پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۸۷ مقاله منتشر شده

بیش از «گام‌به‌گام فکر کن»: ساختار استدلال برای واداشتن هوش مصنوعی به تفکر واقعی
آموزش کاربردی

رویکرد Scaffolds: جایگزینی الگوهای آماری با چرخهٔ چهارگانهٔ استدلال

روش جدیدی به نام داربست استدلالی با جایگزینی دستورات مبهم «گام‌به‌گام فکر کن»، مدل‌ها را مجبور به طی یک چرخه سخت‌گیرانه از مشاهده، فرضیه، تست و نتیجه‌گیری می‌کند. این رویکرد با…

۱۵ دقیقه خواندن۲
گروک ۴.۵، جی‌پی‌تی ۵.۵ و کلود در حال ساخت یک اپلیکیشن مشابه
آموزش کاربردی

Grok 4.5 سرعت استنتاج را دوبرابر کرد اما در کدنویسی سه‌بعدی شکست خورد

مقایسه‌ی عملکرد مدل‌های جدید نشان می‌دهد Grok 4.5 سریع‌ترین و ارزان‌ترین گزینه است، اما خانواده Claude همچنان در اجرای کدهای پیچیده و سه‌بعدی پیشتاز است. این آزمون بدون هیچ‌گونه…

۵ دقیقه خواندن
شرط ۲.۳ میلیارد دلاری جنرال اینتویشن: بازی‌های ویدیویی می‌توانند عامل‌های هوش مصنوعی را برای دنیای واقعی آموزش دهند.

آموزش ربات‌ها با داده‌های بازی‌های ویدئویی؛ کاهش زمان یادگیری به ۸ دقیقه

استارتاپ General Intuition با استفاده از میلیون‌ها ساعت داده‌های بازی‌های ویدئویی، مدلی بنیادی برای هوش مصنوعی فیزیکی ساخته است. این روش اجازه می‌دهد ربات‌ها حرکات پیچیده را با…

۳ دقیقه خواندن
فرآیندهای تست عاملی، معیارهای LLM و یادداشت‌هایی درباره کدنویسی عاملی از جزایر گالاپاگوس

تست‌های تصادفی در برابر بازبینی انسانی در مقیاس‌پذیری کدنویسی هوش مصنوعی

دن لو، مهندس ارشد نرم‌افزار، استدلال می‌کند که جریان‌های کاری کدنویسی با هوش مصنوعی به‌دلیل اتکا به بازبینی انسانی به‌جای تست‌های تصادفی، به‌سرعت دچار افت کیفیت می‌شوند. او…

۷۱ دقیقه خواندن
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»

درون مکانیسم رد درخواست‌های پیچیده در مدل Fable آنتروپیک

یک پژوهشگر ارشد گزارش داده است که مدل Fable متعلق به آنتروپیک به‌دلیل کالیبراسیون بیش‌ازحد لایه‌های ایمنی، درخواست‌های تخصصی در علوم کامپیوتر و بیوانفورماتیک را به‌اشتباه رد…

۱۱ دقیقه خواندن
لوگوی Grok 4.5 با طراحی مدرن و رنگ‌های آبی-بنفش روی پس‌زمینه تیره.

چگونه Grok 4.5 با افزایش بهره‌وری، هزینه‌های عملیاتی را پایین آورد؟

شرکت SpaceXAI مدل Grok 4.5 را برای بهینه‌سازی کدنویسی و کارهای اداری پیچیده عرضه کرد. این مدل با سرعت استنتاج بالا و قیمت به‌مراتب کمتر از رقبا، تمرکز را از اندازه مدل به بهره‌وری…

۳ دقیقه خواندن
آمازون در حال توسعه دستیار الکسای قدرتمندتر با قابلیت عامل‌محوری است
اخبار کوتاه روزانهگزارش تأییدنشده

«عملکرد ناپایدار»؛ چالش اصلی آمازون در مسیر توسعه الکسای عامل‌محور

آمازون در حال توسعه پروژه Moonraker است تا الکسا را از یک ابزار صوتی ساده به یک عامل چندمرحله‌ای تبدیل کند. هزینه‌های نجومی پردازش و عملکرد ناپایدار در نسخه‌های اولیه، باعث ایجاد…

۲ دقیقه خواندن
داده‌ها برای عامل‌های هوشمند: مجموعه‌ای از اطلاعات برای توسعه و آموزش سیستم‌های عاملی.
آموزش کاربردی

انویدیا: داده‌های سنتتیک تنها راه مقیاس‌پذیری عامل‌های هوشمند است

انویدیا معتقد است وزن‌های باز به تنهایی برای ساخت عامل‌های هوشمند کافی نیستند و توسعه‌دهندگان برای پیش‌بینی‌پذیر کردن رفتار عامل‌ها به مجموعه‌داده‌های باز و سنتتیک نیاز دارند. این…

۵ دقیقه خواندن
سه عامل هوشمند روی صحنه مناظره: ساخت گردش‌کار قابل تأیید با Agno و Shepherd
آموزش کاربردی

ترکیب Agno و Shepherd امکان بازگشت به عقب در گردش‌های کاری عامل‌ها را فراهم کرد

یک ادغام جدید، ارکستراسیون چندعاملی Agno را با ردپاهای اجرای پایدار Shepherd ترکیب می‌کند. این ابزار به توسعه‌دهندگان اجازه می‌دهد به‌جای شروع مجدد کل فرآیند، اقدامات عامل‌ها را…

۵ دقیقه خواندن۱
اتصال عامل‌های واقعی به Halo: از هماهنگ‌کننده ساده به خط لوله تست نفوذ چندعاملی کارا
آموزش کاربردی

درون سامانه چندعاملی Halo برای شناسایی دقیق آسیب‌پذیری‌ها

پروژه Halo از مدل‌های شبیه‌ساز فاصله گرفت و یک سامانه چندعاملی برای تست نفوذ ایجاد کرد که بر اساس شواهد واقعی عمل می‌کند. این سیستم با استفاده از مسیریاب‌های تخصصی، توهمات مدل‌های…

۳ دقیقه خواندن
تصویر: نمونه‌ای از خروجی مقاله که در آن نشانگرهای تفکر یا توکن‌های ویژه در متن نهایی ظاهر شده‌اند.
آموزش کاربردی

مقایسه‌ی مدل‌های چینی؛ DeepSeek و Qwen هزینه‌ی استنتاج را به کف رساندند

بررسی چهار خانواده مدل برتر چینی نشان می‌دهد که این مدل‌ها اکنون با قیمت‌هایی بسیار پایین‌تر و عملکردی رقابتی در برابر غول‌های غربی قرار دارند. تحلیل‌ها DeepSeek را برای کدنویسی…

۸ دقیقه خواندن۱