
واقعیتهای بازار در برابر پیشبینیهای اد زیتورن از سقوط AI
بررسی جامع دن لو، پژوهشگر مستقل، نشان میدهد اد زیتورن در تقریباً تمام پیشبینیهای کلیدی خود درباره هوش مصنوعی شکست خورده است. از ادعای توقف پیشرفت مدلها تا پیشبینی سقوط…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۷ مقاله منتشر شده

بررسی جامع دن لو، پژوهشگر مستقل، نشان میدهد اد زیتورن در تقریباً تمام پیشبینیهای کلیدی خود درباره هوش مصنوعی شکست خورده است. از ادعای توقف پیشرفت مدلها تا پیشبینی سقوط…

آنتروپیک با معرفی مدلهای Fable 5.1 و Mythos 5.1، هزینههای اجرای تسکهای عاملمحور را بهشدت کاهش داد. در حالی که Fable برای عموم در دسترس است، Mythos تنها برای شرکای تحقیقاتی در…

محکهای جدید نشان میدهند عاملهای هوش مصنوعی قادر به شناسایی خطاهای بحرانی در کارهای خود هستند، اما به دلیل نبود ساختار کنترلی، نتیجهٔ معیوب را تحویل میدهند. این شکست نه از…

بسیاری از عاملهای کدنویس هوش مصنوعی به دلیل رویکرد خطی «ایده به کد» در عیبیابی شکست میخورند. برای رفع واقعی باگها، مدل باید ابتدا بتواند خطا را بازتولید کند تا وصلههای…

شرکت Physical Superintelligence (PSI) با جذب ۵۸ میلیون دلار سرمایه، قصد دارد آزمایشگاهی مبتنی بر هوش مصنوعی برای کشف قوانین جدید فیزیک بسازد. پلتفرم این شرکت با نام Emmy، از…

متا نخستین مدل تصویرساز عاملمحور خود به نام Muse Image را برای توسعهدهندگان در دسترس قرار داد. این مدل برخلاف مدلهای سنتی، از معماری برنامهریز-پخشکننده برای جستوجوی وب،…

یک پژوهشگر با آموزش یک مدل ترنسفورمر کوچک از صفر، توانست بدون استفاده از دادههای مصنوعی و با هزینهای ناچیز، به امتیاز ۴۴٪ در آزمون استدلال ARC-AGI-1 دست یابد. این دستاورد فرضیه…

تزریق دادههای بیشتر به پنجرهٔ زمینه لزوماً به پاسخهای بهتر منجر نمیشود و در بسیاری از موارد، کیفیت خروجی را بهدلیل کاهش نسبت سیگنال به نویز تخریب میکند. این محدودیت معماری…

گوگل با معرفی دستور /boost در پلتفرم Antigravity، یک سیستم استدلال سهمرحلهای را برای حل باگهای سخت نرمافزاری عرضه کرد. این ابزار با تفکیک استراتژی از اجرا و استفاده از…

پروژه ACAI چارچوبی جامع برای گذار از پاسخهای متنی ساده به جریانهای کاری خودگردان ارائه داده است. این سیستم با ادغام حافظه، RAG و ثبت ابزارها، محیطی کنترلشده برای مدیریت…

محک جدید LoopArena نشان میدهد شکست عاملهای کدنویس نه از ضعف در تولید کد، بلکه به دلیل نقص در مدیریت زمان اجرا رخ میدهد. تفکیک نقش «کنترلکننده» از «کارگر» میتواند هزینههای…

شرکتهای متا و xAI مدلهای کدنویسی پیشرفته خود را منتشر کردند که بازار را به دو قطب «وزنهای باز» و «ظرفیت متنی عظیم» تقسیم میکند. در حالی که Grok 4.6 کل مخازن کد را در یک…