
«واکنش به تغییرات محیطی»؛ راهکار ctxloom برای افزایش ردیابی پاسخها
پلتفرم متنباز ctxloom با حذف گرافهای اجرای پیشفرض، رویکردی مبتنی بر حالت (State-driven) را برای مدیریت عاملهای هوش مصنوعی معرفی کرده است. در این سیستم، عاملها بهجای دنبال…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۷ مقاله منتشر شده

پلتفرم متنباز ctxloom با حذف گرافهای اجرای پیشفرض، رویکردی مبتنی بر حالت (State-driven) را برای مدیریت عاملهای هوش مصنوعی معرفی کرده است. در این سیستم، عاملها بهجای دنبال…

عاملهای هوش مصنوعی با ترکیب استدلال و توانایی تعامل با محیط، مدلهای زبانی را از چتباتهای ساده به سامانههایی تبدیل میکنند که قادر به اجرای مستقل گردشهای کاری پیچیده هستند.

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنالهای متناقض در ارزیابیهای مدلهای زبانی معرفی کردند. این ابزار نشان میدهد بسیاری از محکهای «ایمنی» در واقع توان استدلال کلی را…

شرکت You.com حالت استخراج جدیدی به نام Highlights را برای API جستوجوی وب خود عرضه کرد که صحت پاسخها را به ۹۵.۱۷٪ میرساند. این ابزار در مقایسه با راهکارهای داخلی OpenAI و…

بررسی جامع دن لو، پژوهشگر مستقل، نشان میدهد اد زیتورن در تقریباً تمام پیشبینیهای کلیدی خود درباره هوش مصنوعی شکست خورده است. از ادعای توقف پیشرفت مدلها تا پیشبینی سقوط…

آنتروپیک با معرفی مدلهای Fable 5.1 و Mythos 5.1، هزینههای اجرای تسکهای عاملمحور را بهشدت کاهش داد. در حالی که Fable برای عموم در دسترس است، Mythos تنها برای شرکای تحقیقاتی در…

محکهای جدید نشان میدهند عاملهای هوش مصنوعی قادر به شناسایی خطاهای بحرانی در کارهای خود هستند، اما به دلیل نبود ساختار کنترلی، نتیجهٔ معیوب را تحویل میدهند. این شکست نه از…

بسیاری از عاملهای کدنویس هوش مصنوعی به دلیل رویکرد خطی «ایده به کد» در عیبیابی شکست میخورند. برای رفع واقعی باگها، مدل باید ابتدا بتواند خطا را بازتولید کند تا وصلههای…

شرکت Physical Superintelligence (PSI) با جذب ۵۸ میلیون دلار سرمایه، قصد دارد آزمایشگاهی مبتنی بر هوش مصنوعی برای کشف قوانین جدید فیزیک بسازد. پلتفرم این شرکت با نام Emmy، از…

متا نخستین مدل تصویرساز عاملمحور خود به نام Muse Image را برای توسعهدهندگان در دسترس قرار داد. این مدل برخلاف مدلهای سنتی، از معماری برنامهریز-پخشکننده برای جستوجوی وب،…

یک پژوهشگر با آموزش یک مدل ترنسفورمر کوچک از صفر، توانست بدون استفاده از دادههای مصنوعی و با هزینهای ناچیز، به امتیاز ۴۴٪ در آزمون استدلال ARC-AGI-1 دست یابد. این دستاورد فرضیه…

تزریق دادههای بیشتر به پنجرهٔ زمینه لزوماً به پاسخهای بهتر منجر نمیشود و در بسیاری از موارد، کیفیت خروجی را بهدلیل کاهش نسبت سیگنال به نویز تخریب میکند. این محدودیت معماری…