
گزارش arXiv: ارتقای نرخ حل مسائل SWE-bench به ۳۲.۲٪ با روش SRFT
روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…

چارچوب MAGE با معرفی گرافهای دانش تکاملی، به عاملهای هوش مصنوعی اجازه میدهد بدون تغییر در وزنهای مدل، از شکستها و موفقیتهای خود بیاموزند. این سیستم در ۹ بنچمارک مختلف، از…

پژوهشگران چارچوب GW-Eyes را معرفی کردند؛ سیستمی عاملمحور که با استفاده از مدلهای زبانی بزرگ، پیوند میان امواج گرانشی و همتایهای الکترومغناطیسی آنها را خودکار میکند. این…

چارچوب جدیدی به نام Metis با استفاده از یک حلقه فراشناختی تکاملی، توانسته است با نرخ موفقیت ۸۹.۲ درصد از سدهای امنیتی مدلهای پیشرو عبور کند. این سیستم بهطور ویژه مدلهای GPT-5 و…

مدل CoWorld-VLA با معرفی توکنهای تخصصی برای دادههای هندسی و پویا، استدلال سطح بالا را به عمل دقیق در رانندگی خودکار متصل میکند. این چارچوب در بنچمارک NAVSIM v1 دقت مسیر و ایمنی…

یک مطالعه در مه ۲۰۲۶ نشان میدهد که مدلهای زبانی پیشرو همچنان برتری مطلق خود را در پاسخگویی به پرسشهای مجموعهدادهها حفظ کردهاند. مدلهای کوچک و بهینه، بهویژه در تبدیل زبان…

عامل AnomalyClaw با جایگزینی استنتاج تکمرحلهای با یک فرآیند ردّیه چندمرحلهای، دقت تشخیص ناهنجاریهای بصری را بهطور چشمگیری افزایش میدهد. این ابزار بدون نیاز به آموزش مجدد،…

چارچوب جدید SCALAR با ترکیب مدلهای زبانی و استدلال نمادین، شناسایی الگوهای پیچیده در مدارات کوانتومی را خودکار میکند. این سیستم که بر بستر CUDA-Q توسعه یافته، قادر است تا ۷۷…

پژوهشی جدید نشان میدهد توکنهای بافت نهفته پیوسته به مدلهای کوچک اجازه میدهند الگوریتمهای یادگیری آنلاین را بهینهتر از مدلهای زبانی بزرگ اجرا کنند. یک مدل با معماری GPT-2 با…

مدل DeepRefine با استفاده از یادگیری تقویتشده، نقصها و افزونگیهای پایگاه دانش در عاملهای هوش مصنوعی را شناسایی و اصلاح میکند. این مدل با معرفی پاداش GBD، نیاز به دادههای…

پلتفرم Shepherd با معرفی زیرساختی مبتنی بر برنامهنویسی تابعی، تعاملات عاملها را به عنوان رویدادهای کنترلشده مدیریت میکند. این رویکرد سرعت بازتولید وضعیتها را ۵ برابر بیشتر از…

بنچمارک جدید BenchCAD نشان میدهد مدلهای پیشرو در عین توانایی در تقلید بصری، در تولید کدهای پارامتریک دقیق برای تولید صنعتی شکست میخورند. این مطالعه شکاف عمیق میان استدلال فضایی…