
چرا نمرات «شروع سرد» برای سنجش قابلیت یادگیری عاملهای VLM کافی نیستند؟
پژوهشگران بنچمارک OmniGameArena را برای اندازهگیری نحوه بهبود عاملهای مدل زبانی-دیداری از طریق بازتاب خودکار معرفی کردهاند. برخلاف تابلوهای امتیازات ایستا، این سیستم مسیر…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۸ مقاله منتشر شده

پژوهشگران بنچمارک OmniGameArena را برای اندازهگیری نحوه بهبود عاملهای مدل زبانی-دیداری از طریق بازتاب خودکار معرفی کردهاند. برخلاف تابلوهای امتیازات ایستا، این سیستم مسیر…

پژوهشگران دریافتند که توکنهای بصری در مدلهای چندوجهی پیش از رسیدن به لایههای نهایی اشباع میشوند. چارچوب DPVR-LF با مسیریابی این توکنها به یک شاخه جانبی، عملکرد مدل را با تنها…

محققان مجموعهدادهی ArtiFact را شامل بیش از ۶۵۰ هزار رکورد میراث فرهنگی منتشر کردند. این بنچمارک فاش میکند که سیستمهای فعلی هوش مصنوعی در تشخیص ناهماهنگیهای تاریخی ظریف و…

تحلیلی بر مدلهای بنیادی ویدیو نشان میدهد که V-JEPA در درک قوانین فیزیک شهودی را به مدلهای مبتنی بر انتشار و بازسازی پیشی میبرد. این یافتهها تأیید میکند که هدف پیشآموزش…

چارچوب ReCoVLA با استفاده از مدلهای چندوجهی برای هدایت پاداشها، توانایی رباتها در بازیابی از شکستها را بدون نیاز به بازآموزی سیاست اصلی افزایش میدهد. این روش نرخ موفقیت…

چارچوب Anything2Skill با تبدیل دانش خارجی پراکنده به قراردادهای مهارتی ساختاریافته، شکاف بین «خواندن مستندات» و «اجرای وظیفه» را پر میکند. این رویکرد باعث افزایش نرخ موفقیت…

پژوهشگران ابزاری به نام AGENTSERVESIM را معرفی کردهاند که امکان شبیهسازی دقیق عملکرد سختافزاری عاملهای هوش مصنوعی را روی پردازندههای معمولی (CPU) فراهم میکند. این ابزار با…

پژوهشگران چارچوبی برای مدلهای زبانی ابداع کردهاند که به جای امتیازدهی ساده، از منطق فیزیکوشیمیایی برای طراحی مولکولها استفاده میکند. این روش در وظایف متوسط به موفقیت ۱۰۰ درصدی…

چارچوب Reasoning Arena با جایگزینی سیگنالهای باینری با تورنمنتهای مقایسهای، دقت مدلها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

پژوهشگران مجموعه داده PhysScene را معرفی کردند؛ نخستین گراف صحنه تخصصی برای محیطهای آزمایشگاهی فیزیک. هدف این پروژه تغییر تمرکز مدلها از روابط مکانی ساده به وابستگیهای عملکردی…

پژوهشگران با معرفی PyGeoX و مکانیزم پاداش SAR، نرخ موفقیت مدلهای زبانی در حل مسائل پیچیده هندسی را ۲.۳ برابر کردند. این روش با جلوگیری از «پوشش گرادیانهای پرت»، مانع از توهم مدل…

پژوهشی جدید با معرفی چارچوب SEF-CLGC نشان میدهد که ادغام منطق نمادین در مدلهای زبانی کوچک میتواند سوگیری محتوایی را کاهش دهد. این رویکرد در آزمونهای SemEval-2026 به دقت ۲۷.۸۰…