
بهینهسازی پایش آنفلوانزا از طریق استنتاج گزینشی متغیرهای پنهان (BSLI)
چارچوب BSLI پایش فاضلاب شهری را از یک جریان دادهی غیرفعال به یک سامانهی تصمیمساز فعال تبدیل میکند. این سیستم با تعیین زمان دقیق نیاز به دادههای تکمیلی، توازن میان هزینهی…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۷۶ مقاله منتشر شده

چارچوب BSLI پایش فاضلاب شهری را از یک جریان دادهی غیرفعال به یک سامانهی تصمیمساز فعال تبدیل میکند. این سیستم با تعیین زمان دقیق نیاز به دادههای تکمیلی، توازن میان هزینهی…

بنچمارک جدید TheoremBench نشان میدهد که مدلهای زبانی با وجود موفقیت در مسائل مجزا، در مدیریت براهین پیچیده و وابسته به یکدیگر شکست میخورند. این مدلها به جای استدلال ساختاری،…

یک چارچوب آموزشی جدید با بهرهگیری از تقطیر دانش و بهینهسازی GRPO، مدلی با ۳۲ میلیارد پارامتر را به سطح مدلهای تجاری پیشرو در اتوماسیون کنسولهای ابری رسانده است. این سیستم ضمن…

عامل جدید SuperBrowser با دستیابی به نرخ موفقیت ۸۹.۴۷ درصدی در بنچمارک Mind2Web Hard، استانداردهای ناوبری وب را جابهجا کرد. این سیستم به جای پردازش جامع دادههای صفحه، از مکانیزم…

بنچمارک جدید WeaveBench نشان میدهد که مدلهای پیشرو در وظایف ترکیبی GUI و CLI تنها به نرخ موفقیت ۴۱.۲ درصدی رسیدهاند. این نتایج فاش میکند که عاملها در مدیریت گردشکارهای…

پژوهشی جدید نشان میدهد اجبار مدلهای زبانی متوسط به تولید خروجی ساختاریافته (JSON)، دقت استدلالی آنها را تا ۲۸ درصد کاهش میدهد. این پدیده که «مالیات استدلال» نامیده شده، نشان…

پژوهشی جدید نشان میدهد رتبهبندیهای Elo در مدلهای زبانی با دقت واقعی (Ground-Truth) همبستگی شدیدی دارند. این یافتهها ثابت میکند که اگرچه سوگیریهای استایلی وجود دارند، اما…

رویکرد جدیدی به نام CAHL از طریق یادگیری تقویتشده با پاداشهای قابل تأیید، برنامهریز و اجراکننده مدلهای زبانی را بهطور مشترک بهینه میکند. این روش همراستاسازی ساختاری را که…

روش جدید PCI با جایگزینی بازبینیهای مبتنی بر گرادیان با تصویرسازیهای ساختاری، زمان استنتاج را در مسائل TSP تا ۴۰ درصد کاهش میدهد. این متد بدون نیاز به بازآموزی، شکاف بهینگی را…

بنچمارک جدید IMUG-Bench نشان میدهد مدلهای چندوجهی یکپارچه در حفظ سازگاری طی گفتگوهای طولانی با تصاویر شکست میخورند. این پژوهش ثابت میکند «سوگیری مواجهه» عامل اصلی خطاهاست و…

مدلهای زبانی معمولاً در تولید ایدههای پژوهشی به دلیل اتکای به متنهای «تخت» شکست میخورند. Graph2Idea با تبدیل ادبیات علمی به گرافهای دانش، نرخ نوآوری و امکانپذیری ایدههای…

معماری FF-JEPA با معرفی یک رویکرد سلسلهمراتبی، مشکل فروپاشی مدلهای جهان در برنامهریزیهای بلندمدت را حل کرده است. این مدل با استفاده از یک برنامهریز نهان برای تعیین زیرهدفها،…