
سنجش مدلهای جهانی در ثانیهها: سازوکار ATM برای حذف شبیهسازیهای زمانبر
پژوهشگران ابزاری به نام ATM را معرفی کردهاند که ارزیابی مدلهای جهانی نهفته را به جای اجرای کند شبیهسازها، با پروبهای سبک انجام میدهد. این متد با شناسایی سریع شکستهای…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۱۰۷ مقاله منتشر شده

پژوهشگران ابزاری به نام ATM را معرفی کردهاند که ارزیابی مدلهای جهانی نهفته را به جای اجرای کند شبیهسازها، با پروبهای سبک انجام میدهد. این متد با شناسایی سریع شکستهای…

پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاحگر»، نرخ موفقیت حملات پاداشجویانه در بنچمارکهای هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…

چارچوب آموزشی جدیدی به نام PACT با تفکیک پارادایمهای استدلالی به شاخههای مجزای LoRA، دقت مدلهای زبانی در تشخیص پزشکی را بهبود بخشیده است. این سیستم از طریق تجمیع شاخهها بر…

کارگاه CHIIR ۲۰۲۶ گذار از بازیابی سنتی اسناد به «سنتز زاینده» در پژوهشهای دانشگاهی را ترسیم میکند. این چارچوب بر طراحی انسانمحور با تمرکز بر شفافیت و یکپارچگی پژوهشی تأکید دارد.

پژوهشگران پدیده «حذف خاموش دامنه» (SSO) را شناسایی کردهاند؛ اختلالی که در آن مدلهای زبانی قوانین کلی را میپذیرند اما استثنائات تودرتو را نادیده میگیرند. راهکار پیشنهادی،…

پژوهشگران یک چارچوب بینایی-زبانی دو-مرحلهای طراحی کردهاند که قادر است خطاهای خود را در تشخیص نقصهای لیتوگرافی شناسایی و اصلاح کند. این سیستم با آموزش یک ماژول پالایش روی…

روش جدیدی به نام BODHI با استخراج «منفیهای سخت» از گرافهای دانش، رانش معنایی در رمزگذارهای زیستپزشکی را اصلاح میکند. این متد علاوه بر بهبود تفکیک مفاهیم، تأخیر استنتاج را روی…

پژوهشگران با معرفی SpineAgent، سیستمی عاملمحور ساختهاند که گزارشهای پیچیده MRI ستون فقرات را از طریق هماهنگی ۳۷ عامل تخصصی تولید میکند. این مدل با آموزش روی ۱۳ میلیون برش…

آداپتور جدیدی به نام SIGA با ایجاد یک لایهی «مبنیسازی» از قواعد و حافظه، امکان تعامل عاملهای کدنویسی با شبیهسازهای پیچیده علمی را فراهم میکند. این سیستم در آزمایشهای مربوط…

یک مطالعه جدید نشان میدهد که بازخوردهای هدفمند کیفیت گزارشهای عاملهای پژوهش عمیق را افزایش میدهد، اما این پیشرفت در دورههای تکرار متوالی پایداری ندارد. این عاملها هنگام رفع…

مدل با وزنهای باز SearchSwarm-30B با درونیسازی «هوش تفویض» در وزنهای خود، محدودیت پنجره متنی را در وظایف پژوهشی پیچیده برطرف کرده است. این مدل قادر است اهداف کلان را به…

پژوهشگران پیشزمینه جدیدی به نام PRIME را شناسایی کردهاند که امکان پیشبینی تقلب در پاداش (Reward Hacking) را پیش از بروز شکست عملی فراهم میکند. این یافته، رویکرد همراستاسازی…