پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۰۷ مقاله منتشر شده

سنجش مدل‌های جهانی در ثانیه‌ها: سازوکار ATM برای حذف شبیه‌سازی‌های زمان‌بر

سنجش مدل‌های جهانی در ثانیه‌ها: سازوکار ATM برای حذف شبیه‌سازی‌های زمان‌بر

پژوهشگران ابزاری به نام ATM را معرفی کرده‌اند که ارزیابی مدل‌های جهانی نهفته را به جای اجرای کند شبیه‌سازها، با پروب‌های سبک انجام می‌دهد. این متد با شناسایی سریع شکست‌های…

۱ دقیقه خواندن
«حلقهٔ هکر-اصلاح‌گر»: متدی برای حذف تقلب در بنچمارک‌های عامل‌محور

«حلقهٔ هکر-اصلاح‌گر»: متدی برای حذف تقلب در بنچمارک‌های عامل‌محور

پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاح‌گر»، نرخ موفقیت حملات پاداش‌جویانه در بنچمارک‌های هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…

۲ دقیقه خواندن
PACT: عبور از بن‌بست تداخل استدلالی در مدل‌های پزشکی با اجماع شاخه‌ای

PACT: عبور از بن‌بست تداخل استدلالی در مدل‌های پزشکی با اجماع شاخه‌ای

چارچوب آموزشی جدیدی به نام PACT با تفکیک پارادایم‌های استدلالی به شاخه‌های مجزای LoRA، دقت مدل‌های زبانی در تشخیص پزشکی را بهبود بخشیده است. این سیستم از طریق تجمیع شاخه‌ها بر…

۱ دقیقه خواندن
چرا دقت در بازیابی متون دیگر معیار موفقیت در جستجوهای علمی نیست؟

چرا دقت در بازیابی متون دیگر معیار موفقیت در جستجوهای علمی نیست؟

کارگاه CHIIR ۲۰۲۶ گذار از بازیابی سنتی اسناد به «سنتز زاینده» در پژوهش‌های دانشگاهی را ترسیم می‌کند. این چارچوب بر طراحی انسان‌محور با تمرکز بر شفافیت و یکپارچگی پژوهشی تأکید دارد.

۲ دقیقه خواندن
چرا بازیابی دقیق متون در RAG برای رعایت قوانین حقوقی کافی نیست؟

چرا بازیابی دقیق متون در RAG برای رعایت قوانین حقوقی کافی نیست؟

پژوهشگران پدیده «حذف خاموش دامنه» (SSO) را شناسایی کرده‌اند؛ اختلالی که در آن مدل‌های زبانی قوانین کلی را می‌پذیرند اما استثنائات تودرتو را نادیده می‌گیرند. راهکار پیشنهادی،…

۲ دقیقه خواندن
چرا تنظیم دقیق تک‌مرحله‌ای برای بازرسی تراشه‌ها کافی نیست؟

چرا تنظیم دقیق تک‌مرحله‌ای برای بازرسی تراشه‌ها کافی نیست؟

پژوهشگران یک چارچوب بینایی-زبانی دو-مرحله‌ای طراحی کرده‌اند که قادر است خطاهای خود را در تشخیص نقص‌های لیتوگرافی شناسایی و اصلاح کند. این سیستم با آموزش یک ماژول پالایش روی…

۱ دقیقه خواندن
سازوکار BODHI: افزایش ۲.۳ برابری تفکیک مفاهیم در مدل‌های رفتاری زیست‌پزشکی

سازوکار BODHI: افزایش ۲.۳ برابری تفکیک مفاهیم در مدل‌های رفتاری زیست‌پزشکی

روش جدیدی به نام BODHI با استخراج «منفی‌های سخت» از گراف‌های دانش، رانش معنایی در رمزگذارهای زیست‌پزشکی را اصلاح می‌کند. این متد علاوه بر بهبود تفکیک مفاهیم، تأخیر استنتاج را روی…

۲ دقیقه خواندن
چرا مدل‌های یکپارچه در MRI شکست می‌خورند و SpineAgent به ۳۷ عامل نیاز دارد؟

چرا مدل‌های یکپارچه در MRI شکست می‌خورند و SpineAgent به ۳۷ عامل نیاز دارد؟

پژوهشگران با معرفی SpineAgent، سیستمی عامل‌محور ساخته‌اند که گزارش‌های پیچیده MRI ستون فقرات را از طریق هماهنگی ۳۷ عامل تخصصی تولید می‌کند. این مدل با آموزش روی ۱۳ میلیون برش…

۲ دقیقه خواندن
کاهش ۳۶ برابری زمان تنظیم شبیه‌سازهای علمی با لایه‌های مبنی‌سازی SIGA

کاهش ۳۶ برابری زمان تنظیم شبیه‌سازهای علمی با لایه‌های مبنی‌سازی SIGA

آداپتور جدیدی به نام SIGA با ایجاد یک لایه‌ی «مبنی‌سازی» از قواعد و حافظه، امکان تعامل عامل‌های کدنویسی با شبیه‌سازهای پیچیده علمی را فراهم می‌کند. این سیستم در آزمایش‌های مربوط…

۲ دقیقه خواندن
گزارش arXiv: بازگشت ۲۴ درصدی خطاهای اصلاح‌شده در خروجی‌های عامل‌های پژوهشی

گزارش arXiv: بازگشت ۲۴ درصدی خطاهای اصلاح‌شده در خروجی‌های عامل‌های پژوهشی

یک مطالعه جدید نشان می‌دهد که بازخوردهای هدفمند کیفیت گزارش‌های عامل‌های پژوهش عمیق را افزایش می‌دهد، اما این پیشرفت در دوره‌های تکرار متوالی پایداری ندارد. این عامل‌ها هنگام رفع…

۱ دقیقه خواندن
سازوکار PRIME: شناسایی نشانه‌های پنهان تقلب در پاداش پیش از وقوع شکست

سازوکار PRIME: شناسایی نشانه‌های پنهان تقلب در پاداش پیش از وقوع شکست

پژوهشگران پیش‌زمینه جدیدی به نام PRIME را شناسایی کرده‌اند که امکان پیش‌بینی تقلب در پاداش (Reward Hacking) را پیش از بروز شکست عملی فراهم می‌کند. این یافته، رویکرد همراستاسازی…

۱ دقیقه خواندن