پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۶۷۷ مقاله منتشر شده

دقت ۹۶ درصدی مدل‌های زبانی در مبنی‌سازی اشیاء سه‌بعدی بدون نیاز به آموزش

دقت ۹۶ درصدی مدل‌های زبانی در مبنی‌سازی اشیاء سه‌بعدی بدون نیاز به آموزش

مدل‌های زبانی بزرگ اکنون می‌توانند بدون هیچ آموزشی، اشیاء محیط‌های سه‌بعدی را با دقت ۹۶ درصد به کلاس‌های هستی‌شناسی متصل کنند. این روش با بهره‌گیری از نشانه‌های معنایی در گراف…

۱ دقیقه خواندن
INFUSER: جایگزینی «سختی مسئله» با «امتیاز تأثیر» در آموزش مدل‌ها

INFUSER: جایگزینی «سختی مسئله» با «امتیاز تأثیر» در آموزش مدل‌ها

چارچوب جدیدی به نام INFUSER با تغییر رویکرد از داده‌های «سخت» به داده‌های «مؤثر»، مدل‌های هوش مصنوعی را قادر می‌سازد تا برنامه آموزشی خود را به‌طور پویا تکامل دهند. این متد باعث…

۲ دقیقه خواندن
چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

یک مطالعه فنی روی مدل‌های بینایی-زبانی نشان می‌دهد که انتخاب بین SFT و OPD در مرحله گرم‌بندی، تنها بر رژیم آنتروپی اولیه اثر می‌گذارد و تأثیری بر عملکرد نهایی یادگیری تقویت‌شده…

۲ دقیقه خواندن۲
چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چارچوب SafeRun با جداسازی تفسیر زبان طبیعی از اجرای محدودیت‌های سخت، ایمنی کامل در برنامه‌ریزی‌های ورزشی را تضمین می‌کند. این متد در بنچمارک‌های جدید، عملکرد مهندسی پرامپت و…

۱ دقیقه خواندن
TRIAGE: کاهش ۸۱ درصدی خطای کالیبراسیون در تشخیص ریسک‌های پزشکی

TRIAGE: کاهش ۸۱ درصدی خطای کالیبراسیون در تشخیص ریسک‌های پزشکی

چارچوب TRIAGE با جایگزینی پیش‌بینی‌های باینری و بیش‌ازحد مطمئن با امتیازات ریسک پیوسته، خطای کالیبراسیون در مدل‌های زبانی بزرگ پزشکی را ۸۱٪ کاهش داده است. این رویکرد از طریق…

۱ دقیقه خواندن
سنجش مدل‌های جهانی در ثانیه‌ها: سازوکار ATM برای حذف شبیه‌سازی‌های زمان‌بر

سنجش مدل‌های جهانی در ثانیه‌ها: سازوکار ATM برای حذف شبیه‌سازی‌های زمان‌بر

پژوهشگران ابزاری به نام ATM را معرفی کرده‌اند که ارزیابی مدل‌های جهانی نهفته را به جای اجرای کند شبیه‌سازها، با پروب‌های سبک انجام می‌دهد. این متد با شناسایی سریع شکست‌های…

۱ دقیقه خواندن
«حلقهٔ هکر-اصلاح‌گر»: متدی برای حذف تقلب در بنچمارک‌های عامل‌محور

«حلقهٔ هکر-اصلاح‌گر»: متدی برای حذف تقلب در بنچمارک‌های عامل‌محور

پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاح‌گر»، نرخ موفقیت حملات پاداش‌جویانه در بنچمارک‌های هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…

۲ دقیقه خواندن
PACT: عبور از بن‌بست تداخل استدلالی در مدل‌های پزشکی با اجماع شاخه‌ای

PACT: عبور از بن‌بست تداخل استدلالی در مدل‌های پزشکی با اجماع شاخه‌ای

چارچوب آموزشی جدیدی به نام PACT با تفکیک پارادایم‌های استدلالی به شاخه‌های مجزای LoRA، دقت مدل‌های زبانی در تشخیص پزشکی را بهبود بخشیده است. این سیستم از طریق تجمیع شاخه‌ها بر…

۱ دقیقه خواندن۱
چرا دقت در بازیابی متون دیگر معیار موفقیت در جستجوهای علمی نیست؟

چرا دقت در بازیابی متون دیگر معیار موفقیت در جستجوهای علمی نیست؟

کارگاه CHIIR ۲۰۲۶ گذار از بازیابی سنتی اسناد به «سنتز زاینده» در پژوهش‌های دانشگاهی را ترسیم می‌کند. این چارچوب بر طراحی انسان‌محور با تمرکز بر شفافیت و یکپارچگی پژوهشی تأکید دارد.

۲ دقیقه خواندن
چرا بازیابی دقیق متون در RAG برای رعایت قوانین حقوقی کافی نیست؟

چرا بازیابی دقیق متون در RAG برای رعایت قوانین حقوقی کافی نیست؟

پژوهشگران پدیده «حذف خاموش دامنه» (SSO) را شناسایی کرده‌اند؛ اختلالی که در آن مدل‌های زبانی قوانین کلی را می‌پذیرند اما استثنائات تودرتو را نادیده می‌گیرند. راهکار پیشنهادی،…

۲ دقیقه خواندن۱
چرا تنظیم دقیق تک‌مرحله‌ای برای بازرسی تراشه‌ها کافی نیست؟

چرا تنظیم دقیق تک‌مرحله‌ای برای بازرسی تراشه‌ها کافی نیست؟

پژوهشگران یک چارچوب بینایی-زبانی دو-مرحله‌ای طراحی کرده‌اند که قادر است خطاهای خود را در تشخیص نقص‌های لیتوگرافی شناسایی و اصلاح کند. این سیستم با آموزش یک ماژول پالایش روی…

۱ دقیقه خواندن