پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۱۰۷ مقاله منتشر شده

کاهش خطای طراحی مولکولی به ۰.۰۰۰۳ الکترون-ولت با بازخورد استدلالی LLM

کاهش خطای طراحی مولکولی به ۰.۰۰۰۳ الکترون-ولت با بازخورد استدلالی LLM

پژوهشگران چارچوبی برای مدل‌های زبانی ابداع کرده‌اند که به جای امتیازدهی ساده، از منطق فیزیکوشیمیایی برای طراحی مولکول‌ها استفاده می‌کند. این روش در وظایف متوسط به موفقیت ۱۰۰ درصدی…

۱ دقیقه خواندن
Reasoning Arena: غلبه بر مشکل پاداش‌های تخت در آموزش مدل‌های استدلالی

Reasoning Arena: غلبه بر مشکل پاداش‌های تخت در آموزش مدل‌های استدلالی

چارچوب Reasoning Arena با جایگزینی سیگنال‌های باینری با تورنمنتهای مقایسه‌ای، دقت مدل‌ها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

۲ دقیقه خواندن
PhysScene: گذار از بازشناسی بصری به استدلال رابطه‌ای در آزمایشگاه‌های فیزیک

PhysScene: گذار از بازشناسی بصری به استدلال رابطه‌ای در آزمایشگاه‌های فیزیک

پژوهشگران مجموعه داده PhysScene را معرفی کردند؛ نخستین گراف صحنه تخصصی برای محیط‌های آزمایشگاهی فیزیک. هدف این پروژه تغییر تمرکز مدل‌ها از روابط مکانی ساده به وابستگی‌های عملکردی…

۱ دقیقه خواندن
PyGeoX: افزایش ۲.۳ برابری دقت حل مسائل هندسی با سیستم پاداش SAR

PyGeoX: افزایش ۲.۳ برابری دقت حل مسائل هندسی با سیستم پاداش SAR

پژوهشگران با معرفی PyGeoX و مکانیزم پاداش SAR، نرخ موفقیت مدل‌های زبانی در حل مسائل پیچیده هندسی را ۲.۳ برابر کردند. این روش با جلوگیری از «پوشش گرادیان‌های پرت»، مانع از توهم مدل…

۱ دقیقه خواندن
دقت ۹۶ درصدی مدل‌های زبانی در مبنی‌سازی اشیاء سه‌بعدی بدون نیاز به آموزش

دقت ۹۶ درصدی مدل‌های زبانی در مبنی‌سازی اشیاء سه‌بعدی بدون نیاز به آموزش

مدل‌های زبانی بزرگ اکنون می‌توانند بدون هیچ آموزشی، اشیاء محیط‌های سه‌بعدی را با دقت ۹۶ درصد به کلاس‌های هستی‌شناسی متصل کنند. این روش با بهره‌گیری از نشانه‌های معنایی در گراف…

۱ دقیقه خواندن
INFUSER: جایگزینی «سختی مسئله» با «امتیاز تأثیر» در آموزش مدل‌ها

INFUSER: جایگزینی «سختی مسئله» با «امتیاز تأثیر» در آموزش مدل‌ها

چارچوب جدیدی به نام INFUSER با تغییر رویکرد از داده‌های «سخت» به داده‌های «مؤثر»، مدل‌های هوش مصنوعی را قادر می‌سازد تا برنامه آموزشی خود را به‌طور پویا تکامل دهند. این متد باعث…

۲ دقیقه خواندن
چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

یک مطالعه فنی روی مدل‌های بینایی-زبانی نشان می‌دهد که انتخاب بین SFT و OPD در مرحله گرم‌بندی، تنها بر رژیم آنتروپی اولیه اثر می‌گذارد و تأثیری بر عملکرد نهایی یادگیری تقویت‌شده…

۲ دقیقه خواندن
چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چارچوب SafeRun با جداسازی تفسیر زبان طبیعی از اجرای محدودیت‌های سخت، ایمنی کامل در برنامه‌ریزی‌های ورزشی را تضمین می‌کند. این متد در بنچمارک‌های جدید، عملکرد مهندسی پرامپت و…

۱ دقیقه خواندن
TRIAGE: کاهش ۸۱ درصدی خطای کالیبراسیون در تشخیص ریسک‌های پزشکی

TRIAGE: کاهش ۸۱ درصدی خطای کالیبراسیون در تشخیص ریسک‌های پزشکی

چارچوب TRIAGE با جایگزینی پیش‌بینی‌های باینری و بیش‌ازحد مطمئن با امتیازات ریسک پیوسته، خطای کالیبراسیون در مدل‌های زبانی بزرگ پزشکی را ۸۱٪ کاهش داده است. این رویکرد از طریق…

۱ دقیقه خواندن