
سازوکار RACER: بهینهسازی هزینه داوران LLM از طریق مسیریابی مقاوم
مدلهای استدلالی در ارزیابیهای ساده، قدرت محاسباتی را هدر میدهند. چارچوب RACER با مسیریابی پویا، وظایف را به مقرونبهصرفهترین داور میسپارد و دقت را حتی در صورت تغییر توزیع…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۰۹۸ مقاله منتشر شده

مدلهای استدلالی در ارزیابیهای ساده، قدرت محاسباتی را هدر میدهند. چارچوب RACER با مسیریابی پویا، وظایف را به مقرونبهصرفهترین داور میسپارد و دقت را حتی در صورت تغییر توزیع…

بنچمارک جدید ComplexMCP نشان میدهد برترین عاملهای هوش مصنوعی در محیطهای ابزاری پیچیده تنها ۶۰ درصد موفقیت دارند، در حالی که این رقم برای انسانها ۹۰ درصد است. این مطالعه…

چارچوب جدیدی به نام Agent Cybernetics پیشنهاد میکند که به جای آزمون و خطاهای تجربی، از تئوری کنترل کلاسیک برای طراحی عاملهای هوش مصنوعی استفاده کند. هدف این رویکرد، تضمین…

پژوهشگران با معرفی GESR، جهشهای تصادفی در رگرسیون نمادین را با «ویرایش ژنی» هدایتشده توسط مدلهای BERT جایگزین کردهاند. این رویکرد کارایی محاسباتی و دقت کشف قوانین ریاضی از…

متد جدیدی به نام TRACE با هدفگیری توکنهای حیاتی در فرآیند تقطیر، نرخ خطای مدلهای استدلالی را کاهش داد. این رویکرد برخلاف روشهای متراکم، از نشت اطلاعات ممتاز جلوگیری کرده و…

یک چارچوب تکاملی جدید با استفاده از سیاستهای بهینهسازیشده به عنوان «معلم»، الگوریتمهای اکتشافی (Heuristics) سریع و اجرایی میسازد. این سیستم نیاز به استنتاج عصبی در زمان اجرا…

پژوهشگران دریافتند که مدلهای زبانی بهجای پیشرفت یکنواخت، «ناهمواری» (Jaggedness) در توانمندیهای خود دارند. با ترکیب این نقاط قوت پراکنده در مجموعههای فرا-مدلی، میتوان…

پژوهشگران چارچوب جدیدی به نام استنتاج علّی سلسلهمراتبی (HCA) معرفی کردهاند که تصمیمات مبهم سیستمهای کنترل پیشبین را قابلتفسیر میکند. این روش با ترکیب فیزیک و دادههای…

چارچوب جدیدی به نام Deep Arguing با ادغام یادگیری عمیق و منطق استدلالی، پیشبینیهای هوش مصنوعی را تفسیرپذیر میکند. این مدل بدون کاهش دقت، دادهها را به عنوان استدلالهایی برای…

پژوهشگران با ترکیب استخراج استدلال و گرافهای دانش، سیستمی برای کاهش توهمات مدلهای زبانی در روایتهای سلامت سالمندان طراحی کردهاند. این معماری بازتابی تضمین میکند که داستانهای…

یک چارچوب آماری جدید، ارزیابی عاملهای هوش مصنوعی را از نرخهای سادهی موفقیت/شکست به سنجش ثبات در سطح مسیر تغییر میدهد. این متد به توسعهدهندگان اجازه میدهد تفاوت میان دانش مدل…

روش جدیدی به نام Slash نشان میدهد که مدلهای زبانی بزرگ درک ساختاری گرافها را در وزنهای خود دارند، اما «چاههای توجه» مانع دسترسی به آن میشوند. این متد بدون نیاز به آموزش…