پرش به محتوای اصلی
پرش به محتوای مقاله

مدل BDH-CQ هزینه استنتاج در محک ARC-AGI را به ۰.۰۰۰۷ دلار رساند

·۱۷ شهریور ۱۴۰۵۴ دقیقه مطالعه
نمودار مقایسه هزینه-دقت BDH-CQ با مدل‌های ARC-AGI پیشین
نمودار مقایسه هزینه-دقت BDH-CQ با مدل‌های ARC-AGI پیشین
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل زنجیره تفکر متنی (CoT) با استدلال در فضای نهان در یک مدل بسیار کوچک (۱۵۰ میلیون پارامتر) که منجر به کاهش شدید هزینه استنتاج بدون افت شدید دقت در تعمیم‌پذیری شد.

تصور کنید سیستمی که بدون نیاز به «بلند فکر کردن» یا نوشتن گام‌های منطقی، مسائل پیچیده را حل کند. مدل BDH-CQ با ثبت نرخ موفقیت ۲۹.۵ درصدی (pass@2) در محک ARC-AGI-1 و هزینه خیره‌کننده ۰.۰۰۰۷ دلار به‌ازای هر مسئله، استانداردهای بهره‌وری در استدلال هوش مصنوعی را جابه‌جا کرد.

به نقل از پژوهشی که در ۸ سپتامبر ۲۰۲۶ منتشر شد، این مدل ثابت می‌کند حل مسائل پیچیده لزوماً نیازمند تولید توکن‌های متنی گران‌قیمت نیست که در مدل‌های زبانی بزرگ مدرن رایج است. در حال حاضر، اکثر سامانه‌های استدلالی بر پایه زنجیره تفکر (Chain-of-Thought) عمل می‌کنند؛ یعنی مدل باید هر گام منطقی را به‌صورت صریح و متنی بنویسد. این فرآیند اگرچه برای انسان قابل‌فهم است، اما حجم عظیمی از محاسبات و زمان را می‌بلعد و هزینه هر استنتاج (Cost-per-inference) را افزایش می‌دهد که در نهایت مقیاس‌پذیری عامل‌های (Agents) خودمختار را محدود می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های استدلالی اشاره کردیم، حذف لایه‌های زائد در مسیر استنتاج کلید دستیابی به سرعت است. BDH-CQ با استفاده از استدلال نهان بازگشتی، این پارادایم را تغییر داده است. به‌جای آنکه مدل را مجبور کند خروجی‌هایی مانند «گام اول، گام دوم» تولید کند، این سیستم محاسبات تکرارشونده را در یک فضای نهان (Latent Space) با ابعاد بالا انجام می‌دهد. این یعنی مدل وضعیت داخلی خود را به‌طور مستمر و بر اساس ورودی‌های زمان استنتاج به‌روز می‌کند، بدون آنکه درگیر سربار تولید توکن‌های زبان طبیعی شود.

زمینه و تعمیم‌پذیری

این پیشرفت به‌ویژه در محک ARC-AGI-1 (پیکره انتزاع و استدلال) اهمیت می‌یابد. این آزمون برای سیستم‌های هوش مصنوعی به‌شدت دشوار است زیرا به‌جای تطبیق ساده‌ی الگوها (Pattern Matching)، نیازمند تعمیم‌پذیری (Generalization) واقعی است.

پژوهشگران با حذف نیاز به بیان متنی منطق میانی، مسیر استنتاج (Inference) را بهینه کرده‌اند. نتیجه این رویکرد، مدلی است که قادر است وظایف تبدیل (Transformation) پیچیده و دیده‌نشده را مدیریت کند و در عین حال، بهره‌وری بسیار بالایی را حفظ نماید.

معماری فنی

بهره‌وری این مدل از ترکیب یادگیری در بستر متن (In-context learning) و یک مکانیزم بازگشتی نشأت می‌گیرد. برخلاف ترنسفورمرهای (Transformers) استاندارد که دارای پنجره‌های متنی ایستا هستند، BDH-CQ ورودی را به‌صورت جریانی می‌بیند که یک فضای کاری حافظه بازگشتی را تغییر می‌دهد.

این حافظه مانند یک میز کار اختصاصی عمل می‌کند که مدل در آن محاسبات تکراری را انجام می‌دهد. مشخصات کلیدی این معماری عبارتند از:

  • تعداد پارامترها: تنها ۱۵۰ میلیون پارامتر، که آن را نسبت به رقبای چند میلیارد پارامتری، به‌طور قابل‌توجهی قابل‌حمل‌تر (Portable) می‌کند.
  • منطق غیرمتنی: به‌روزرسانی وضعیت داخلی جایگزین توکن‌های استدلالی صریح شده است. مدل از تولید خروجی‌هایی مانند «گام ۱: شناسایی الگو... گام ۲: اعمال تبدیل...» اجتناب می‌کند.
  • به‌روزرسانی‌های بازگشتی: مدل درک خود از وظایف تبدیل را با پردازش نمونه‌های بیشتر اصلاح می‌کند، به‌جای آنکه تنها به یک گذر پیشرو (Forward Pass) واحد تکیه کند.
  • پردازش در فضای نهان: عملیات به‌صورت داخلی در یک فضای با ابعاد بالا انجام می‌شود. این امر سربار تولید توکن‌ها را که اغلب بخش اعظم هزینه‌های استنتاج در مدل‌های زبانی بزرگ (LLM) را تشکیل می‌دهد، حذف می‌کند.

طبق گزارش منتشر شده توسط Pneumetron، این معماری مرز هزینه-دقت (Pareto frontier) را در محک ARC-AGI-1 می‌شکند. مدل‌های پیشین برای رسیدن به آستانه‌های عملکردی مشابه، اغلب به خوشه‌های محاسباتی عظیم یا چرخه‌های تولید با تأخیر (Latency) بالا نیاز داشتند.

پژوهشگران با بهینه‌سازی مسیر استنتاج ثابت کردند که قابلیت استدلال، تابعی از نحوه استفاده مؤثر مدل از وضعیت داخلی‌اش است، نه صرفاً تابعی از مقیاس خام مدل (Model Scale).

تحلیل بنچمارک و پیامدهای توسعه

عملکرد BDH-CQ به‌دلیل بهره‌وری شدید در هزینه بسیار قابل‌توجه است. مدل به نرخ موفقیت ۲۹.۵ درصدی در pass@2 دست یافته است. اگرچه این درصد در حالت ایزوله ممکن است متواضعانه به نظر برسد، اما وقتی از دریچه هزینه محاسباتی مورد نیاز برای دستیابی به آن نگریسته شود، یک پیشرفت بزرگ (Breakthrough) محسوب می‌شود.

برای جامعه فنی، این تغییر این فرض را به چالش می‌کشد که زنجیره تفکر (CoT) پرحجم برای تعمیم‌پذیری پیچیده ضروری است. این نتیجه نشان می‌دهد که «تفکر بدون سخن» مسیر بهینه برای سیستم‌هایی است که در آن‌ها تنها پاسخ نهایی مورد نیاز است.

این تحول برای رایانش لبه (Edge Computing) حیاتی است. ردپای ۱۵۰ میلیون پارامتری اجازه می‌دهد استدلال‌های پیچیده روی سخت‌افزارهای محلی که در آن‌ها حافظه و توان محدود است، اجرا شوند و کاربردهای بلادرنگ (Real-time) را که پیش‌تر از نظر هزینه غیرممکن بودند، فعال کنند. این رویکرد در راستای تلاشاتی است که سرعت پاسخ‌دهی عامل‌های هوشمند را در سخت‌افزارهای محلی افزایش داده‌اند تا محدودیت‌های سخت‌افزاری مانع از بهره‌برداری بهینه نشوند.

علاوه بر این، هزینه ۰.۰۰۰۷ دلار به‌ازای هر مسئله، گردش‌کارهای عامل‌محور (Agentic) در حجم بالا — مانند بازنویسی خودکار کد، پردازش خودکار داده‌ها یا برنامه‌ریزی منطقی پیچیده — را برای نخستین بار از نظر اقتصادی توجیه‌پذیر می‌کند. در این راستا، بهینه‌سازی استدلال می‌تواند به حل چالش‌هایی کمک کند که در آن درک عمیق کد به گلوگاه جدید توسعه نرم‌افزار تبدیل شده است.

توسعه‌دهندگان اکنون باید معماری‌هایی را در نظر بگیرند که به‌روزرسانی وضعیت داخلی را بر خروجی‌های مولد اولویت می‌دهند تا تأخیر و هزینه در محیط‌های عملیاتی کاهش یابد. توانایی اجرای منطق داخلی بدون خروجی زبان طبیعی، یک بهینه‌سازی حیاتی برای هر سیستمی است که در آن گام‌های میانی صرفاً وسیله‌ای برای رسیدن به هدف هستند.

در آینده باید منتظر پژوهش‌های بیشتری بود تا مشخص شود آیا این رویکرد استدلال نهان می‌تواند به وظایف چندوجهی (Multimodal) تعمیم یابد یا اینکه متمرکز بر بنچمارک‌های انتزاعی مانند ARC-AGI باقی می‌ماند.

گام بعدی شما

  • بررسی معماری‌های مبتنی بر وضعیت داخلی (Internal State) به‌جای خروجی‌های مولد برای کاهش تأخیر در محیط‌های عملیاتی.
  • ارزیابی مدل‌های کوچک (SLM) با قابلیت استدلال نهان برای جایگزینی زنجیره‌های تفکر گران‌قیمت در اپلیکیشن‌های لبه.
  • دنبال کردن پژوهش‌های آتی برای بررسی امکان تعمیم این رویکرد به وظایف چندوجهی (Multimodal).

اما آیا این استدلال نهان می‌تواند در مدل‌های غول‌پیکر هم جایگزین توکن‌های متنی شود؟ پاسخ این پرسش در تحلیل ما درباره‌ی آینده مدل‌های استدلالی نهفته است.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در معماری‌های بازگشتی، هزینه استنتاج را به سطح ناچیزی رسانده و موانع اقتصادی استقرار عامل‌های هوشمند در مقیاس وسیع را از بین می‌برد. اعتبار این یافته در شکستن مرز هزینه-دقت در یکی از سخت‌ترین محک‌های تعمیم‌پذیری (ARC-AGI) نهفته است.

تأثیر برای ایران

این مدل به‌دلیل حجم بسیار کم (۱۵۰ میلیون پارامتر)، برای توسعه‌دهندگان ایرانی که با محدودیت سخت‌افزاری و هزینه GPU مواجه‌اند، فرصتی ایده‌آل برای اجرای استدلال‌های پیچیده روی سخت‌افزارهای محلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی توکن‌های متنی با محاسبات در فضای نهان، پارادایم «بیشتر تولید کن تا بهتر فکر کنی» را به چالش می‌کشد. این رویکرد نشان می‌دهد که استدلال یک فرآیند محاسباتی است، نه لزوماً یک فرآیند زبانی. در نتیجه، می‌توانیم انتظار ظهور نسلی از مدل‌های بسیار کوچک اما هوشمند را داشته باشیم که به‌جای تقلید از لحن انسان در فکر کردن، از بهینه‌ترین مسیر ریاضی برای رسیدن به جواب استفاده می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.