پرش به محتوای اصلی
پرش به محتوای مقاله

«افزایش بودجه تفکر»؛ راهکار Darwin برای رفع خطاهای توکنی در استدلال

·۷ مهر ۱۴۰۵۲ دقیقه مطالعه
نمرات کامل در مسابقات AIME و HMMT ۲۰۲۶: مدل ۱۸۰ میلیارد پارامتری باز چه کرد و چرا بودجه فکر کردن اهمیت داشت
نمرات کامل در مسابقات AIME و HMMT ۲۰۲۶: مدل ۱۸۰ میلیارد پارامتری باز چه کرد و چرا بودجه فکر کردن اهمیت داشت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی این موضوع که افزایش بودجه توکن‌های تفکر (از ۶۵ هزار به ۱۳۱ هزار) می‌تواند خطاهای منطقیِ ظاهری را به پاسخ‌های درست تبدیل کند، بدون تغییر در وزن‌های مدل.

تصور کنید یک نابغه ریاضی تمام مراحل حل یک مسئله پیچیده را در ذهن دارد، اما درست پیش از نوشتن جواب نهایی، مدادش تمام می‌شود. این دقیقاً همان اتفاقی است که برای مدل‌های استدلالی می‌افتد وقتی بودجه توکن‌های آن‌ها برای تفکر بیش از حد کم است.

به نقل از گزارشی در ۲۹ سپتامبر ۲۰۲۶، مدل Darwin-180B-RSI با استفاده از یک سامانه رای‌گیری اکثریت (Majority Vote) با ۱۶ نمونه، توانست در هر دو جدول رده‌بندی AIME ۲۰۲۶ و HMMT فوریه ۲۰۲۶ به امتیاز ۱۰۰٪ برسد. این دستاورد، استانداردهای جدیدی را برای مدل‌های استدلالی (Reasoning Model) — مدل‌هایی که قبل از جواب، یک قدم درنگ می‌کنند و فکر می‌کنند، شبیه شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — با وزن‌های باز (Open Weights) تعریف می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی قوانین مقیاس‌پذیری اشاره کردیم، افزایش اندازه مدل همیشه به معنای افزایش هوش نیست، بلکه مدیریت نحوه استفاده از آن اهمیت دارد. این رویکرد در تضاد با استراتژی‌های برخی شرکت‌هاست که به جای بهینه‌سازی محض ریاضیات، اولویت را به ایمنی مدل‌ها می‌دهند. محک‌هایی مانند AIME به دلیل ماهیت پاسخ‌های عددی (بین ۰ تا ۹۹۹)، حدس زدن در آن‌ها تقریباً غیرممکن است. آزمون HMMT حتی سخت‌تر است، زیرا برای پاسخ‌های شامل رادیکال و کسر، نیاز به برابری نمادین دارد.

مهندسان VIDRAFT در جریان آزمایش‌ها به یک گلوگاه حیاتی رسیدند. طبق مستندات آن‌ها، مدل هنگام استفاده از بودجه تفکر ۶۵ هزار توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — در دو مسئله AIME شکست خورد. اما بررسی‌ها نشان داد این‌ها خطاهای ریاضی نبودند؛ مدل صرفاً پیش از رسیدن به پاسخ نهایی، تمام توکن‌های مجاز خود را مصرف کرده بود. این چالش‌ها یادآور تلاش‌های مشابه برای مقابله با زوال درک مفهومی در مسائل پیچیده ریاضی است که پیش‌تر بررسی کردیم.

با افزایش این بودجه به ۱۳۱ هزار توکن، همان مسائل به‌درستی حل شدند. نتایج نهایی برای اجرای ۱۶ نمونه به شرح زیر است:

  • AIME ۲۰۲۶: ۱۰۰.۰٪ (رتبه اول قبلی: ۹۷.۱٪)
  • HMMT فوریه ۲۰۲۶: ۱۰۰.۰٪ (رتبه اول قبلی: ۹۲.۷٪)

این تغییر، نحوه ارزیابی مدل‌های استدلالی را دگرگون می‌کند. این یافته ثابت می‌کند که «برش متن» (Truncation) اغلب به اشتباه به عنوان فقدان هوش تلقی می‌شود. اگر مدل در میانه راه قطع شود، نتیجه شبیه به شکست در منطق است، اما در واقع شکست در بودجه پروتکل است.

برای توسعه‌دهندگان، این بدان معناست که هر امتیازی بدون افشای بودجه تفکر، بی‌معناست. برای سنجش واقعی قدرت یک مدل، باید «پاسخ‌های غلط» را از «پاسخ‌های ناقص» تفکیک کرد و به‌جای تطبیق ساده متنی، از بررسی‌کننده‌های نمادین استفاده نمود.

گام بعدی شما

  • هنگام ارزیابی مدل‌های استدلالی، حتماً مقدار توکن‌های اختصاص‌یافته به زنجیره تفکر را بررسی کنید.
  • برای کاهش نرخ خطای مدل‌های ریاضی، بودجه استنتاج را به‌صورت پویا افزایش دهید.
  • از ابزارهای Symbolic Checker برای اعتبارسازی پاسخ‌های ریاضی استفاده کنید تا خطاهای فرمتی را با خطاهای منطقی اشتباه نگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص مهندسان VIDRAFT در مدیریت توکن‌ها، نشان داد که مدل‌های باز می‌توانند در استدلال‌های پیچیده با مدل‌های بسته رقابت کنند. این موضوع باعث می‌شود استانداردهای گزارش‌دهی بنچمارک‌ها به سمت شفافیت در بودجه محاسباتی تغییر کند.

تأثیر برای ایران

این مدل به‌دلیل داشتن وزن‌های باز، برای پژوهشگران هوش مصنوعی در ایران که با محدودیت‌های API مدل‌های بسته روبرو هستند، یک ابزار قدرتمند برای مطالعه استدلال ریاضی است.

·نگاه ما
تحریریه دات‌هوش

بسیاری از بنچمارک‌های فعلی، مدل‌ها را در تله‌ای می‌اندازند که در آن «صبر» مدل با «هوش» آن اشتباه گرفته می‌شود. Darwin-180B-RSI ثابت کرد که بسیاری از شکست‌های مدل‌های باز، نه در معماری، بلکه در محدودیت‌های عملیاتی استنتاج نهفته است. این یعنی ما باید از عصر «امتیاز کلی» به عصر «امتیاز به ازای توکن» حرکت کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.