تصور کنید یک نابغه ریاضی تمام مراحل حل یک مسئله پیچیده را در ذهن دارد، اما درست پیش از نوشتن جواب نهایی، مدادش تمام میشود. این دقیقاً همان اتفاقی است که برای مدلهای استدلالی میافتد وقتی بودجه توکنهای آنها برای تفکر بیش از حد کم است.
به نقل از گزارشی در ۲۹ سپتامبر ۲۰۲۶، مدل Darwin-180B-RSI با استفاده از یک سامانه رایگیری اکثریت (Majority Vote) با ۱۶ نمونه، توانست در هر دو جدول ردهبندی AIME ۲۰۲۶ و HMMT فوریه ۲۰۲۶ به امتیاز ۱۰۰٪ برسد. این دستاورد، استانداردهای جدیدی را برای مدلهای استدلالی (Reasoning Model) — مدلهایی که قبل از جواب، یک قدم درنگ میکنند و فکر میکنند، شبیه شطرنجبازی که چند حرکت جلوتر را میبیند — با وزنهای باز (Open Weights) تعریف میکند.
همانطور که در تحلیلهای قبلی ما دربارهی قوانین مقیاسپذیری اشاره کردیم، افزایش اندازه مدل همیشه به معنای افزایش هوش نیست، بلکه مدیریت نحوه استفاده از آن اهمیت دارد. این رویکرد در تضاد با استراتژیهای برخی شرکتهاست که به جای بهینهسازی محض ریاضیات، اولویت را به ایمنی مدلها میدهند. محکهایی مانند AIME به دلیل ماهیت پاسخهای عددی (بین ۰ تا ۹۹۹)، حدس زدن در آنها تقریباً غیرممکن است. آزمون HMMT حتی سختتر است، زیرا برای پاسخهای شامل رادیکال و کسر، نیاز به برابری نمادین دارد.
مهندسان VIDRAFT در جریان آزمایشها به یک گلوگاه حیاتی رسیدند. طبق مستندات آنها، مدل هنگام استفاده از بودجه تفکر ۶۵ هزار توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — در دو مسئله AIME شکست خورد. اما بررسیها نشان داد اینها خطاهای ریاضی نبودند؛ مدل صرفاً پیش از رسیدن به پاسخ نهایی، تمام توکنهای مجاز خود را مصرف کرده بود. این چالشها یادآور تلاشهای مشابه برای مقابله با زوال درک مفهومی در مسائل پیچیده ریاضی است که پیشتر بررسی کردیم.
با افزایش این بودجه به ۱۳۱ هزار توکن، همان مسائل بهدرستی حل شدند. نتایج نهایی برای اجرای ۱۶ نمونه به شرح زیر است:
- AIME ۲۰۲۶: ۱۰۰.۰٪ (رتبه اول قبلی: ۹۷.۱٪)
- HMMT فوریه ۲۰۲۶: ۱۰۰.۰٪ (رتبه اول قبلی: ۹۲.۷٪)
این تغییر، نحوه ارزیابی مدلهای استدلالی را دگرگون میکند. این یافته ثابت میکند که «برش متن» (Truncation) اغلب به اشتباه به عنوان فقدان هوش تلقی میشود. اگر مدل در میانه راه قطع شود، نتیجه شبیه به شکست در منطق است، اما در واقع شکست در بودجه پروتکل است.
برای توسعهدهندگان، این بدان معناست که هر امتیازی بدون افشای بودجه تفکر، بیمعناست. برای سنجش واقعی قدرت یک مدل، باید «پاسخهای غلط» را از «پاسخهای ناقص» تفکیک کرد و بهجای تطبیق ساده متنی، از بررسیکنندههای نمادین استفاده نمود.
گام بعدی شما
- هنگام ارزیابی مدلهای استدلالی، حتماً مقدار توکنهای اختصاصیافته به زنجیره تفکر را بررسی کنید.
- برای کاهش نرخ خطای مدلهای ریاضی، بودجه استنتاج را بهصورت پویا افزایش دهید.
- از ابزارهای Symbolic Checker برای اعتبارسازی پاسخهای ریاضی استفاده کنید تا خطاهای فرمتی را با خطاهای منطقی اشتباه نگیرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو