پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های استدلالی بودجهٔ توکن را در تفکرات پنهان می‌سوزانند

·۱۳ مهر ۱۴۰۵۲ دقیقه مطالعه
پاسخ‌های خالی با max_tokens=700 در مدل استدلالی: کل بودجه صرف توکن‌های پنهان تفکر شد
پاسخ‌های خالی با max_tokens=700 در مدل استدلالی: کل بودجه صرف توکن‌های پنهان تفکر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای مکانیزم «سوزاندن بودجهٔ توکن» در لایهٔ تفکر پنهان؛ جایی که مدل استدلالی پیش از تولید اولین توکن خروجی، به دلیل محدودیت max_tokens متوقف می‌شود.

تصور کنید برای یک دستیار هوشمند بودجه‌ای تعیین کرده‌اید تا پاسخی کوتاه بدهد، اما او تمام وقتش را صرف فکر کردن می‌کند و پیش از آنکه لب باز کند، زمانش تمام می‌شود. این دقیقاً همان اتفاقی است که برای بسیاری از توسعه‌دهندگانی می‌افتد که بدون تغییر تنظیمات، به مدل‌های استدلالی کوچ کرده‌اند.

به گزارش وب‌سایت dev.to، یک توسعه‌دهنده در اکتبر ۲۰۲۶ متوجه شد که خط لولهٔ جمع‌آوری اخبارش برای سه شب متوالی با شکست مواجه شده است. سیستم با وجود گزارش موفقیت‌آمیز بودن درخواست‌ها، فیلدهای محتوای خالی برمی‌گرداند؛ یک شکست خاموش که تمام سیگنال‌های سلامت سیستم را دور زد.

بسیاری از برنامه‌نویسان پارامتر max_tokens (حداکثر توکن) را صرفاً محدودیتی برای پاسخ نهایی می‌بینند. اما در یک مدل استدلالی (Reasoning Model) — شبیه شطرنج‌بازی که قبل از هر حرکت، چندین گام جلوتر را در ذهن می‌بیند — این بودجه بین زنجیره تفکر (Chain-of-Thought) داخلی و خروجی قابل مشاهده تقسیم می‌شود. اگر این بودجه کم باشد، مدل تمام توکن‌ها را در مرحلهٔ «تفکر» می‌سوزاند و پیش از نوشتن حتی یک کلمه از پاسخ واقعی، قطع می‌شود. در همین راستا، تلاش‌هایی برای بهینه‌سازی این فرآیند صورت گرفته است، مانند مدل ThinkingCap که توانست حجم توکن‌های استدلال را تا ۳۷ درصد کاهش دهد تا بهره‌وری مدل‌ها افزایش یابد.

محدودیت ۷۰۰ توکن در مدل استدلالی پاسخ خالی داد — توکن‌های فکر پنهان کل بودجه را مصرف کردند

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدیریت هزینه‌های استنتاج اشاره کردیم، درک تفاوت معماری مدل‌ها برای بهینه‌سازی حیاتی است. این موضوع در مدل‌های پیشرفته‌تر نیز دیده می‌شود، جایی که مدل BDH-CQ توانست هزینه استنتاج در محک ARC-AGI را به شدت کاهش دهد. طبق مستندات این گزارش، شکست مذکور زمانی رخ داد که محدودیت روی ۷۰۰ توکن تنظیم شده بود. این مقدار برای یک خلاصهٔ ۲۰۰ کلمه‌ای در مدل‌های معمولی کافی است، اما برای فرآیند داخلی یک مدل استدلالی، فضای لازم را فراهم نمی‌کرد.

این توسعه‌دهنده برای حل مشکل سه اقدام انجام داد:

  • افزایش بودجهٔ تکمیل (Completion Budget) به حدود ۴۰۰۰ توکن.
  • تعریف مجدد وضعیت finish_reason: "length" به همراه محتوای خالی به عنوان یک خطای درجه‌یک.
  • مستندسازی رفتار توکن‌ها برای هر مدل در یک API سفارشی جهت جلوگیری از محاسبات اشتباه در آینده.

این اتفاق یک شکاف بحرانی در رابط‌های سازگار با OpenAI را آشکار می‌کند. وقتی یک نقطه اتصال (Endpoint) درخواست‌ها را بین خانواده‌های مختلف مدل‌ها توزیع می‌کند، پارامترهای جهانی مثل max_tokens دیگر معنای واحدی ندارند. برنامه‌نویسان دیگر نمی‌توانند فرض کنند که یک فراخوانی موفق با محدودیت طول، صرفاً به معنای کم آوردن جا برای جملات پایانی است. این چالش با بررسی‌های مربوط به افزایش بودجه توکن در حافظه عامل‌ها همسو است که نشان می‌دهد افزایش ساده بودجه همیشه با افزایش متناسب خروجی همراه نیست.

برای کسانی که خط لوله‌های تولیدی می‌سازند، این یعنی بازبینی هر فیلد پاسخ بر اساس خانوادهٔ مدل. شما باید به‌طور خاص مواردی را رصد کنید که مدل پیش از تولید هرگونه متن قابل مشاهده، به محدودیت طول می‌رسد؛ زیرا این نشانهٔ قطعی اتمام بودجه در لایهٔ استدلال است.

گام بعدی شما

  • تمام محدودیت‌های max_tokens را در مدل‌های استدلالی حداقل ۵ برابر کنید.
  • منطق بررسی خطاها را به‌گونه‌ای تغییر دهید که «پاسخ خالی + دلیل توقف به دلیل طول» را به عنوان خطا ثبت کند.
  • در صورت استفاده از مدل‌های مختلف در یک پروژه، برای هر مدل یک پروفایل بودجهٔ توکن مجزا تعریف کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این موضوع بر اساس تجربهٔ عملی توسعه‌دهندگان، ریسک شکست‌های نامرئی در سیستم‌های اتوماسیون را افزایش می‌دهد. اعتبار سیستم‌های مبتنی بر هوش مصنوعی زمانی به خطر می‌افتد که خروجی‌های خالی را به جای خطای سیستمی گزارش کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از واسط‌های API (Proxy) استفاده می‌کنند، این موضوع اهمیت دوچندان دارد؛ زیرا مدیریت دقیق توکن‌ها برای کاهش هزینه‌های ارزی حیاتی است و نادیده گرفتن آن منجر به اتلاف هزینه برای پاسخ‌های خالی می‌شود.

·نگاه ما
تحریریه دات‌هوش

این گزارش نشان می‌دهد که استانداردهای فعلی APIها با معماری مدل‌های استدلالی هم‌راستا نیستند. در واقع، «تفکر» مدل اکنون به عنوان یک هزینهٔ عملیاتی پنهان عمل می‌کند که می‌تواند پایداری سیستم‌های خودکار را به خطر اندازد. توسعه‌دهندگان باید از رویکرد «یک اندازه برای همه» در تنظیمات توکن فاصله بگیرند و لایه‌ای برای نظارت بر توکن‌های تفکر ایجاد کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.