پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه مدل ThinkingCap حجم توکن‌های استدلال را ۳۷ درصد کاهش داد؟

·۲ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
انتشار ThinkingCap-Qwen3.8-27B: کاهش ۳۷.۲٪ توکن‌های استدلالی با تنها ۰.۸۶ درصد افت دقت
انتشار ThinkingCap-Qwen3.8-27B: کاهش ۳۷.۲٪ توکن‌های استدلالی با تنها ۰.۸۶ درصد افت دقت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی این موضوع که حدود ۴۰٪ از توکن‌های زنجیره تفکر در مدل‌های پیشرفته، نویز هستند و حذف آن‌ها تأثیر ناچیزی بر صحت پاسخ دارد.

مدل‌های استدلالی فعلی اغلب روی توکن‌هایی هزینه می‌کنند که هیچ تأثیری بر پاسخ نهایی ندارند. ThinkingCap-Qwen3.8-27B ثابت می‌کند که می‌توان با هرس کردن این ردپاهای زائد، سرعت استنتاج را بدون تخریب هوش مدل افزایش داد. طبق گزارش فنی منتشر شده در marktechpost.com، BottleCap AI توانسته است میانگین توکن‌های مورد نیاز برای تفکر را در ۱۲ محک کلیدی تا ۳۷.۲٪ کاهش دهد.

این دستاورد در حالی رخ می‌دهد که صنعت با تأخیر بالا و هزینه‌های سنگین مدل‌های استدلالی (Reasoning Models) یا مدل‌های «سیستم ۲» دست‌وپنجه نرم می‌کند. در حالی که مدل‌های سری Qwen قابلیت‌های عمیقی در زنجیره تفکر (Chain-of-Thought) دارند، اما اغلب برای پرسش‌های ساده بیش از حد فکر می‌کنند. رویکرد BottleCap AI، کارایی استدلال را به جای یک محصول جانبی یا نتیجه‌ی اندازه مدل، به هدف اصلی بهینه‌سازی تبدیل کرده است. این تلاش برای کاهش هزینه‌های عملیاتی در راستای روندهایی است که در مدل‌های دیگر نیز دیده می‌شود؛ برای مثال، مدل BDH-CQ توانست هزینه استنتاج در محک ARC-AGI را به شدت کاهش دهد.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، کاهش هزینه استنتاج اکنون به اندازه افزایش دقت اهمیت یافته است.

اهداف و سازوکار فنی

مدل ThinkingCap-Qwen3.8-27B دومین عضو این خانواده است و پس از نسخه قبلی که بر پایه Qwen3.6-27B بود، عرضه شده است. هدف تیم توسعه در این نسخه به‌طور آگاهانه محافظه‌کارانه بود؛ آن‌ها تلاشی برای افزودن دانش جدید یا تغییر سبک پاسخ‌دهی نکردند.

به نقل از مستندات فنی، تمرکز اصلی بر این بود که توانایی استدلال، پیروی از دستورات و رفتارهای ایمنی در فرآیند تنظیم دقیق (Fine-tuning) دست‌نخورده باقی بمانند. برای تضمین پایداری، تیم تحقیق تأکید بیشتری بر محک‌های ریاضی، استدلال، زمینه‌های متنی طولانی و قابلیت‌های عامل‌محور (Agentic) صورت داد.

این مدل یک تنظیم دقیق مستقیم از مدل پایه Qwen3.8-27B است. داده‌ها نشان می‌دهند که صحت کلی (Macro-average accuracy) مدل از ۸۶.۶۵٪ به ۸۵.۷۹٪ رسیده است؛ یعنی یک هزینه ناچیز (۰.۸۶ درصد) در برابر افزایش چشمگیر سرعت. میانگین توکن‌های تفکر (Pooled mean thinking tokens) از ۱۵,۷۳۵ به ۱۲,۱۴۴ عدد کاهش یافته است.

تحلیل عملکرد در محک‌های مختلف

میزان کاهش توکن‌ها بسته به نوع وظیفه، بین ۱۰.۷٪ تا ۶۵.۵٪ متغیر است:

  • دانش و چندزبانی: بیشترین کاهش در این بخش رخ داده است؛ توکن‌های تفکر در MMMLU حدود ۶۵.۵٪ (از ۱,۶۵۶ به ۵۷۱) و در MMLU-Pro حدود ۵۷.۳٪ کم شده‌اند.
  • استدلال پیچیده: در محک GPQA-Diamond کاهش ۴۳.۱ درصدی مشاهده شد (از ۱۲,۷۷۲ به ۷,۲۶۷ توکن). در IFBench نیز توکن‌های تفکر ۴۶.۴٪ کاهش یافتند در حالی که صحت مدل تقریباً ثابت ماند (۷۹.۷۵٪ به ۷۹.۷۱٪).
  • زمینه متنی طولانی: در یک نتیجه غیرمنتظره، صحت مدل در AA-LCR حدود ۲.۲۵ درصد افزایش یافت (۸۱.۷۵٪ به ۸۴.۰۰٪) در حالی که ۳۸.۶٪ توکن کمتری مصرف کرد.
  • ریاضیات: بیشترین افت کیفیت در AIME 2026 رخ داد؛ جایی که صحت مدل برای دستیابی به ۳۰.۲٪ کاهش توکن، ۳.۸۵ درصد افت کرد (۹۸.۱۳٪ به ۹۴.۲۷٪).
  • وظایف عامل‌محور: نتایج نزدیک به مدل پایه بود. در $\tau^2$-bench کاهش ۳۰.۹ درصدی توکن‌ها با افت ۱.۰۱ درصدی صحت همراه بود. در Terminal-Bench 2.1، مدل ۰.۵۶ درصد صحت از دست داد (که در بازه خطای $\pm 4.26$ قرار دارد) تا به کاهش ۱۰.۷ درصدی توکن‌ها برسد. همچنین در LiveCodeBench v6، صحت مدل ۰.۰۷ درصد افزایش یافت در حالی که ۲۰.۳٪ کمتر فکر می‌کرد.

بودجه محاسباتی و دینامیک تلاش

گزارش‌های BottleCap یک منحنی بودجه را نشان می‌دهد که ثابت می‌کند در صورت اعمال سقف ۱۶ هزار توکن برای هر پاسخ، مدل ThinkingCap در واقع امتیاز بیشتری نسبت به مدل پایه کسب می‌کند. در این حالت، ردپاهای قطع شده (Truncated traces) از ۰.۵۱٪ به ۰.۳۴٪ و نرخ تکرار (Looping) از ۰.۰۶٪ به ۰.۰۵٪ کاهش یافته است.

این مدل همچنین با تنظیمات «میزان تلاش استدلال» (Reasoning-effort dial) در Qwen3.8-27B تعامل دارد. در تنظیمات 'medium'، مدل ThinkingCap حدود ۶۰.۲٪ از توکن‌های تفکر را حذف می‌کند که منجر به افت ۹.۹۰ درصدی صحت می‌شود (در مقایسه با مدل پایه که ۵۲.۱٪ کاهش توکن و ۹.۱۶٪ افت صحت داشت). در حالت 'low'، کاهش توکن‌ها به ۶۲.۳٪ می‌رسد و افت صحت ۱۰.۷۹٪ است. در صورتی که تفکر به‌طور کامل خاموش شود، ThinkingCap حدود ۵.۷ درصد از مدل پایه عقب می‌ماند.

استقرار و مشخصات فنی

هر دو مدل روی یک پردازنده NVIDIA H200 با استفاده از vLLM 0.29.0 ارزیابی شدند. تنظیمات نمونه‌برداری یکسان بود: دما ۱.۰، top_p ۰.۹۵، top_k ۲۰ و min_p ۰.۰. همچنین استفاده از رمزگشایی گمانه‌زن MTP (با ۳ توکن پیش‌نویس) در AIME 2026 تأثیری بر دقت نداشت و ۵۳٪ از توکن‌های پیش‌نویس پذیرفته شدند.

مدل ThinkingCap یک جایگزین مستقیم (Drop-in replacement) برای Qwen3.8-27B در vLLM یا SGLang است. نسخه bf16 دارای ۲۸ میلیارد پارامتر است و ورودی‌های متنی و تصویری را می‌پذیرد. برای استقرار، فرمت‌های مختلف کوانتیزاسیون (Quantization) ارائه شده است:

  • FP8 (۳۱ گیگابایت): بهینه برای GPUهای Hopper و Blackwell.
  • NVFP4 Weight-only (۲۱ گیگابایت): مخصوص Hopper (هسته Marlin) و Blackwell.
  • NVFP4 W4A4 AWQ (۲۳ گیگابایت): فقط برای Blackwell.
  • GGUF (۱۶ تا ۵۵ گیگابایت): سازگار با llama.cpp، LM Studio و Ollama.
  • MLX 4-bit DWQ (۲۱ گیگابایت): مخصوص مک‌های اپل با ۳۲ گیگابایت رم.

برای کسانی که از تنظیمات میزان تلاش استدلال استفاده می‌کنند، BottleCap حالت 'xhigh' را برای بهترین تعادل بین دقت و تعداد توکن توصیه می‌کند. برای سرویس‌دهی، از دستور --reasoning-parser qwen3 به همراه ابزار qwen3_xml در vLLM استفاده شود تا توکن‌های تفکر در یک فیلد جداگانه بازگردانده شوند.

این تحول نشان می‌دهد که مرز بعدی مدل‌های استدلالی، «بیشتر فکر کردن» نیست، بلکه «هوشمندتر فکر کردن» است. وقتی نزدیک به ۴۰٪ از توکن‌های استدلال عملاً نویز هستند، فرض قدیمی که «ردپاهای طولانی‌تر برابر با منطق بهتر است» به چالش کشیده می‌شود. برای توسعه‌دهندگان، این به معنای هزینه‌های استنتاج کمتر و کاهش زمان رسیدن به اولین توکن (TTFT) بدون قربانی کردن هوش هسته معماری Qwen است. این رویکرد بهینه‌سازی در سایر مدل‌های چندوجهی خانواده Qwen نیز دیده شده است، جایی که مدل Qwen3.8-Omni-Flash توانست مصرف توکن‌های ویدیو را ۴۵.۷٪ کاهش دهد.

این مدل تحت مجوز PolyForm Small Business 1.0.0 به همراه گرنت استفاده شخصی BottleCap در دسترس است، در حالی که متریال‌های بالادستی Qwen تحت Apache-2.0 باقی می‌مانند. استفاده تجاری فراتر از مجوز کسب‌وکارهای کوچک، نیازمند توافق‌نامه با BottleCap است.

گام بعدی شما

  • اگر از مدل‌های Qwen برای وظایف استدلالی استفاده می‌کنید، نسخه ThinkingCap را برای کاهش هزینه استنتاج (Inference) تست کنید.
  • برای دستیابی به بهترین تعادل بین دقت و تعداد توکن، تنظیمات reasoning-effort را روی حالت 'xhigh' قرار دهید.
  • در محیط vLLM از پارامتر --reasoning-parser qwen3 برای جداسازی توکن‌های تفکر از پاسخ نهایی استفاده کنید.

اما تأثیر این بهینه‌سازی بر سخت‌افزارهای لبه حتی حیاتی‌تر است — به تحلیل ما درباره‌ی تراشه‌های NPU مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش چشمگیر توکن‌های استدلال، تأخیر (Latency) را کم و توان عملیاتی را افزایش می‌دهد. این دستاورد بر اساس تجربه عملی BottleCap، هزینه‌های عملیاتی استقرار مدل‌های استدلالی را برای کسب‌وکارها به شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل وزن‌های باز مدل و پشتیبانی از فرمت GGUF، توسعه‌دهندگان ایرانی می‌توانند این مدل را روی سخت‌افزارهای محدودتر (مانند مک‌های اپل یا GPUهای قدیمی‌تر) با سرعت بسیار بیشتر اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

حذف توکن‌های زائد در مدل‌های استدلالی نشان می‌دهد که ما در حال ورود به عصر «تقطیر استدلال» هستیم. این یافته ثابت می‌کند که بسیاری از مدل‌های Reasoning فعلی دچار بیش‌پردازش (Over-thinking) هستند و مقدار زیادی از توان محاسباتی را صرف تکرار مفاهیم می‌کنند. به نظر ما، آینده‌ی این مدل‌ها در گروی مکانیزم‌هایی است که بتوانند در لحظه تشخیص دهند چه زمانی استدلال عمیق لازم است و چه زمانی می‌توان به پاسخ سریع رسید.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.