هزینهٔ پرداخت برای یک شناخت تکراری را تصور کنید؛ هر بار که یک مدل استدلالی برای یافتن پاسخ درست، چندین گزینه را نمونهبرداری میکند، منابع محاسباتی شما میسوزد. برای حذف این ناکارآمدی، صنعت در حال چرخش به سمت «تقطیر محاسبات زمان استنتاج» (Test-time compute distillation) است.
به نقل از تحلیل فنی وبسایت The Sequence که در ۱۸ اوت ۲۰۲۶ منتشر شد، آزمایشگاههای پیشرو در سال گذشته محاسبات زمان استنتاج را به عنوان محور سوم مقیاسپذیری — در کنار پارامترها و دادهها — تعریف کردند. با اجازه دادن به مدل برای تولید یک زنجیره تفکر (Chain-of-Thought) یا اجرای جستوجوی درختی روی مسیرهای استدلالی، صحت پاسخها بدون تغییر در وزنهای مدل بهشدت افزایش مییابد. با این حال، این «آیین استنتاجی» از نظر محاسباتی گران و تکراری است و فشار زیادی بر زیرساختهای مدیریت توکن وارد میکند؛ موضوعی که در تحلیل ما پیرامون مدیریت حافظه در سیستمهای استنتاج مدرن به تفصیل بررسی شده است.

همانطور که در بحثهای گذشتهی ما دربارهی قوانین مقیاسپذیری اشاره کردیم، بهینهسازی هزینه بدون افت کیفیت، هدف نهایی است. تقطیر محاسبات زمان استنتاج یک پویایی متضاد میان «معلم» و «شاگرد» را پیشنهاد میدهد:
- معلم: همان شبکه عصبی است، اما زمان بسیار بیشتری برای تفکر دارد (مثلاً نمونهبرداری از ۱۶ گزینه و استفاده از رایگیری اکثریت).
- شاگرد: همان شبکه است، اما آموزش میبیند تا خروجی با صحت بالای معلم را تنها در یک گذر پیشرو (Forward Pass) بازتولید کند.
بر اساس مستندات این روش، این مکانیزم در واقع «هوشمندی» خریداریشده در زمان استنتاج را مستقیماً در وزنها (Weights) فشرده میکند. بهجای پرداخت هزینه برای ۱۶ نمونه جهت رسیدن به یک پاسخ قابلاعتماد، مدل تقطیرشده یاد میگیرد منطق داخلی لازم برای رسیدن فوری به آن پاسخ را درونی کند. این رویکرد در واقع تکاملیافتهی استراتژیهای تقطیر دادههای مصنوعی است که در آن مدلهای بزرگتر به مدرسانی برای مدلهای کوچکتر تبدیل میشوند.
برای جامعه فنی، این موضوع فرض بنیادی مدلهای استدلالی را تغییر میدهد. این یافته نشان میدهد تفکر «سیستم ۲» (استدلال کند و متأملانه) تنها راهی برای دریافت پاسخهای بهتر نیست، بلکه روشی برای تولید دادههای مصنوعی (Synthetic Data) باکیفیت جهت بهبود خودِ مدل است. در واقع، مدل در حال تقطیر خودش به نسخهای کارآمدتر است؛ مشابه آنچه در بررسی اثرات تقلید توالیها در مدلهای کوچک مشاهده کردیم و نشان داد که حتی تقلید ساده میتواند نتایج چشمگیری داشته باشد.
گام بعدی شما
- رصد انتشار مدلهای استدلالی تقطیرشده که دقت سری o را با سرعت استنتاج مدلهای زبانی استاندارد ترکیب میکنند.
- تحلیل نسبت دقیق محاسبات زمان استنتاج مورد نیاز برای دستیابی به یک بهبود مشخص در عملکرد مبتنی بر وزن.
- بررسی ابزارهای جدید تولید دادههای مصنوعی که از خروجیهای مدلهای «متفکر» برای آموزش مدلهای کوچکتر استفاده میکنند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو