اگر امروز برای استنتاج مدلهای ۷۰ میلیارد پارامتری هزینه میپردازید، احتمالاً نیمی از توان پردازشی شما صرف انتظار برای جابهجایی دادهها شده است، نه محاسبات واقعی. یک گذر پیشرو (Forward Pass) در یک مدل ۷۰ میلیاردی، چه برای تولید یک توکن باشد و چه برای تأیید پنج توکن، هزینه یکسانی دارد. هر توکن تولید شده مستلزم بارگذاری ۷۰ میلیارد پارامتر از حافظه، ضرب آنها و سپس دور ریختن آنهاست تا این فرآیند برای توکن بعدی تکرار شود. رمزگشایی گمانهزنانه (Speculative Decoding) این ناکارآمدی را هدف قرار داده تا تأخیر استنتاج را بدون کوچکترین افت در کیفیت خروجی، ۲ تا ۵ برابر کاهش دهد.
بیشتر مدلهای زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — با محدودیت حافظه (Memory-bound) مواجهاند. به این معنا که واحد پردازش گرافیکی (GPU) زمان بیشتری را صرف انتقال وزنها از حافظه پهنایباند بالا (HBM) میکند تا انجام عملیات ریاضی. این وضعیت باعث میشود واحدهای محاسباتی GPU در حالی که مدل توکنها را یکییکی تایپ میکند، بیکار بمانند. این چالش در واقع همان گلوگاه پهنایباند حافظه است که مانع اصلی مقیاسدهی سنتی در مدلهای زبانی محسوب میشود. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی خروجیهای ساختاریافته با ابزارهایی مثل coerce-json اشاره کردیم، رمزگشایی گمانهزنانه مستقیماً فیزیک تولید توکن را هدف قرار میدهد.
تصور کنید در یک آزمون، شما ۵ کلمه را مینویسید و همزمان به معلم میدهید تا همه را یکجا تصحیح کند؛ معلم کلماتی را که با آنها موافق است نگه میدارد و شما فقط اولین اشتباه را اصلاح میکنید. طبق مستندات فنی، این دقیقاً سازوکار رمزگشایی گمانهزنانه است: یک مدل پیشنویس (Draft Model) ارزانقیمت، تعداد K توکن را پیشنهاد میدهد و مدل هدف آنها را در یک گذر موازی تأیید میکند. از آنجا که بررسی موازی توکنها پس از بارگذاری وزنها تقریباً رایگان است، مدل هدف میتواند کل توالی پیشنویس را یکباره اعتبارسنجی کند.
مکانیسم پذیرش
این سیستم بر اساس یک قانون پذیرش مشخص مبتنی بر نمونهگیری رد (Rejection Sampling) کتابخانهای عمل میکند. به نقل از منابع پژوهشی، وقتی مدل پیشنویس توکنی مانند d را پیشنهاد میدهد، مدل هدف آن را با احتمالی برابر با min(1, q(d)/p(d)) میپذیرد. این عدد در واقع نسبت احتمال توکن از دیدگاه مدل هدف در مقابل تخمین مدل پیشنویس است.
اگر پیشنویس اشتباه باشد، مدل هدف به سادگی توکن را رد کرده، توکن صحیح را از توزیع باقیمانده نمونهبرداری میکند و به مسیر خود ادامه میدهد. این سازوکار تضمین میکند که توزیع نهایی خروجی دقیقاً (bit-for-bit) مشابه مدل اصلی باشد. یک پیشنویس بد نمیتواند کیفیت خروجی را تخریب کند؛ بلکه فقط سرعت سیستم را به حالت عادی برمیگرداند.
دو متغیر اصلی سرعت واقعی را تعیین میکنند:
- آلفا (α): نرخ پذیرش یا کسری از توکنهای پیشنویس که مدل هدف میپذیرد. این متغیر، معیار اصلی کل این حوزه است.
- N: طول پیشنویس یا تعداد توکنهایی که در هر دور گمانهزنی میشوند.
تعداد توکنهای مورد انتظار که در هر گذر پیشرو مدل هدف ذخیره میشوند، با فرمول E[accepted] = (1 − α^(N+1)) / (1 − α) محاسبه میشود. برای مثال، با نرخ پذیرش ۰.۸ و طول پیشنویس ۵، انتظار میرود در هر گذر حدود ۳.۴ توکن تأیید شوند. اگر با یک مدل پیشنویس باکیفیت، آلفا به ۰.۹۵ و N به ۸ برسد، افزایش سرعت میتواند به مرز ۵ برابر نزدیک شود.
تکامل پیشنویسها (۲۰۲۳–۲۰۲۶)
صنعت برای افزایش نرخ پذیرش (α) از سه دوره متمایز عبور کرده است:
- رمزگشایی گمانهزنانه ساده (۲۰۲۳): در این دوره از یک مدل کوچکتر از همان خانواده استفاده میشد (مثلاً یک مدل ۱ میلیارد پارامتری برای پیشنویس مدل ۷۰ میلیارد پارامتری). این روش معمولاً نرخ پذیرش α ≈ 0.6 و سرعت حدود ۲ برابری داشت. محدودیت اصلی این بود که حدسهای مدل کوچک بیش از حد با مدل بزرگ فاصله میگرفت.
- EAGLE و EAGLE-3 (۲۰۲۴-۲۰۲۵): به جای مدل مجزا، EAGLE از یک سر پیشنویس (Draft Head) بسیار کوچک (یک یا دو لایه ترنسفورمر) استفاده میکند که حالتهای پنهان (Hidden States) لایه آخر مدل هدف را میخواند. چون این مدل نمایش داخلی هدف را میبیند، توزیع آن بسیار نزدیکتر به هدف است و آلفا را به ۰.۶ تا ۰.۸ میرساند. مقاله EAGLE گزارش میدهد که در مدلهای چت ۷۰ میلیاردی، تأخیر ۲.۷ تا ۳.۵ برابر کاهش یافته است. EAGLE-3 با پیشبینیهای دورتر و مدیریت بهتر عدم قطعیت، این وضعیت را بهبود بخشید؛ مستندات رسمی NVIDIA آن را ۲ تا ۳ برابر سریعتر از رمزگشایی ساده میدانند و تستهای شخص ثالث نشان میدهد که در اندازه دستههای کوچک (Low Batch Sizes)، ۱۵ تا ۲۵ درصد سریعتر از EAGLE-2 و Medusa-2 در تولید توکن بر ثانیه است.
- پیشبینی بومی چندتوکنی (۲۰۲۶): جدیدترین مرز، ادغام پیشبینی در خود معماری است. مدلهایی مثل Gemma 4 MTP، DSpark و DFlash با سرهای MTP داخلی عرضه شدهاند. یک بنچمارک در سال ۲۰۲۶ نشان داد که DFlash در آزمون MATH500 برای یک مدل با ۲۶ میلیارد پارامتر فعال، به سرعت ۲.۸۷ برابری رسید، در حالی که Kimi-K2.5 به ۲.۶۸ برابر و یک مدل با ۱۲۲ میلیارد پارامتر فعال در حالت MTP بومی به ۲.۲۰ برابر دست یافتند. این رویکرد در واقع پاسخی به این مسئله است که تولید متن بهجای تصمیمگیری، مانع اصلی سرعت در معماریهای فعلی AI است.
واقعیتهای تولید و محدودیتها
در حالی که مقالات پژوهشی دستاوردهای عظیمی را گزارش میکنند، نتایج دنیای واقعی بسته به حجم کاری (Workload) متفاوت است. یک بنچمارک سیستماتیک در سال ۲۰۲۶ روی vLLM (که پنج روش، چهار مدل و شش حجم کاری مختلف را تست کرد) فاش کرد که با افزایش اندازه دسته (Batch Size)، میزان افزایش سرعت کاهش مییابد. برای مثال، EAGLE در اندازه دسته ۱ به سرعت ۱.۹۶ برابری میرسد، اما در اندازه دسته ۱۲۸ این عدد به ۱.۲۱ کاهش مییابد.
این اتفاق به این دلیل رخ میدهد که همزمانی بالا، ظرفیت محاسباتی GPU را اشباع میکند. وقتی GPU از نظر محاسباتی اشباع شده باشد، دیگر ظرفیت بیکاری برای صرف کردن در گمانهزنی باقی نمیماند. در این محیطها، مرحله تأیید (Verification) غالب میشود و ۴۲ تا ۹۵ درصد زمان اجرا را به خود اختصاص میدهد.
علاوه بر این، نوع محتوا تعیینکننده موفقیت استراتژی است:
- ویرایش کد: در اینجا جستجوی ساده n-gram برنده است (۲ تا ۴ برابر سرعت) زیرا کدها بسیار تکراری هستند. یک اوراکل که استراتژیها را ترکیب کند، تئوریکاً میتواند به سرعت ۴.۹ برابری در کد برسد.
- نویسندگی خلاق: به دلیل ساختار غیرقابل پیشبینی و کمبود الگوهای تکراری، کمترین سود (۱ تا ۱.۳ برابر) را دارد.
- چت عمومی: مدل EAGLE-3 همچنان بهترین گزینه همهمنظوره برای مدلهای بالای ۷۰ میلیارد پارامتر است.
برای تیمهایی که از نسخههای ۲۰۲۶ vLLM استفاده میکنند، این قابلیت از طریق speculative_config فعال میشود. اپراتورهایی که بدون اندازهگیری نرخ پذیرش ترافیک خاص خود آن را فعال کردهاند، گزارش دادهاند که تأخیر در موارد خاص (Tail Latency) بدتر شده است، زیرا وقتی مدل پیشنویس بیش از حد شکست بخورد، گمانهزنی به یک شرط ضرر تبدیل میشود.
این چرخش نشان میدهد صنعت از ابزارهای پیشنویس مجزا به سمت مدلهایی میرود که ذاتاً چندتوکن پیشبینی میکنند. هدف، تبدیل چرخههای بیکار حافظه به توکنهای رایگان است و در واقع تبدیل یک محدودیت سختافزاری به یک پیروزی در عملکرد.
توسعهدهندگان اکنون باید نرخهای آلفای خاص خود را روی ترافیک تولیدی نظارت کنند تا متوجه شوند آیا گمانهزنی برای Use Case آنها سود خالص دارد یا خیر. همچنین منتظر ادغام بیشتر سرهای MTP در نسل بعدی مدلهای Open-weights باشید.
گام بعدی شما
- اگر از vLLM استفاده میکنید، نرخ پذیرش (α) را روی ترافیک واقعی خود اندازه بگیرید تا متوجه شوید آیا گمانهزنی برای Use Case شما سودآور است یا خیر.
- برای کارهای مربوط به کدنویسی، به جای مدلهای پیشنویس سنگین، از روشهای n-gram lookup استفاده کنید.
- در انتخاب مدلهای جدید، به وجود سرهای MTP (Multi-Token Prediction) به عنوان یک مزیت سختافزاری توجه کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو