پرش به محتوای اصلی
پرش به محتوای مقاله

«بدون کاهش کیفیت»؛ بهینه‌سازی زمان پاسخ‌دهی در حجم‌های پردازشی پایین

·۱۶ مهر ۱۴۰۵۵ دقیقه مطالعه
تولید متن توکن‌به‌توکن در مدل‌های زبانی بزرگ: راهکارهایی برای افزایش سرعت و کارایی
تولید متن توکن‌به‌توکن در مدل‌های زبانی بزرگ: راهکارهایی برای افزایش سرعت و کارایی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از مدل‌های پیش‌نویس مجزا (Separate Draft Models) به پیش‌بینی بومی در معماری مدل (Native MTP) که نرخ پذیرش توکن‌ها را به شدت افزایش داده است.

اگر امروز برای استنتاج مدل‌های ۷۰ میلیارد پارامتری هزینه می‌پردازید، احتمالاً نیمی از توان پردازشی شما صرف انتظار برای جابه‌جایی داده‌ها شده است، نه محاسبات واقعی. یک گذر پیشرو (Forward Pass) در یک مدل ۷۰ میلیاردی، چه برای تولید یک توکن باشد و چه برای تأیید پنج توکن، هزینه یکسانی دارد. هر توکن تولید شده مستلزم بارگذاری ۷۰ میلیارد پارامتر از حافظه، ضرب آن‌ها و سپس دور ریختن آن‌هاست تا این فرآیند برای توکن بعدی تکرار شود. رمزگشایی گمانه‌زنانه (Speculative Decoding) این ناکارآمدی را هدف قرار داده تا تأخیر استنتاج را بدون کوچک‌ترین افت در کیفیت خروجی، ۲ تا ۵ برابر کاهش دهد.

بیشتر مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — با محدودیت حافظه (Memory-bound) مواجه‌اند. به این معنا که واحد پردازش گرافیکی (GPU) زمان بیشتری را صرف انتقال وزن‌ها از حافظه پهنای‌باند بالا (HBM) می‌کند تا انجام عملیات ریاضی. این وضعیت باعث می‌شود واحدهای محاسباتی GPU در حالی که مدل توکن‌ها را یکی‌یکی تایپ می‌کند، بیکار بمانند. این چالش در واقع همان گلوگاه پهنای‌باند حافظه است که مانع اصلی مقیاس‌دهی سنتی در مدل‌های زبانی محسوب می‌شود. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی خروجی‌های ساختاریافته با ابزارهایی مثل coerce-json اشاره کردیم، رمزگشایی گمانه‌زنانه مستقیماً فیزیک تولید توکن را هدف قرار می‌دهد.

تصور کنید در یک آزمون، شما ۵ کلمه را می‌نویسید و هم‌زمان به معلم می‌دهید تا همه را یک‌جا تصحیح کند؛ معلم کلماتی را که با آن‌ها موافق است نگه می‌دارد و شما فقط اولین اشتباه را اصلاح می‌کنید. طبق مستندات فنی، این دقیقاً سازوکار رمزگشایی گمانه‌زنانه است: یک مدل پیش‌نویس (Draft Model) ارزان‌قیمت، تعداد K توکن را پیشنهاد می‌دهد و مدل هدف آن‌ها را در یک گذر موازی تأیید می‌کند. از آنجا که بررسی موازی توکن‌ها پس از بارگذاری وزن‌ها تقریباً رایگان است، مدل هدف می‌تواند کل توالی پیش‌نویس را یک‌باره اعتبارسنجی کند.

مکانیسم پذیرش

این سیستم بر اساس یک قانون پذیرش مشخص مبتنی بر نمونه‌گیری رد (Rejection Sampling) کتابخانه‌ای عمل می‌کند. به نقل از منابع پژوهشی، وقتی مدل پیش‌نویس توکنی مانند d را پیشنهاد می‌دهد، مدل هدف آن را با احتمالی برابر با min(1, q(d)/p(d)) می‌پذیرد. این عدد در واقع نسبت احتمال توکن از دیدگاه مدل هدف در مقابل تخمین مدل پیش‌نویس است.

اگر پیش‌نویس اشتباه باشد، مدل هدف به سادگی توکن را رد کرده، توکن صحیح را از توزیع باقی‌مانده نمونه‌برداری می‌کند و به مسیر خود ادامه می‌دهد. این سازوکار تضمین می‌کند که توزیع نهایی خروجی دقیقاً (bit-for-bit) مشابه مدل اصلی باشد. یک پیش‌نویس بد نمی‌تواند کیفیت خروجی را تخریب کند؛ بلکه فقط سرعت سیستم را به حالت عادی برمی‌گرداند.

دو متغیر اصلی سرعت واقعی را تعیین می‌کنند:

  • آلفا (α): نرخ پذیرش یا کسری از توکن‌های پیش‌نویس که مدل هدف می‌پذیرد. این متغیر، معیار اصلی کل این حوزه است.
  • N: طول پیش‌نویس یا تعداد توکن‌هایی که در هر دور گمانه‌زنی می‌شوند.

تعداد توکن‌های مورد انتظار که در هر گذر پیشرو مدل هدف ذخیره می‌شوند، با فرمول E[accepted] = (1 − α^(N+1)) / (1 − α) محاسبه می‌شود. برای مثال، با نرخ پذیرش ۰.۸ و طول پیش‌نویس ۵، انتظار می‌رود در هر گذر حدود ۳.۴ توکن تأیید شوند. اگر با یک مدل پیش‌نویس باکیفیت، آلفا به ۰.۹۵ و N به ۸ برسد، افزایش سرعت می‌تواند به مرز ۵ برابر نزدیک شود.

تکامل پیش‌نویس‌ها (۲۰۲۳–۲۰۲۶)

صنعت برای افزایش نرخ پذیرش (α) از سه دوره متمایز عبور کرده است:

  • رمزگشایی گمانه‌زنانه ساده (۲۰۲۳): در این دوره از یک مدل کوچک‌تر از همان خانواده استفاده می‌شد (مثلاً یک مدل ۱ میلیارد پارامتری برای پیش‌نویس مدل ۷۰ میلیارد پارامتری). این روش معمولاً نرخ پذیرش α ≈ 0.6 و سرعت حدود ۲ برابری داشت. محدودیت اصلی این بود که حدس‌های مدل کوچک بیش از حد با مدل بزرگ فاصله می‌گرفت.
  • EAGLE و EAGLE-3 (۲۰۲۴-۲۰۲۵): به جای مدل مجزا، EAGLE از یک سر پیش‌نویس (Draft Head) بسیار کوچک (یک یا دو لایه ترنسفورمر) استفاده می‌کند که حالت‌های پنهان (Hidden States) لایه آخر مدل هدف را می‌خواند. چون این مدل نمایش داخلی هدف را می‌بیند، توزیع آن بسیار نزدیک‌تر به هدف است و آلفا را به ۰.۶ تا ۰.۸ می‌رساند. مقاله EAGLE گزارش می‌دهد که در مدل‌های چت ۷۰ میلیاردی، تأخیر ۲.۷ تا ۳.۵ برابر کاهش یافته است. EAGLE-3 با پیش‌بینی‌های دورتر و مدیریت بهتر عدم قطعیت، این وضعیت را بهبود بخشید؛ مستندات رسمی NVIDIA آن را ۲ تا ۳ برابر سریع‌تر از رمزگشایی ساده می‌دانند و تست‌های شخص ثالث نشان می‌دهد که در اندازه دسته‌های کوچک (Low Batch Sizes)، ۱۵ تا ۲۵ درصد سریع‌تر از EAGLE-2 و Medusa-2 در تولید توکن بر ثانیه است.
  • پیش‌بینی بومی چندتوکنی (۲۰۲۶): جدیدترین مرز، ادغام پیش‌بینی در خود معماری است. مدل‌هایی مثل Gemma 4 MTP، DSpark و DFlash با سرهای MTP داخلی عرضه شده‌اند. یک بنچمارک در سال ۲۰۲۶ نشان داد که DFlash در آزمون MATH500 برای یک مدل با ۲۶ میلیارد پارامتر فعال، به سرعت ۲.۸۷ برابری رسید، در حالی که Kimi-K2.5 به ۲.۶۸ برابر و یک مدل با ۱۲۲ میلیارد پارامتر فعال در حالت MTP بومی به ۲.۲۰ برابر دست یافتند. این رویکرد در واقع پاسخی به این مسئله است که تولید متن به‌جای تصمیم‌گیری، مانع اصلی سرعت در معماری‌های فعلی AI است.

واقعیت‌های تولید و محدودیت‌ها

در حالی که مقالات پژوهشی دستاوردهای عظیمی را گزارش می‌کنند، نتایج دنیای واقعی بسته به حجم کاری (Workload) متفاوت است. یک بنچمارک سیستماتیک در سال ۲۰۲۶ روی vLLM (که پنج روش، چهار مدل و شش حجم کاری مختلف را تست کرد) فاش کرد که با افزایش اندازه دسته (Batch Size)، میزان افزایش سرعت کاهش می‌یابد. برای مثال، EAGLE در اندازه دسته ۱ به سرعت ۱.۹۶ برابری می‌رسد، اما در اندازه دسته ۱۲۸ این عدد به ۱.۲۱ کاهش می‌یابد.

این اتفاق به این دلیل رخ می‌دهد که هم‌زمانی بالا، ظرفیت محاسباتی GPU را اشباع می‌کند. وقتی GPU از نظر محاسباتی اشباع شده باشد، دیگر ظرفیت بیکاری برای صرف کردن در گمانه‌زنی باقی نمی‌ماند. در این محیط‌ها، مرحله تأیید (Verification) غالب می‌شود و ۴۲ تا ۹۵ درصد زمان اجرا را به خود اختصاص می‌دهد.

علاوه بر این، نوع محتوا تعیین‌کننده موفقیت استراتژی است:

  • ویرایش کد: در اینجا جستجوی ساده n-gram برنده است (۲ تا ۴ برابر سرعت) زیرا کدها بسیار تکراری هستند. یک اوراکل که استراتژی‌ها را ترکیب کند، تئوریکاً می‌تواند به سرعت ۴.۹ برابری در کد برسد.
  • نویسندگی خلاق: به دلیل ساختار غیرقابل پیش‌بینی و کمبود الگوهای تکراری، کمترین سود (۱ تا ۱.۳ برابر) را دارد.
  • چت عمومی: مدل EAGLE-3 همچنان بهترین گزینه همه‌منظوره برای مدل‌های بالای ۷۰ میلیارد پارامتر است.

برای تیم‌هایی که از نسخه‌های ۲۰۲۶ vLLM استفاده می‌کنند، این قابلیت از طریق speculative_config فعال می‌شود. اپراتورهایی که بدون اندازه‌گیری نرخ پذیرش ترافیک خاص خود آن را فعال کرده‌اند، گزارش داده‌اند که تأخیر در موارد خاص (Tail Latency) بدتر شده است، زیرا وقتی مدل پیش‌نویس بیش از حد شکست بخورد، گمانه‌زنی به یک شرط ضرر تبدیل می‌شود.

این چرخش نشان می‌دهد صنعت از ابزارهای پیش‌نویس مجزا به سمت مدل‌هایی می‌رود که ذاتاً چندتوکن پیش‌بینی می‌کنند. هدف، تبدیل چرخه‌های بیکار حافظه به توکن‌های رایگان است و در واقع تبدیل یک محدودیت سخت‌افزاری به یک پیروزی در عملکرد.

توسعه‌دهندگان اکنون باید نرخ‌های آلفای خاص خود را روی ترافیک تولیدی نظارت کنند تا متوجه شوند آیا گمانه‌زنی برای Use Case آن‌ها سود خالص دارد یا خیر. همچنین منتظر ادغام بیشتر سرهای MTP در نسل بعدی مدل‌های Open-weights باشید.

گام بعدی شما

  • اگر از vLLM استفاده می‌کنید، نرخ پذیرش (α) را روی ترافیک واقعی خود اندازه بگیرید تا متوجه شوید آیا گمانه‌زنی برای Use Case شما سودآور است یا خیر.
  • برای کارهای مربوط به کدنویسی، به جای مدل‌های پیش‌نویس سنگین، از روش‌های n-gram lookup استفاده کنید.
  • در انتخاب مدل‌های جدید، به وجود سرهای MTP (Multi-Token Prediction) به عنوان یک مزیت سخت‌افزاری توجه کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تکنیک با کاهش هزینه‌های استنتاج و تأخیر، امکان استقرار مدل‌های بسیار بزرگ را در کاربردهای بلادرنگ (Real-time) فراهم می‌کند. اعتبار این روش از طریق بنچمارک‌های vLLM و نتایج عملیاتی مدل‌های Gemma 4 تأیید شده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت منابع GPU مواجه‌اند، فعال‌سازی این قابلیت در vLLM می‌تواند بدون نیاز به ارتقای سخت‌افزار، سرعت پاسخ‌دهی سرویس‌هایشان را تا ۲ برابر افزایش دهد.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت بر پیش‌بینی بومی (Native MTP) نشان می‌دهد که بهینه‌سازی‌های نرم‌افزاری دیگر برای غلبه بر گلوگاه حافظه کافی نیستند. این تغییر رویکرد، مدل‌های زبانی را از «تولید توکن به توکن» به سمت «تولید بلوکی» سوق می‌دهد که در نهایت منجر به بازنگری در معماری‌های ترنسفورمر برای بهره‌وری بیشتر از GPU می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.