پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش vLLM: افزایش ۲ برابری سرعت تولید متن در مدل Kimi K2.6 با EAGLE 3.1

·۵ خرداد ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
اشتراک‌گذاری

اگر در حال مقیاس‌بندی استنتاج (Inference) هستید — یعنی همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش — سرعت خروجی شما در برخی پردازش‌ها همین حالا دو برابر شده است. باید بدانید که گلوگاه اصلی هوش مصنوعی در محیط عملیاتی، سرعت تولید توکن‌هاست.

طبق گزارش vllm.ai، تیم vLLM در ۲۶ مه ۲۰۲۶ ابزار EAGLE 3.1 را منتشر کرد. این ابزار برای مدل زبانی بزرگ (LLM) است؛ مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد. این سیستم از روش «رمزگشایی پیش‌بین» (Speculative Decoding) استفاده می‌کند؛ شبیه کسی که جملات را پیش‌بینی می‌کند تا سریع‌تر بخواند. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش هزینه‌های توکن اشاره کردیم، صنعت اکنون روی بهینه‌سازی مرحله‌ی تولید متمرکز شده است.

مشکل اصلی در متون طولانی، پدیده‌ای به نام «لغزش توجه» (Attention Drift) است. در این حالت، مدل پیش‌بین توکن‌های کلیدی را نادیده می‌گیرد. EAGLE 3.1 برای حل این مشکل دو تغییر ساختاری ایجاد کرد:

  • اعمال نرمال‌سازی FC پس از هر حالت پنهان هدف.
  • تزریق حالت‌های پنهان پس از نرمال‌سازی به مرحله‌ی رمزگشایی بعدی.

Figure 1: EAGLE 3 vs. EAGLE 3.1 architecture comparison. EAGLE 3.1 adds FC normalization after each target hidden state and feeds post-norm hidden states into the next decoding step.

این به‌روزرسانی اکنون به صورت یک افزونه در vLLM در دسترس است. بر اساس مستندات این تیم، مدل پیش‌بین Kimi K2.6 روی سخت‌افزار GB200 به نتایج زیر رسید:

  • افزایش ۲.۰۳ برابری سرعت در حالت تک‌کاربر (Concurrency 1).
  • افزایش ۱.۶۶ برابری سرعت در حالت ۱۶ کاربر هم‌زمان.

Figure 2: Per-user output throughput (TPS) on Kimi-K2.6-NVFP4 with vLLM, TP=4, GB200 on SPEED-Bench coding. EAGLE 3.1-MLA vs. no-spec baseline.

این تغییر، نگاه ما به مدل‌های پیش‌بین را عوض می‌کند. طراحی جدید باعث می‌شود فرآیند تولید شبیه به یک «فراخوانی بازگشتی» (Recursive Call) عمل کند. برای توسعه‌دهندگان، این یعنی مدل‌ها در برابر تغییر قالب‌های چت و متون طولانی مقاوم‌تر شده‌اند. دیگر نیازی نیست برای هر دستور سیستمی جدید، مدل را دوباره آموزش دهید.

گام بعدی شما

  • مدل پیش‌بین Kimi K2.6 را از Hugging Face دریافت کنید.
  • کتابخانه vLLM را به نسخه v0.22.0 به‌روزرسانی کنید.
  • نرخ خروجی (Throughput) را در مجموعه‌های داده‌ی کدنویسی بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت به دلیل تخصص تیم vLLM در بهینه‌سازی لایه‌ی استنتاج، هزینه‌ی عملیاتی مدل‌های زبانی را برای سازمان‌ها به‌شدت کاهش می‌دهد. دو برابر شدن سرعت خروجی یعنی بهره‌وری حداکثری از سخت‌افزارهای گران‌قیمت مانند GB200.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.