پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه TokenSpeed سرعت استنتاج Qwen3.5 را به ۵۸۰ توکن در ثانیه رساند؟

·۶ خرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
اشتراک‌گذاری

اگر در حال استقرار مدل‌های هیبریدی عظیم برای وظایف پیچیده هستید، باید بدانید که گلوگاه واقعی شما قدرت محاسباتی خام نیست، بلکه نحوه جابه‌جایی تانسورها در حافظه است. موتور TokenSpeed به‌تازگی ثابت کرد که با تغییر رویکرد در مدیریت حافظه، می‌توان سرعت پاسخ‌دهی مدل‌های غول‌پیکر را به سطحی باورنکردنی رساند.

طبق گزارشی که در ۲۷ مه ۲۰۲۶ در وب‌سایت pytorch.org منتشر شد، این موتور توانسته است مدل Qwen3.5-397B-A17B را روی پردازنده‌های NVIDIA Blackwell به سرعت ۵۸۰ توکن در ثانیه (tps) برساند. این دستاورد از طریق حذف کپی‌های حافظه و اشباع کامل GPU با استفاده از اجرای هم‌زمان CPU-GPU حاصل شده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های وزن‌باز اشاره کردیم، مدل‌های عامل‌محور (Agentic) به‌دلیل نیاز به فراخوانی مکرر ابزارها و مدیریت تاریخچه‌های طولانی گفتگو، معمولاً با افت شدید سرعت در مرحله پیش‌پردازش (Prefill) مواجه می‌شوند. سری Qwen3.5 برای مقابله با این مشکل از یک معماری هیبریدی استفاده می‌کند که در آن توجه کامل (Full Attention) با توجه خطی شبکه دلتای گیت‌دار (GDN) ترکیب شده تا پیچیدگی محاسباتی در توالی‌های طولانی کاهش یابد.

برای بهینه‌سازی این پشته‌ی هیبریدی، TokenSpeed سه مکانیسم کلیدی را پیاده کرده است:

  • حافظه پیشوندی هیبریدی (Hybrid Prefix Caching): سیستمی دو لایه که در آن C++ تطبیق منطقی درخت رادیکس (Radix-tree) را مدیریت می‌کند و پایتون تانسورهای فیزیکی GPU را کنترل می‌کند تا وضعیت‌های Mamba به‌عنوان نقاط بازگشت (Checkpoints) پاک شناخته شوند.
  • جداسازی PD (PD Disaggregation): یک سیستم انتقال وضعیت یکپارچه با استفاده از RDMA برای جابه‌جایی وضعیت‌های Mamba و حافظه KV بین گره‌های پیش‌پردازش و رمزگشایی بدون نیاز به سریال‌سازی.
  • ادغام کرنل (Kernel Fusion): جایگزینی پنج کرنل متوالی برای QK-RMSNorm، RoPE و تقسیم گیت با یک تک-کرنل Triton که مقادیر میانی را در ثبات‌ها (Registers) نگه می‌دارد.

The Scheduler

new request flow

Attach checkpoint to tree

Chunked prefill

Decode overlap

Mamba Update

GDN Input Projector

این چرخش به سمت «غیرمستقیم‌سازی شاخص» (Index Indirection) برای به‌روزرسانی وضعیت Mamba — یعنی جابه‌جایی اشاره‌گرها به‌جای کپی کردن تانسورها — اساساً نحوه مدیریت رمزگشایی تخمینی (Speculative Decoding) را در مدل‌های توجه خطی تغییر می‌دهد. با کاهش فاز تأیید هدف به یک نوشتن عدد صحیح با پیچیدگی O(1)، ثابت شد که محدودیت مدل‌های هیبریدی عظیم، پهنای باند حافظه و سربار توزیع CPU است، نه قدرت پردازشی. نتیجه این است که نرخ انتقال داده در متن‌های طولانی (تا ۱ میلیون توکن) تنها ۱۶٪ نسبت به متن‌های ۱۲۸ هزار توکنی افت می‌کند.

Tokenspeed Decode Throughput

گام بعدی شما

  • بررسی مخزن گیت‌هاب بنیاد LightSeek برای استقرار بنچمارک‌های مذکور.
  • رصد انتشار Flash Attention 4 (FA4) که انتظار می‌رود پتانسیل محاسباتی معماری Blackwell را به‌طور کامل آزاد کند.
  • ارزیابی مدل‌های هیبریدی برای جایگزینی مدل‌های Dense در کاربردهای با پنجره متنی بسیار بلند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک بهتر لایه‌های سخت‌افزاری، به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در معماری سیستم‌های توزیع‌شده، هزینه و تأخیر استنتاج در عامل‌های هوش مصنوعی پیچیده را به‌شدت کاهش می‌دهد. در واقع، این دستاورد اعتبار معماری Blackwell را در مدیریت مدل‌های هیبریدی با مقیاس میلیاردها پارامتر تأیید می‌کند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.