پرش به محتوای اصلی
پرش به محتوای مقاله

DGX Spark: سرعت استنتاج Qwen3.5 به ۷۸ توکن در ثانیه رسید

·۲۷ تیر ۱۴۰۵۱۲ دقیقه مطالعه
مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: ارزیابی N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark
مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: ارزیابی N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تأیید عملی کارآمدی DFlash در رسیدن به ۷۸ توکن بر ثانیه برای مدل‌های ۱۲۰ میلیارد پارامتری؛ در حالی که روش‌های سنتی‌تر مانند N-Gram حتی نتوانستند از حالت پایه (Baseline) پیشی بگیرند.

اگر امروز از مدل‌های ۱۲۰ میلیارد پارامتری روی سخت‌افزار محلی استفاده می‌کنید، احتمالاً با گلوگاه‌های شدید سرعت مواجه هستید. اما رسیدن به ۷۸ توکن در ثانیه برای مدل Qwen3.5-122B روی یک دستگاه NVIDIA DGX Spark، نشان می‌دهد که دوران انتظار طولانی برای پاسخ‌های مدل‌های غول‌پیکر در حال پایان است.

این جهش خیره‌کننده از ۳۷ توکن در ثانیه (Baseline) به ۷۸ توکن، از طریق رمزگشایی گمانه‌زنانه (Speculative Decoding) — شبیه به دستیاری که جملات بعدی را حدس می‌زند و استاد فقط آن‌ها را تأیید می‌کند — به دست آمده است. طبق گزارش فنی منتشر شده در ۱۸ ژوئیه ۲۰۲۶، این روش هیچ آسیبی به کیفیت خروجی نمی‌زند؛ زیرا مدل اصلی هر توکن پیشنهادی را پیش از نهایی کردن، به‌صورت ریاضیاتی تأیید می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره امنیت مدل‌های بازمتن اشاره کردیم، بهینه‌سازی لایه‌های استنتاج همواره با چالش حفظ دقت همراه است. در حال حاضر، استقرار محلی هوش مصنوعی با یک گلوگاه شدید در پهنای باند حافظه روبروست. وقتی یک توکن تولید می‌شود، GPU باید ده‌ها گیگابایت وزن‌ها را از VRAM به واحدهای پردازشی منتقل کند و در این مدت، هسته‌های تانسور اغلب بیکار می‌مانند. رمزگشایی گمانه‌زنانه با استفاده از یک مدل «پیش‌نویس» کوچک، این مشکل را دور می‌زند.

بررسی چهار روش رمزگشایی

در این آزمایش‌ها از یک نقطه بازرسی ترکیبی Qwen3.5-122B-A10B-hybrid-int4-fp8 استفاده شد. این تنظیمات از Intel AutoRound INT4 برای خبره‌ها و FP8 برای لایه‌های مشترک استفاده می‌کند تا دقت مدل حفظ شود.

مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark

روش N-Gram برای تولید متن‌های آزاد عملاً شکست خورد. این روش با جست‌وجوی الگوهای تکراری در پنجره متنی (Context Window) — مثل میز کاری که فقط جا برای چند ورق کاغذ دارد — سعی در پیش‌بینی توکن‌ها داشت. نتیجه این شد که توان عملیاتی به ۲۴ تا ۳۰ توکن در ثانیه افت کرد و حتی از حالت پایه هم بدتر شد.

در مقابل، روش MTP (پیش‌بینی چند-توکنی) رویکردی یکپارچه دارد. MTP به‌جای مدل مجزا، از یک «سربال» (Head) سبک استفاده می‌کند که هم‌زمان با مدل اصلی آموزش دیده است. به نقل از مستندات فنی، چون این روش نمایش‌های داخلی مدل را به اشتراک می‌گذارد، نرخ پذیرش توکن‌ها به‌شدت بالاتر است.

مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark

آزمایش‌های MTP روی DGX Spark یک نقطه بهینه در حالت «دو توکن گمانه‌زن» (MTP-2) نشان داد. این پیکربندی میانگین ۴۹ توکن در ثانیه را ثبت کرد که حدود ۳۲٪ بهبود نسبت به حالت پایه است. با این حال، تلاش برای پیش‌بینی چهار توکن، نرخ خطا را بالا برد و سرعت را به ۳۴ توکن در ثانیه کاهش داد.

روش EAGLE3 مسیر متفاوتی را طی می‌کند و از یک پیش‌نویس مجزا استفاده می‌کند که بر اساس حالت‌های پنهان مدل هدف عمل می‌کند. در تست‌های مدل Qwen3-30B-A3B، این روش سرعت را ۲۰٪ افزایش داد و به ۳۸ تا ۴۰ توکن در ثانیه رسید.

مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark

اما تلاش برای تولید ۱۲ توکن با EAGLE3 منجر به سقوط شدید سرعت شد (۱۵ تا ۱۷ توکن بر ثانیه). نرخ پذیرش توکن‌ها به ۸ تا ۱۱ درصد رسید که ثابت می‌کند مدل‌های پیش‌نویس خودبازگشتی وقتی از مدل هدف فاصله می‌گیرند، عملکرد بدی دارند.

در نهایت، روش DFlash (رمزگشایی گمانه‌زنانه انتشار بلوکی) سعی می‌کند گلوگاه‌های سری را به‌طور کامل بشکند. DFlash به‌جای حدس زدن تک‌تک توکن‌ها، از یک مدل انتشار (Diffusion Model) — شبیه به نقاشی که ابتدا کلیت تصویر را می‌کشد و بعد جزئیات را می‌پروراند — برای تولید تا ۱۶ توکن در یک پاس واحد استفاده می‌کند.

مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark

این معماری موازی اجازه داد DFlash به رکورد ۷۸ توکن در ثانیه برسد. این رویکرد موازی‌سازی در استنتاج یادآور تلاشی است که DeepSeek برای کاهش تأخیر در نسل V4 خود به‌کار گرفت تا سرعت تولید توکن‌ها را بهینه کند. البته این عملکرد نوسانی است؛ DFlash در خروجی‌های ساختاریافته مثل JSON یا کد، بی‌رقیب است، اما در گفتگوهای عمومی ممکن است تا ۳۰ توکن در ثانیه افت کند، چون یک توکن رد شده در بلوک، تمام توکن‌های بعدی را باطل می‌کند.

مقایسه روش‌های تسریع تولید متن در سخت‌افزار محلی: N-Gram، MTP، EAGLE3 و DFlash روی NVIDIA DGX Spark

خلاصه عملکرد نهایی

  • Baseline: ۳۶ تا ۳۷ توکن در ثانیه
  • MTP-2: حدود ۴۹ توکن (پایدارترین حالت)
  • DFlash: پیک ۷۸ توکن (بهترین برای داده‌های ساختاریافته)
  • EAGLE3: ۲۰٪ بهبود نسبت به پایه
  • N-Gram: کمتر از ۳۱ توکن (ناکارآمد)

برای متخصصان، انتخاب متد به نوع عملیات بستگی دارد. MTP برای مدل‌هایی که با سر-پیش‌بینی بومی عرضه شده‌اند (مثل DeepSeek V3 یا Gemma 4) راحت‌ترین گزینه است. DFlash اما برنده مطلق برای عامل‌های کدنویسی و تسک‌های ریاضی است که ساختار نحوی پیش‌بینی‌پذیر دارند.

این جابه‌جایی ثابت می‌کند که بهینه‌سازی استنتاج (Inference) — یعنی همان لحظه تولید جواب توسط مدل — از کوانتش ساده به سمت «میان‌برهای معماری» در فرآیند رمزگشایی حرکت می‌کند. این روند تنها مختص مدل‌های متنی نیست و در مدل‌های بینایی-زبانی نیز شاهد کاهش تأخیر از طریق بهینه‌سازی‌های مشابه بوده‌ایم. با تخصصی‌تر شدن مدل‌های پیش‌نویس، شکاف بین سخت‌افزارهای محلی و استنتاج در مقیاس ابری کوچک‌تر خواهد شد.

گام بعدی شما

  • برای پیاده‌سازی این سرعت‌ها، دستورالعمل Albond برای نقاط بازرسی ترکیبی را بررسی کنید.
  • اگر روی توسعه ابزارهای کدنویسی کار می‌کنید، لایه‌های DFlash موجود در Hugging Face را تست کنید.
  • در انتخاب مدل، بررسی کنید آیا مدل مورد نظرتان از MTP native پشتیبانی می‌کند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این نتایج با تکیه بر اعتبار سخت‌افزاری NVIDIA DGX Spark ثابت می‌کند که محدودیت‌های سرعت در مدل‌های ۱۰۰+ میلیارد پارامتری بیشتر یک مشکل نرم‌افزاری (رمزگشایی) است تا سخت‌افزاری. این یعنی امکان اجرای مدل‌های سطح SOTA روی سرورهای محلی با سرعت کاربردی، بسیار نزدیک‌تر از آن است که تصور می‌شد.

تأثیر برای ایران

این دستاورد برای تیم‌های توسعه‌دهنده ایرانی که از مدل‌های باز-وزن (Open-Weights) روی سرورهای محدود استفاده می‌کنند، راهکاری برای کاهش هزینه و زمان استنتاج بدون نیاز به ارتقای سخت‌افزاری گران‌قیمت است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر DFlash نشان می‌دهد که آینده استنتاج در مدل‌های غول‌پیکر، در گروی گذار از تولید توکن-به-توکن به سمت تولید بلوکی است. این یعنی مدل‌های زبانی در حال تبدیل شدن به سیستم‌هایی هستند که به‌جای پیش‌بینی کلمه بعدی، «ساختار» پاسخ را در یک لحظه تجسم می‌کنند. این رویکرد به‌ویژه برای زبان‌های برنامه‌نویسی که قواعد سخت‌گیرانه‌ای دارند، یک جهش بهره‌وری ایجاد می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.