پرش به محتوای اصلی
پرش به محتوای مقاله

DFlash 2 توان عملیاتی مدل‌های زبانی را تا ۴.۶ برابر افزایش داد

·۲۹ مرداد ۱۴۰۵۱۱ دقیقه مطالعه
پیش‌نویس موازی DFlash 2: حفظ هم‌زمان چندین نسخه
پیش‌نویس موازی DFlash 2: حفظ هم‌زمان چندین نسخه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی لایه‌های سنگین ترنسفورمر با کانولوشن‌های محلی و انتخاب‌گر مسیر در مدل‌های پیش‌نویس؛ این یعنی افزایش سرعت بدون نیاز به افزایش عمق مدل یا تحمل تأخیر.

اگر امروز از مدل‌های زبانی برای برنامه‌ریزی‌های پیچیده یا اجرای عامل‌های خودکار استفاده می‌کنید، گلوگاه اصلی شما سرعت تولید توکن است. در حالی که رابط‌های چت در مقیاسی متوسط عمل می‌کنند، عصر عامل‌های هوش مصنوعی (Agent Era) نیازمند یک پشته استنتاج کاملاً متفاوت است تا بتواند مصرف عظیم توکن‌های مورد نیاز برای برنامه‌ریزی بلندمدت و استفاده از ابزارها را مدیریت کند. از آنجایی که عامل‌ها اغلب برای ساعت‌ها یا روزها در حال خواندن، برنامه‌ریزی و فراخوانی ابزارها هستند، هر توکنی که نیاز به یک گذر کامل پیشرو (Forward Pass) داشته باشد، یک گلوگاه بحرانی ایجاد می‌کند. این نیاز به بهینه‌سازی در مدل‌های عامل‌محور، هم‌زمان با پیشرفت‌های چشمگیری در توانایی‌های کدنویسی و استدلال است که در گزارش‌های اخیر DeepSeek درباره جهش بنچمارک‌های عامل‌های هوش مصنوعی به آن اشاره شده است.

به نقل از گزارش Inco AI، این شرکت برای رفع این مشکل، یک مکانیزم پیش‌نویس موازی (Parallel Drafting) جدید معرفی کرده است که توان عملیاتی مدل Qwen3.8-27B را به ۳.۴ برابر سرعت رمزگشایی استاندارد رسانده است. برای درک این موضوع باید ابتدا با رمزگشایی گمانه‌زنانه (Speculative Decoding) آشنا شویم؛ روشی که سال‌ها پاسخ صنعت به کندی استنتاج بوده است. در این ساختار، یک مدل کوچک «پیش‌نویس» (Draft Model) بلوکی از توکن‌ها را حدس می‌زند و یک مدل بزرگتر «هدف» (Target Model) کل بلوک را در یک گذر پیشرو تأیید می‌کند. اگر حدس‌ها درست باشند، سیستم چندین توکن را به قیمت یک گذر پردازشی تولید می‌کند؛ در غیر این صورت، حدس‌های اشتباه به سادگی دور ریخته می‌شوند. با این حال، برای سال‌ها، اکثر مدل‌های پیش‌نویس به‌صورت خودبازگشتی (Autoregressive) عمل می‌کردند و توکن‌ها را یکی‌یکی پیش‌بینی می‌کردند.

Inco AI اولین بار در ژانویه ۲۰۲۶ با معرفی DFlash این رویکرد را به چالش کشید و فرآیند پیش‌نویس را به یک طراحی موازی تک‌گذر تبدیل کرد که در آن کل بلوک و هر موقعیت به‌طور هم‌زمان پیش‌بینی می‌شوند. این نسخه اولیه به‌سرعت در موتورهای استنتاجی SGLang، vLLM، TensorRT-LLM و llama.cpp پذیرفته شد. تأثیر این فناوری فوری بود: NVIDIA توان عملیاتی تا ۱۵ برابر را روی پردازنده‌های Blackwell اندازه‌گیری کرد و گوگل رشد ۳ برابری توکن در ثانیه را روی TPUها گزارش کرد. همچنین، نقطه انتهایی تولیدی Kimi K2.7 Code در CoreWeave — که طبق داده‌های Artificial Analysis سریع‌ترین نسخه برای این مدل است — به‌طور پیش‌فرض از DFlash استفاده می‌کند. تا اوت ۲۰۲۶، مدل‌های DFlash بیش از ۳.۵ میلیون بار در Hugging Face دانلود شده‌اند و پیش‌نویس‌های رسمی توسط شرکت‌هایی چون Meta (مدل Muse Glimmer)، Poolside (مدل Laguna)، Xiaomi (مدل MiMo-V2.5-Pro) و NVIDIA (مدل Nemotron 3.5 Lightning) عرضه شده‌اند.

مکانیزم DFlash 2

در ۱۸ اوت ۲۰۲۶، نسخه‌ی DFlash 2 منتشر شد تا پیش‌نویس موازی را فراتر ببرد. این مدل خروجی هر مرحله‌ی تأیید را بیش از ۲۰٪ افزایش می‌دهد، در حالی که تأخیر چرخه تنها حدود ۱٪ زیاد شده است و ثابت شده که خروجی نهایی بدون تغییر باقی می‌ماند. در بنچمارک‌های مختلف، این بهبود بین ۱۶ تا ۲۵٪ متغیر است.

برای حل مشکل انسجام (Coherence)، Inco AI ابزاری به نام «انتخاب‌گر مسیر سبک‌وزن» (Lightweight Path Selector) معرفی کرد. در DFlash استاندارد، هر موقعیت در یک بلوک به‌طور مستقل پیش‌بینی می‌شود. اگرچه هر انتخاب به‌تنهایی محتمل است، اما چیزی وجود ندارد که آن‌ها را با هم هماهنگ کند. این امر اغلب منجر به توالی‌های ناهماهنگ می‌شود — مثلاً تکرار یک کلمه دو بار — که سپس در مرحله تأیید حذف می‌شوند.

روش‌های اخیر مانند Domino و DSpark سعی می‌کنند با استفاده از سرهای متوالی (Sequential Heads) که توزیع کل واژگان را برای هر موقعیت بازنویسی می‌کنند، انسجام را به دست آورند. اما Inco AI دریافت که این اصلاحات خودبازگشتی هزینه‌بر و غیرضروری هستند. شواهد حاصل از لیست کاندیداهای DFlash نشان داد در حالی که انتخاب اول در موقعیت نخست ۸۵.۴٪ مواقع درست است، اما توکن صحیح در ۹۹.۵٪ مواقع در بین ۱۶ کاندیدای برتر قرار دارد. این شکاف به عنوان «حاشیه انتخاب» (Selection Headroom) شناخته می‌شود.

جزئیات انتخاب مسیر

  • مکانیزم: انتخاب‌گر، ۱۶ کاندیدای برتر را در هر موقعیت نگه می‌دارد و هر جفت متوالی را امتیازدهی می‌کند. برای یک توکن پیشین a و کاندیدای فعلی b، امتیاز به صورت $S_t(a,b)=U_t(b)+\langle A(a)\odot H(h_t),B(b)\rangle$ محاسبه می‌شود.
  • اجزای امتیازدهی: این امتیاز، لوجیت خود DFlash ($U_t(b)$) را با تطابق بین جاسازی‌های (Embeddings) فشرده ۲۵۶ بعدی ($A$ و $B$) تحت یک گیت زمینه‌ای $H(h_t)$ ترکیب می‌کند.
  • کارایی: این یک توجه دوخطی (Bilinear Attention) کم‌رتبه روی کاندیداهای مجاور است. امتیازدهی کاملاً موازی باقی می‌ماند و نیازی به گذر اضافی از بدنه مدل یا LM-head نیست.
  • گشت نهایی: تنها بخش متوالی، یک گشت حریصانه (Greedy Walk) نهایی (یا نمونه‌برداری/نمونه‌برداری ردکننده) روی امتیازات پیش‌محاسبه شده برای یافتن بهترین مسیر است.
  • معیارهای بازیابی (Recall): در مدل Qwen3-4B پنج لایه‌ای روی مجموعه GSM8K، مقدار Recall@1 از ۸۵.۴٪ در موقعیت ۰ به ۷۲.۹٪ در موقعیت ۶ کاهش می‌یابد. با این حال، Recall@16 بالا می‌ماند و از ۹۹.۵٪ به ۸۷.۸٪ در همان بازه می‌رسد.
  • پتانسیل اوراکل: اگر یک «اوراکل» (پیش‌بین مطلق) کاندیدای درست را از بین ۱۶ مورد انتخاب می‌کرد، طول پذیرش از ۴.۲۷ به ۶.۷۹ افزایش می‌یافت.

طبق گزارش inco.ai، این فرآیند انتخاب به‌طور قابل‌توجهی بهینه‌تر از DSpark است. در تست‌های مدل Qwen3-4B روی GSM8K، انتخاب مسیر تنها ۲ میلیون پارامتر و ۰.۶٪ تأخیر اضافه کرد، در حالی که اصلاح DSpark باعث افزودن ۷۷.۸ میلیون پارامتر و ۹.۶٪ تأخیر شد. این انتخاب‌گر، طول پذیرش را در T=0 به اندازه ۰.۳۴ توکن و در T=1 به اندازه ۰.۴۷ توکن بهبود بخشید.

حل مشکل زوال پسوند (Suffix Decay)

تیم تحقیق همچنین پدیده‌ای به نام «زوال پسوند» را شناسایی کرد؛ وضعیتی که در آن دقت پیش‌بینی با نزدیک شدن بلوک به انتها کاهش می‌یابد. در مدل Qwen3-4B پنج لایه‌ای روی GSM8K، دقت از ۹۹.۵٪ در اولین موقعیت به ۸۷.۸٪ در آخرین موقعیت می‌رسد. حتی یک اوراکل که همیشه کاندیدای درست را از بین ۱۶ مورد انتخاب می‌کند نیز نمی‌تواند این مشکل را حل کند، زیرا خود کاندیداها در انتهای بلوک تمام می‌شوند.

Inco AI دریافت که افزایش عمق مدل در موقعیت‌های انتهایی کمک می‌کند اما این کمک غیرمنتقادانه است. برای مثال، یک مدل DFlash ۱۵ لایه‌ای (با ۳ برابر پارامتر بیشتر)، دقت را در انتهای بلوک بهبود می‌بخشد اما جریمه تأخیری ۱۵.۲ درصدی تحمیل می‌کند. تحلیل سرهای توجه نشان داد که سهم توجه بلوک از ۳۰٪ در لایه ۱ به ۸٪ در لایه ۵ کاهش می‌یابد و در چند سر متمرکز می‌شود. این نشان داد که مدل در ایجاد تعادل بین خواندن زمینه (Context) و مدل‌سازی وابستگی‌های داخلی بلوک دچار مشکل است.

جزئیات کانولوشن محلی

  • عملگر: برای رفع این مشکل، Inco AI یک «کانولوشن محلی سبک‌وزن» (Lightweight Local Convolution) پیاده کرد. این یک کانولوشن عمقی پویا با دو تپ (Two-tap) است: $\operatorname{Conv}{k}(x)t =k{t,0}\odot x_t+k{t,1}\odot x_{t-1}$.
  • پیاده‌سازی: این کانولوشن‌ها قبل و بعد از هر زیرلایه توجه (Attention) و پیش‌رو (Feed-forward) قرار می‌گیرند. هر ضریب از یک هسته پایه یادگرفته شده با یک اصلاح کوچک که از حالت پنهان (Hidden State) محاسبه می‌شود، استفاده می‌کند (یک اصلاح برای هر ۱۶ کانال).
  • جریان داده: اولین موقعیت، نمایش آخرین توکن تأیید شده را می‌خواند و موقعیت‌های بعدی، پیش‌نیاز خود را می‌خوانند. این امر اجازه می‌دهد اطلاعات در بلوک جابجا شوند در حالی که محاسبات موازی حفظ می‌شود.
  • تأثیر: با افزودن تنها ۱۶.۵ میلیون پارامتر (۳٪ افزایش)، مدل DFlash کانولوشنی تقریباً با عملکرد مدل ۱۵ لایه‌ای برابری می‌کند، در حالی که تنها ۰.۷٪ به تأخیر چرخه می‌افزاید.
  • تغییر توجه: کانولوشن کارهای محلی را جذب می‌کند و میانگین توجه درون-بلوکی در لایه‌های ۴ و ۵ را از ۹.۴٪ به ۰.۵٪ کاهش می‌دهد و مکانیسم توجه را آزاد می‌کند تا بر زمینه گسترده‌تر تمرکز کند.
  • مقایسه با عمق: یک هسته که تنها به یک موقعیت قبل بازمی‌گردد، بیشتر آنچه را که ۱۰ لایه اضافی فراهم می‌کردند بازیابی می‌کند؛ این ثابت می‌کند زوال پسوند اساساً یک مشکل محلی است.

عملکرد در بنچمارک‌ها

در چندین محک عملکردی، DFlash 2 به‌طور مداوم از هر دو روش MTP (پیش‌بینی چند توکنی) و پیش‌نویس‌های جامعه DSpark پیشی گرفته است. در مدل Qwen3.5-4B، میانگین طول پذیرش به ۵.۹۷ توکن رسید، در حالی که این مقدار برای DSpark برابر ۵.۴۹ و برای DFlash اولیه ۴.۹۲ بود. این نشان‌دهنده ۲۱٪ بهبود نسبت به DFlash و برتری ۰.۴۸ توکنی نسبت به DSpark است.

جزئیات عملکرد Qwen3.5-4B در مجموعه‌های داده:

  • GSM8K: مدل DFlash 2 (۶.۲۰) در مقابل DSpark (۵.۶۹) و DFlash (۴.۹۹).
  • MATH-500: مدل DFlash 2 (۶.۷۶) در مقابل DSpark (۶.۲۰) و DFlash (۵.۴۲).
  • HumanEval: مدل DFlash 2 (۶.۲۸) در مقابل DSpark (۵.۸۰) و DFlash (۵.۴۳).
  • MBPP: مدل DFlash 2 (۵.۴۱) در مقابل DSpark (۴.۹۶) و DFlash (۴.۴۹).
  • MT-Bench: مدل DFlash 2 (۵.۲۰) در مقابل DSpark (۴.۷۷) و DFlash (۴.۲۶).

بهره‌های خاص مدل‌ها شامل موارد زیر است:

  • Qwen3.8-27B: در اندازه دسته (Batch Size) ۱، به ۲.۷ تا ۳.۴ برابر توان عملیاتی رمزگشایی خودبازگشتی دست می‌یابد. در GSM8K، به میانگین طول پذیرش ۵.۴۶ می‌رسد و MTP (۵.۰۲) و DSpark (۴.۳۶) را شکست می‌دهد. در MATH-500، عدد ۵.۲۸ را در مقابل ۴.۷۲ برای MTP ثبت می‌کند. این بهینه‌سازی در مدل‌های میان‌رده، یادآور موفقیت‌های اخیر در مهندسی مدل‌های بازمتن است که در رقابت مدل‌های Fusion-MoA با غول‌های تک‌سازه مشاهده شد و نشان داد مدل‌های کوچک‌تر می‌توانند با معماری درست، عملکرد مدل‌های عظیم را به چالش بکشند.
  • Muse Glimmer: به ۳.۱ تا ۴.۶ برابر توان عملیاتی رمزگشایی خودبازگشتی می‌رسد. میانگین طول پذیرش آن ۵.۷۰ است که به‌طور قابل‌توجهی از پیش‌نویس رسمی DFlash (۴.۴۴) و DSpark (۴.۴۸) بالاتر است. در HumanEval، مقدار ۵.۶۶ را در مقابل ۴.۱۱ برای DFlash ثبت می‌کند.
  • MATH-500: مدل DFlash 2 نرخ پذیرش شرطی پایداری نزدیک به ۸۶٪ را در کل بلوک (تا موقعیت ۱۴) حفظ می‌کند، در حالی که مدل‌های پایه در انتها ۶ تا ۹ امتیاز افت می‌کنند.

استقرار و یکپارچه‌سازی

DFlash 2 برای یکپارچه‌سازی در موتورهای استنتاج جریان اصلی در دسترس است. کاربران می‌توانند آن را از طریق SGLang با دستور زیر پیاده کنند:
python -m sglang.launch_server --model-path Qwen/Qwen3.8-27B --speculative-algorithm DFLASH --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 --speculative-num-draft-tokens 8

این سیستم همچنین در vLLM از طریق یک Pull Request خاص (PR 52816) با استفاده از پیکربندی گمانه‌زنانه با num_speculative_tokens: 7 و مدل incoai/Qwen3.8-27B-DFlash2 پشتیبانی می‌شود.

برای llama.cpp، کاربران می‌توانند به PR 27342 سوییچ کرده و از فلگ --spec-type draft-dflash استفاده کنند. مثال برای Apple Silicon:
./build/bin/llama-server -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M --spec-type draft-dflash --spec-draft-n-max 7

برای کاربران Apple Silicon، این سیستم از طریق oMLX پشتیبانی می‌شود. کاربران می‌توانند mlx-community/Qwen3.8-27B-4bit و incoai/Qwen3.8-27B-DFlash2 را دانلود کرده و سپس Model Manager را با فعال کردن DFlash، فعال‌سازی کوانتیزاسیون پیش‌نویس و اندازه بلوک زمان اجرا ۵ پیکربندی کنند.

تحلیل تحریریه

این به‌روزرسانی نشان‌دهنده تغییری در نگاه صنعت به مفهوم «پیش‌نویس» در رمزگشایی گمانه‌زنانه است. برای سال‌ها، مدل پیش‌نویس به عنوان نسخه‌ای مینیاتوری از مدل هدف در نظر گرفته می‌شد و ماهیت متوالی آن را به ارث می‌برد. Inco AI ثابت می‌کند که فرآیند پیش‌نویس کاملاً مسئله متفاوتی است — مسئله‌ای مربوط به تطبیق الگو و انسجام محلی، نه تولید در مقیاس کامل.

با جایگزینی لایه‌های سنگین ترنسفورمر با کانولوشن‌های سبک‌وزن و یک انتخاب‌گر مسیر، Inco AI هزینه پیش‌نویس را از کیفیت خروجی جدا کرده است. این موضوع به‌ویژه برای جریان‌های کاری عامل‌محور (Agentic Workflows) که مدل‌ها ساعت‌ها در حلقه‌های «تفکر» سپری می‌کنند، حیاتی است. کاهش هزینه محاسباتی هر توکن به میزان تقریباً یک‌سوم بدون تغییر در خروجی نهایی، یک پیروزی بزرگ برای اقتصاد عامل‌های هوش مصنوعی است.

گام‌های بعدی

توسعه‌دهندگانی که مدل‌های Qwen یا Meta را اجرا می‌کنند، باید پیش‌نویس‌های جدید DFlash 2 را در Hugging Face تست کنند تا افزایش واقعی توان عملیاتی را در ورک‌لودهای تولیدی خود بسنجند. مرز بعدی احتمالاً این خواهد بود که آیا این تکنیک‌های پیش‌نویس موازی را می‌توان برای مدل‌های چندوجهی به کار برد تا تولید توکن‌های تصویر یا ویدیو را تسریع کرد یا خیر.

چرا این موضوع مهم است؟

این فناوری با کاهش چشمگیر هزینه‌ی استنتاج، اجرای عامل‌های هوش مصنوعی در مقیاس صنعتی را ممکن می‌کند. اعتبار این ادعا با پذیرش گسترده در موتورهای vLLM و SGLang و تایید NVIDIA به اثبات رسیده است.

تأثیر برای ایران

توسعه‌دهندگان ایرانی که از مدل‌های بازمتن (Open Weights) روی سخت‌افزارهای محدود استفاده می‌کنند، می‌توانند با جایگزینی DFlash 2 در llama.cpp، سرعت استنتاج را بدون نیاز به ارتقای GPU افزایش دهند.

·نگاه ما
تحریریه دات‌هوش

جدا کردن هزینه‌ی پیش‌نویس از کیفیت خروجی، پارادایم رمزگشایی را تغییر می‌دهد. Inco AI ثابت کرد که پیش‌نویس نیاز به یک مدل زبانی کوچک‌تر ندارد، بلکه به یک سیستم تطبیق الگو و انسجام محلی نیاز دارد. این رویکرد، اقتصاد اجرای عامل‌های AI را به‌طور بنیادی تغییر می‌دهد چون هزینه‌ی محاسباتی هر توکن در حلقه‌های تفکر طولانی را تا یک‌سوم کاهش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.