پرش به محتوای اصلی
پرش به محتوای مقاله

مدل DiffusionGemma سرعت تولید متن را به ۱۰۰۰ توکن در ثانیه رساند

·۲۵ تیر ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
راهنمای توسعه‌دهندگان DiffusionGemma: مدل زبانی برای درک تصاویر تولیدی هوش مصنوعی
راهنمای توسعه‌دهندگان DiffusionGemma: مدل زبانی برای درک تصاویر تولیدی هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین از معماری خودبازگشتی (Sequential) به انتشار موازی (Parallel Diffusion) برای تولید متن که اجازه می‌دهد مدل هم‌زمان بر روی کل بلوک متنی فکر کرده و خطاهای قبلی را اصلاح کند.

یک پردازنده گرافیکی NVIDIA H100 اکنون می‌تواند بیش از ۱۰۰۰ توکن در ثانیه تولید کند. این جهش خیره‌کننده مدیون DiffusionGemma است؛ مدل آزمایشی گوگل که روش سنتی تولید تک‌تک کلمات را کنار گذاشته و متن را به‌صورت بلوکی و موازی پردازش می‌کند. با این روش، سقف عملکرد برای سرویس‌دهی محلی به مدل‌های هوش مصنوعی بازتعریف شده است. حتی روی سخت‌افزارهای مصرف‌کننده، مانند کارت گرافیک NVIDIA GeForce RTX 5090، این سیستم می‌تواند سرعت تولید را به بیش از ۷۰۰ توکن در ثانیه برساند.

بیشتر مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — با محدودیت پهنای باند حافظه دست‌وپنجه نرم می‌کنند. در مدل‌های فعلی، برای پیش‌بینی هر توکن جدید، باید وزن‌ها به‌طور مکرر از حافظه فراخوانی شوند و این باعث می‌شود هسته‌های قدرتمند Tensor در GPU در انتظار رسیدن داده‌ها بیکار بمانند. طبق راهنمای توسعه‌دهندگان در تاریخ ۱۶ جولای ۲۰۲۶ در وب‌سایت dev.to، مدل DiffusionGemma این گلوگاه را با انتقال فشار از حافظه به محاسبات حل کرده است. این رویکرد مشابه تلاش‌های پیشین در سایر حوزه‌هاست، جایی که بهینه‌سازی مشترک میان مدل‌های انتشار و درخت‌های تصمیم باعث افزایش سرعت تولید داده‌های جدولی شده بود. این یعنی مدل از تمام قدرت پردازشی GPU استفاده می‌کند تا یک بلوک کامل از متن را به‌طور هم‌زمان پالایش کند.

معماری موازی‌سازی

DiffusionGemma یک مدل ترکیب خبره‌ها (Mixture of Experts) با ۲۶ میلیارد پارامتر است. برای دسترسی راحت‌تر توسعه‌دهندگان، در لحظه استنتاج (Inference) — یعنی همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی نه دوره‌ی آموزش آشپز — تنها ۳.۸ میلیارد پارامتر فعال می‌شوند. این بهینه‌سازی اجازه می‌دهد مدل با استفاده از کوانتیزاسیون (Quantization)، در حافظه ویدیویی (VRAM) ۱۸ گیگابایتی اجرا شود.

به جای پیش‌بینی‌های متوالی (Autoregressive)، این مدل از «انتشار وضعیت یکنواخت» (Uniform State Diffusion) استفاده می‌کند. فرآیند را تصور کنید: مدل ابتدا یک «بوم» شامل ۲۵۶ توکن تصادفی به عنوان جای‌گذار (Placeholder) می‌سازد و سپس به‌صورت تکراری آن‌ها را پاک‌سازی (Denoising) می‌کند. در این مسیر، توکن‌هایی که مدل از آن‌ها مطمئن است (High Confidence)، به شناسایی و تثبیت موقعیت توکن‌های مجاور کمک می‌کنند تا در نهایت کل توالی متن به طور کامل شکل بگیرد و روی بوم متمرکز شود.

راهنمای توسعه‌دهندگان DiffusionGemma

برای متونی طولانی‌تر از ۲۵۶ توکن، مدل از روش «انتشار خودبازگشتی بلوکی» (Block Autoregressive Diffusion) بهره می‌برد. وقتی یک بلوک ۲۵۶ توکنی کاملاً پالایش شد، مدل آن را پردازش کرده و به KV Cache می‌فرستد (Commit می‌کند). سپس بوم جدیدی را شامل ۲۵۶ توکن تصادفی آماده می‌کند که بر اساس تاریخچه قبلی و متنی که پیش‌تر تثبیت شده، شرطی (Conditioned) شده است. این رویکرد ترکیبی، سرعت مدل‌های انتشار را با پایداری مدل‌های متوالی جمع کرده است.

جزئیات فنی فرآیند انتشار

برای فعال‌سازی این پاک‌سازی خودبازگشتی بلوکی، DiffusionGemma در هنگام استنتاج بین دو فاز اصلی جابه‌جا می‌شود:

  • پیش‌پُرکردن / پیش‌پُرکردن افزایشی (Causal Prefill): در این مرحله از توجه (Attention) یک‌سویه سازگار با ترتیب زمانی استفاده می‌شود تا زمینه پرامپت (Prompt Context) دریافت شده و در حافظه KV نوشته شود. این فاز یک بار برای زمینه اولیه و سپس یک بار برای هر بلوک اجرا می‌شود تا بوم ۲۵۶ توکنی نهایی شده را قبل از رفتن به بلوک بعدی، الحاق کند.
  • پاک‌سازی (Bidirectional Denoising): در این فاز، مدل از توجه دوطرفه استفاده می‌کند تا بوم را به‌صورت تکراری پالایش کند. توکن‌های پرس‌وجو (Query) در هر موقعیتی می‌توانند به تمام توکن‌های دیگر موجود در بوم و همچنین حافظه KV دسترسی داشته باشند، که به مدل اجازه می‌دهد زمینه را به‌صورت دوطرفه پردازش کند.

این انتخاب معماری سه قابلیت کلیدی ایجاد می‌کند:

  • آگاهی از زمینه کلی (Global Context Awareness): برخلاف مدل‌های خودبازگشتی (AR) که فقط «به عقب» نگاه می‌کنند، مدل پاک‌ساز اجازه می‌دهد هر توکن روی بوم به هر توکن دیگر دسترسی داشته باشد. این برای مسائل غیر-متوالی حیاتی است؛ جایی که کاراکترهای ابتدایی باید محدودیت‌هایی را که در انتهای توالی قرار دارند، رعایت کنند.
  • اصلاح خودکار (Self-Correction): چون مدل کل بوم را پالایش می‌کند، می‌تواند اشتباهات قبلی را «درست» کند. اگر میزان اطمینان به یک توکن کاهش یابد، نمونه‌بردار (Sampler) می‌تواند آن را دوباره نویزی کرده و جایگزین کند؛ قابلیتی که مدل‌های AR ندارکد زیرا پس از تولید یک توکن، «گیر» می‌افتند و نمی‌توانند به عقب برگردند.
  • مقیاس‌پذیری متون بلند: روش بلوک-خودبازگشتی، سرعت بلوک‌های موازی را با پایداری اثبات‌شده مدل‌های متوالی برای تولید متون طولانی ترکیب می‌کند.

حل محدودیت‌های پیچیده

مدل‌های سنتی اغلب در حل مسائل چند‌متغیره مانند سودوکو شکست می‌خورند، زیرا نمی‌توانند به جلو نگاه کنند یا به عقب بازگردند (Backtrack). DiffusionGemma با استفاده از توجه دوطرفه، به هر توکن روی بوم اجازه می‌دهد به‌طور موازی به تمام موقعیت‌های دیگر دسترسی داشته باشد. در نمایش رشته‌ای ۸۱ کاراکتری سودوکو (که در آن خانه‌های خالی با نقطه نشان داده می‌شوند)، هر عدد توسط محدودیت‌های سخت افقی، عمودی و شبکه‌های ۹x۹ محدود شده است. DiffusionGemma این وابستگی‌های کلی را به‌صورت متقارن در کل صفحه حل می‌کند.

گوگل این توانایی را از طریق یک دستورالعمل تنظیم دقیق (Fine-tuning) با استفاده از جعبه‌ابزار پژوهشی JAX به نام Hackable Diffusion به نمایش گذاشت. در حالی که مدل پایه نرخ موفقیت نزدیکی به صفر درصد در حل سودوکو داشت، نسخه تنظیم نظارت‌شده (SFT) — که شبیه به دادن تخصص پوست به یک پزشک عمومی است — به نرخ موفقیت ۸۰ درصد رسید.

راهنمای توسعه‌دهندگان DiffusionGemma: راهنمای عملی برای کار با مدل‌های تولید تصویر هوش مصنوعی

یافته‌های کلیدی در آزمایش سودوکو عبارتند از:

  • انتشار دوطرفه: اطلاعات به‌صورت متقارن جابه‌جا می‌شوند و عدد سلول اول را بلافاصله با محدودیت سلول آخر هماهنگ می‌کنند.
  • اصلاح خطا با باز-نویز: تحت انتشار وضعیت یکنواخت، اگر اطمینان مدل به عددی کم شود، نمونه‌بردار ارقام را با مقادیر تصادفی جایگزین می‌کند تا اصلاح خودکار مستمر صورت گیرد.
  • توقف زودهنگام بهینه: مدل‌های SFT-tuned بسیار سریع‌تر پایدار می‌شوند. برای مثال، در حالی که مدل پایه پس از ۴۸ گام همچنان شکست می‌خورد، مدل SFT-tuned پازل را تنها پس از ۱۲ گام حل کرد که باعث کاهش تأخیر و هزینه‌های محاسباتی شد.

استقرار و یکپارچه‌سازی

برای کاربردی کردن این ساختار، گوگل با تیم vLLM همکاری کرد تا حلقه‌های پاک‌سازی را در موتور خود جای دهد. این همکاری اجازه می‌دهد موتور vLLM حلقه‌های پاک‌سازی موازی تکراری را به‌طور بهینه در جریان‌های درخواست دسته‌ای (Batched Request Streams) اجرا کند. توسعه‌دهندگان اکنون می‌توانند مدل را با یک سرور محلی استاندارد و سازگار با OpenAI با دستوری شبیه به این مستقر کنند:

vllm serve google/diffusiongemma-26B-A4B-it --max-model-len 262144 --max-num-seqs 4 --gpu-memory-utilization 0.85 --attention-backend TRITON_ATTN --generation-config vllm --hf-overrides '{"diffusion_sampler": "entropy_bound", "diffusion_entropy_bound": 0.1}' --diffusion-config '{"canvas_length": 256}' --enable-chunked-prefill

این پشته بهینه شده است تا روی طیف وسیعی از سخت‌افزارها، از کارت‌های مصرف‌کننده RTX 4090 و 5090 گرفته تا سرورهای سازمانی Hopper و Blackwell اجرا شود.

برای کسانی که امروز می‌خواهند شروع کنند، وزن‌های مدل تحت لیسانس Apache 2.0 در Hugging Face در دسترس است. این مدل همچنین با SGLang، MLX و Hugging Face Transformers سازگاری دارد. برای کسانی که به دنبال تنظیم دقیق بهینه هستند، توسعه‌دهندگان می‌توانند از دستورالعمل‌های رسمی Hackable Diffusion، یا ابزارهای Unsloth و NVIDIA NeMo استفاده کنند. استقرار فوری مدل همچنین از طریق Google Cloud Model Garden یا NVIDIA NIM امکان‌پذیر است.

تغییر از تولید متوالی به موازی، این فرض را که پهنای باند حافظه تنها دیوار سرعت است، می‌شکند. وقتی متن را نه به عنوان توالی، بلکه به عنوان سیگنالی برای پاک‌سازی ببینیم، به هوشی می‌رسیم که می‌تواند هم‌زمان روی یک صفحه کامل فکر کند. این یعنی توانایی حل مسائل غیرخطی مثل کدنویسی یا معماهای منطقی با مصرف بهینه محاسبات و کاهش اتلاف منابع.

گام بعدی شما

  • اگر با vLLM کار می‌کنید، مدل google/diffusiongemma-26B-A4B-it را برای کارهای استدلالی موازی تست کنید.
  • برای پروژه‌های تخصصی، دستورالعمل‌های Hackable Diffusion را برای تبدیل مدل به یک متخصص حل مسئله بررسی کنید.
  • تفاوت سرعت استنتاج را در سخت‌افزارهای سری RTX 5000 با مدل‌های autoregressive مقایسه کنید.

اما بررسی تأثیر این معماری بر کاهش هزینه‌های استنتاج در مقیاس صنعتی، موضوع تحلیل بعدی ماست؛ به گزارش ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با انتقال گلوگاه از سخت‌افزار (حافظه) به نرم‌افزار (محاسبات)، بهره‌وری GPUها را به‌شدت بالا می‌برد. بر اساس اعتبار فنی گوگل و همکاری با vLLM، این مدل استاندارد جدیدی برای استقرار محلی مدل‌های سریع و استدلالی ایجاد می‌کند.

تأثیر برای ایران

به دلیل وزن‌های باز (Open Weights) در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی، این مدل را روی سخت‌افزارهای محلی یا سرورهای اجاره‌ای اجرا و بهینه‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی پیش‌بینی توکن‌به-توکن با پالایش بلوکی، پارادایم تولید متن را از «تکمیل جمله» به «پردازش تصویر-گونه» تغییر می‌دهد. این رویکرد احتمالاً باعث می‌شود مدل‌های آینده در کارهای مهندسی معکوس و کدنویسی، که نیاز به دید کلی (Global View) دارند، بسیار دقیق‌تر عمل کنند و نرخ توهم را در ساختارهای پیچیده کاهش دهند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.