اگر امروز برای استنتاج مدلهای زبانی هزینه میپردازید، تصور کنید پاسخی که ثانیهها طول میکشید، در کسری از ثانیه و با سرعتی خیرهکننده ظاهر شود. DiffusionGemma با ثبت سرعت تقریبی ۱۵۰۰ توکن در ثانیه، استانداردهای فعلی سرعت در مدلهای زبانی را جابهجا کرده است.
طبق گزارشی که در ۹ اوت ۲۰۲۶ منتشر شد، گوگل دیپمایند (Google DeepMind) بهجای آموزش یک مدل از صفر، مدل موجود Gemma-4-26B-A4B را بازسازی کرد. این رویکرد در زمانی رخ میدهد که کل صنعت با هزینههای سرسامآور محاسباتی مدلهای پیشرو دستوپنجه نرم میکند. همانطور که در تحلیل قبلی ما دربارهی تغییرات مدیریتی دیپمایند اشاره کردیم، این محصول نشاندهنده چرخش راهبردی گوگل به سمت بهینهسازی منابع است. این مدل را شبیه نقاشی تصور کنید که بهجای کشیدن خطبهخط، ابتدا کل طرح را کمرنگ میکشد و سپس در لحظه آن را شفاف و دقیق میکند.

بر اساس مستندات گوگل، این تبدیل در دو مرحله انجام شده است:
- مرحله اول: مدل یاد میگیرد که بلوکهای متنی نویزدار را از روی دادههای نمونه بازسازی کند.
- مرحله دوم (SD·RL): ترکیبی از یادگیری تقویتی و distillation (تقطیر) — که شبیه خلاصه کردن یک کتاب قطور در چند نکته کلیدی برای یادگیری سریعتر است — برای افزایش کیفیت و کاهش گامهای محاسباتی.
این متد کمتر از ۱۰٪ بودجه توکنهای آموزش اولیه را مصرف کرد. نتیجه این است که پاسخها حدود ۵۰٪ کوتاهتر از نسخه پایه هستند و سرعت تحویل را باز هم بیشتر میکنند.

مهمترین تغییر فنی، گذار به استدلال دوطرفه است. مدلهای خودبازگشتی (Autoregressive) — که مثل کسی هستند که هر کلمه را میگویند و دیگر نمیتوانند آن را پس بگیرند — مجبورند ابتدا اولین رقم یک پاسخ ریاضی را بنویسند و سپس بقیه را حساب کنند. اما DiffusionGemma استدلال و پاسخ نهایی را بهصورت موازی توسعه میدهد و میتواند خطاهای ابتدایی را در مراحل نهایی پاکسازی اصلاح کند.

این توانایی در کارهای ساختاریافته کاملاً مشهود است. به نقل از گزارش گوگل، این مدل پس از یک تنظیم دقیق (Fine-tuning) — که مثل دادن تخصص پوست به یک پزشک عمومی است — توانست ۸۵٪ از جدولهای سودوکو را درست حل کند؛ در حالی که مدل پایه Gemma 4 در این کار کاملاً شکست خورده بود. برای اصلاح کدهای برنامهنویسی یا فایلهای JSON، مدل معمولاً تنها در دو یا سه گام اصلاحی به جواب میرسد.

البته این سرعت به بهای کاهش کیفیت تمام شده است. DiffusionGemma در محکهای کیفیت مطلق، از مدل خودبازگشتی Gemma 4 عقبتر است. گزارشها حاکی از آن است که مدل گاهی دچار حلقههای تکرار میشود و در وظایف چندوجهی (Multimodal) — مدلهایی که مثل انسان همزمان متن و عکس را میفهمند — گاهی نمیتواند بخشهای استدلالی را بهدرستی ببندد.
از منظر تجاری، این دستاورد ثابت میکند که «بازیافت» مدلهای بزرگ در معماریهای تخصصی ممکن است. این کار سد ورود استارتاپها را برای ساخت ابزارهای سریع و تخصصی، بدون نیاز به خوشههای عظیم GPU، پایین میآورد. در این راستا، بهینهسازیهای سختافزاری مانند رویکرد Nunchaku Lite برای کاهش مصرف VRAM در مدلهای انتشار میتواند مکمل این مدلها در محیطهای با منابع محدود باشد.
در حال حاضر مزیت توان عملیاتی (Throughput) بیشتر برای کاربران تکنفره است. وقتی درخواستهای همزمان به عدد ۳۲ میرسد، مدلهای زبانی استاندارد از نظر مجموع خروجی به این مدل میرسند و کاربرد DiffusionGemma را به تعاملات فردی با تأخیر بسیار کم محدود میکنند.
گوگل این مدل را تحت لایسنس Apache 2.0 در Hugging Face منتشر کرده است. استارتاپ Interfaze در حال حاضر از آن برای بازشناسی گفتار چندزبانه و پژوهشهای گزارش رادیولوژی استفاده میکند.
گام بعدی شما
- اگر روی ابزارهای Real-time یا دستیارهای صوتی کار میکنید، مدل DiffusionGemma را برای کاهش تأخیر استنتاج تست کنید.
- برای کارهای حساس به دقت (مانند تحلیل حقوقی)، همچنان از مدلهای خودبازگشتی استفاده کنید و این مدل را برای کارهای ساختاریافته (مانند اصلاح کد) به کار ببرید.
- مستندات تبدیل مدل در Hugging Face را بررسی کنید تا ببینید آیا مدلهای وزنباز دیگر را هم میتوان به این شکل بهینه کرد یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو