پرش به محتوای اصلی
پرش به محتوای مقاله

دیپ‌مایند: سرعت تولید متن Gemma 4 به ۱۵۰۰ توکن در ثانیه رسید

·۱۸ مرداد ۱۴۰۵۳ دقیقه مطالعه
جان جامپر، برنده نوبل، گوگل دیپ‌مایند را ترک کرد و به آنتروپیک پیوست.
جان جامپر، برنده نوبل، گوگل دیپ‌مایند را ترک کرد و به آنتروپیک پیوست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک مدل زبانی موجود به مدل انتشار (Diffusion) بدون آموزش از صفر؛ این یعنی تغییر ماهیت تولید متن از «کلمه به کلمه» به «بازسازی کل پاسخ» برای دستیابی به سرعت ۱۵۰۰ توکن در ثانیه.

اگر امروز برای استنتاج مدل‌های زبانی هزینه می‌پردازید، تصور کنید پاسخی که ثانیه‌ها طول می‌کشید، در کسری از ثانیه و با سرعتی خیره‌کننده ظاهر شود. DiffusionGemma با ثبت سرعت تقریبی ۱۵۰۰ توکن در ثانیه، استانداردهای فعلی سرعت در مدل‌های زبانی را جابه‌جا کرده است.

طبق گزارشی که در ۹ اوت ۲۰۲۶ منتشر شد، گوگل دیپ‌مایند (Google DeepMind) به‌جای آموزش یک مدل از صفر، مدل موجود Gemma-4-26B-A4B را بازسازی کرد. این رویکرد در زمانی رخ می‌دهد که کل صنعت با هزینه‌های سرسام‌آور محاسباتی مدل‌های پیشرو دست‌وپنجه نرم می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی تغییرات مدیریتی دیپ‌مایند اشاره کردیم، این محصول نشان‌دهنده چرخش راهبردی گوگل به سمت بهینه‌سازی منابع است. این مدل را شبیه نقاشی تصور کنید که به‌جای کشیدن خط‌به‌خط، ابتدا کل طرح را کمرنگ می‌کشد و سپس در لحظه آن را شفاف و دقیق می‌کند.

مدل دیفیوژن متنی گوگل بدون آموزش از صفر ساخته شد

بر اساس مستندات گوگل، این تبدیل در دو مرحله انجام شده است:

  • مرحله اول: مدل یاد می‌گیرد که بلوک‌های متنی نویزدار را از روی داده‌های نمونه بازسازی کند.
  • مرحله دوم (SD·RL): ترکیبی از یادگیری تقویتی و distillation (تقطیر) — که شبیه خلاصه کردن یک کتاب قطور در چند نکته کلیدی برای یادگیری سریع‌تر است — برای افزایش کیفیت و کاهش گام‌های محاسباتی.

این متد کمتر از ۱۰٪ بودجه توکن‌های آموزش اولیه را مصرف کرد. نتیجه این است که پاسخ‌ها حدود ۵۰٪ کوتاه‌تر از نسخه پایه هستند و سرعت تحویل را باز هم بیشتر می‌کنند.

مدل دیفیوژن متنی گوگل بدون آموزش از صفر ساخته شد

مهم‌ترین تغییر فنی، گذار به استدلال دوطرفه است. مدل‌های خودبازگشتی (Autoregressive) — که مثل کسی هستند که هر کلمه را می‌گویند و دیگر نمی‌توانند آن را پس بگیرند — مجبورند ابتدا اولین رقم یک پاسخ ریاضی را بنویسند و سپس بقیه را حساب کنند. اما DiffusionGemma استدلال و پاسخ نهایی را به‌صورت موازی توسعه می‌دهد و می‌تواند خطاهای ابتدایی را در مراحل نهایی پاک‌سازی اصلاح کند.

مدل دیفیوژن متنی گوگل بدون آموزش از صفر ساخته شده است.

این توانایی در کارهای ساختاریافته کاملاً مشهود است. به نقل از گزارش گوگل، این مدل پس از یک تنظیم دقیق (Fine-tuning) — که مثل دادن تخصص پوست به یک پزشک عمومی است — توانست ۸۵٪ از جدول‌های سودوکو را درست حل کند؛ در حالی که مدل پایه Gemma 4 در این کار کاملاً شکست خورده بود. برای اصلاح کدهای برنامه‌نویسی یا فایل‌های JSON، مدل معمولاً تنها در دو یا سه گام اصلاحی به جواب می‌رسد.

مدل دیفیوژن متنی گوگل بدون آموزش از صفر ساخته شده است.

البته این سرعت به بهای کاهش کیفیت تمام شده است. DiffusionGemma در محک‌های کیفیت مطلق، از مدل خودبازگشتی Gemma 4 عقب‌تر است. گزارش‌ها حاکی از آن است که مدل گاهی دچار حلقه‌های تکرار می‌شود و در وظایف چندوجهی (Multimodal) — مدل‌هایی که مثل انسان هم‌زمان متن و عکس را می‌فهمند — گاهی نمی‌تواند بخش‌های استدلالی را به‌درستی ببندد.

از منظر تجاری، این دستاورد ثابت می‌کند که «بازیافت» مدل‌های بزرگ در معماری‌های تخصصی ممکن است. این کار سد ورود استارتاپ‌ها را برای ساخت ابزارهای سریع و تخصصی، بدون نیاز به خوشه‌های عظیم GPU، پایین می‌آورد. در این راستا، بهینه‌سازی‌های سخت‌افزاری مانند رویکرد Nunchaku Lite برای کاهش مصرف VRAM در مدل‌های انتشار می‌تواند مکمل این مدل‌ها در محیط‌های با منابع محدود باشد.

در حال حاضر مزیت توان عملیاتی (Throughput) بیشتر برای کاربران تک‌نفره است. وقتی درخواست‌های هم‌زمان به عدد ۳۲ می‌رسد، مدل‌های زبانی استاندارد از نظر مجموع خروجی به این مدل می‌رسند و کاربرد DiffusionGemma را به تعاملات فردی با تأخیر بسیار کم محدود می‌کنند.

گوگل این مدل را تحت لایسنس Apache 2.0 در Hugging Face منتشر کرده است. استارتاپ Interfaze در حال حاضر از آن برای بازشناسی گفتار چندزبانه و پژوهش‌های گزارش رادیولوژی استفاده می‌کند.

گام بعدی شما

  • اگر روی ابزارهای Real-time یا دستیارهای صوتی کار می‌کنید، مدل DiffusionGemma را برای کاهش تأخیر استنتاج تست کنید.
  • برای کارهای حساس به دقت (مانند تحلیل حقوقی)، همچنان از مدل‌های خودبازگشتی استفاده کنید و این مدل را برای کارهای ساختاریافته (مانند اصلاح کد) به کار ببرید.
  • مستندات تبدیل مدل در Hugging Face را بررسی کنید تا ببینید آیا مدل‌های وزن‌باز دیگر را هم می‌توان به این شکل بهینه کرد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص دیپ‌مایند در مدل‌های انتشار، اثبات می‌کند که سرعت استنتاج می‌تواند بدون نیاز به سخت‌افزارهای گران‌تر، از طریق تغییر معماری مدل افزایش یابد. این موضوع باعث می‌شود ابزارهای هوش مصنوعی در کاربردهای حساس به زمان (Low-latency) بسیار کاربردی‌تر شوند.

تأثیر برای ایران

به‌دلیل انتشار مدل تحت لایسنس Apache 2.0 در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون محدودیت‌های API، این مدل را روی سخت‌افزارهای شخصی یا سرورهای داخلی برای کاربردهای سریع اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

بازیافت مدل‌های پیش‌آموز شده به جای آموزش مجدد، پارادایم جدیدی در کاهش هزینه‌های AI است. این رویکرد نشان می‌دهد که «دانش» مدل در وزن‌ها ذخیره شده و می‌توان با تغییر «موتور استخراج» (از خودبازگشتی به انتشار)، ویژگی‌های عملیاتی مثل سرعت و استدلال دوطرفه را تغییر داد بدون آنکه نیاز به میلیاردها دلار هزینه آموزش باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.