پرش به محتوای اصلی
پرش به محتوای مقاله

گزارش فنی: اجرای Gemma 4 26B روی یک GPU با سرعت ۵۱ توکن بر ثانیه

·۲۸ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
گزارش فنی: اجرای Gemma 4 26B روی یک GPU با سرعت ۵۱ توکن بر ثانیه
اشتراک‌گذاری

اگر ماهانه هزاران دلار برای APIهای مدل‌های پیشرو می‌پردازید، باید بدانید که یک GPU مدل L4 می‌تواند مدل Gemma 4 26B را با سرعت ۵۱ توکن بر ثانیه اجرا کند. این یعنی تیم‌های فنی اکنون می‌توانند یک مدل قدرتمند ۲۶ میلیارد پارامتری را روی یک نمونه استاندارد ابری اجرا کنند، بدون اینکه پایداری سیستم در محیط عملیاتی به خطر بیفتد.

گوگل دیپ‌مایند (Google DeepMind) خانواده‌ی وزن‌های باز (Open Weights) — یعنی مدل‌هایی که دستور پخت آن‌ها علناً منتشر شده و نه فقط غذای آماده — Gemma 4 را در آوریل ۲۰۲۶ عرضه کرد. این خانواده از مدل‌ها نه تنها در بهینگی، بلکه در توانایی‌های استدلالی نیز پیشرفت چشمگیری داشته‌اند؛ چنان‌که مدل Gemma 4 در بنچمارک AIME با کسب دقت ۸۹.۲ درصد، استانداردهای جدیدی را در استدلال ریاضی محلی تعریف کرد. برای اکثر توسعه‌دهندگان، چالش اصلی فاصلهٔ حافظه (VRAM) بود؛ یعنی چطور مدلی که به‌طور معمول به ۵۲ گیگابایت حافظه نیاز دارد را در ۲۴ گیگابایت حافظهٔ یک GPU مدل L4 جای دهند. طبق گزارش فنی منتشر شده در ۱۸ مه ۲۰۲۶ در وب‌سایت dev.to، این هدف از طریق کوانتایزیشن تهاجمی و پروفایلینگ حافظه محقق شده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های بازمتن اشاره کردیم، بهره‌وری در لایه‌ی سخت‌افزار کلید کاهش هزینه‌هاست. این استقرار بر روی نسخه‌ی Gemma 4 26B-A4B متمرکز است که از معماری «مخلوط متخصصان» (MoE) استفاده می‌کند. برای جای‌گذاری مدل در حافظه، از بهینه‌سازی‌های زیر استفاده شده است:

  • کوانتایزیشن ۴-بیتی AWQ: کاهش وزن‌های مدل از ۵۲ گیگابایت به ۱۶ گیگابایت — شبیه فشرده‌سازی یک فایل حجیم برای جا شدن در فلش‌مموری بدون حذف محتوای اصلی.
  • غیرفعال‌سازی قابلیت‌های چندوجهی: تنظیم محدودیت‌های تصویر، صدا و ویدیو روی صفر که ۱ گیگابایت حافظه آزاد می‌کند.
  • حافظه پنهان FP8 KV: نصف کردن اثر حافظه در وضعیت‌های توجه (Attention states).
  • زیرساخت: استفاده از یک نمونه g2-standard-4 در گوگل کوبرنتیز انجین (GKE) با یک ادعای حجم ذخیره‌سازی ۳۰ گیگابایتی.

بر اساس مستندات این گزارش، این تغییرات امکان استفاده از پنجره متنی ۲۸,۰۰۰ توکنی را فراهم می‌کند. در تست‌های واقعی، مدل حتی با چهار درخواست موازی، سرعت ۴۷ توکن بر ثانیه را حفظ کرد؛ هرچند زمان رسیدن به اولین توکن (TTFT) از ۸۴ میلی‌ثانیه به ۱.۹۴ ثانیه افزایش یافت.

این تحول، محاسبات «ساخت در برابر خرید» را برای ابزارهای داخلی هوش مصنوعی تغییر می‌دهد. با هزینه ثابت حدود ۵۰۳ دلار در ماه، میزبانی شخصی برای کارهای حجیم مثل تحلیل لاگ‌ها یا بررسی PRها، به‌شدت ارزان‌تر از APIهای پرچم‌دار است. علاوه بر مسائل مالی، این معماری با نگه داشتن منطق تجاری در زیرساخت خود کاربر، حریم خصوصی داده‌ها را تضمین می‌کند.

گام بعدی شما

  • بررسی پیاده‌سازی معماری Zone-aware برای کاهش تأخیر در دسترسی به داده‌ها.
  • مطالعه‌ی راهنماهای آتی برای استفاده از نمونه‌های Spot در GKE جهت کاهش ۷۰ درصدی هزینه‌های محاسباتی.
  • تست مدل Gemma 4 26B روی داده‌های اختصاصی سازمان برای مقایسه دقت در مقابل مدل‌های بسته.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص در مدیریت حافظه، مرز بین مدل‌های کوچک و بزرگ را می‌شکند. اکنون شرکت‌ها می‌توانند بدون ریسک تسریب داده‌ها و با هزینه‌ای پیش‌بینی‌پذیر، مدل‌های سطح بالا را در محیط‌های ایزوله مستقر کنند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.