پرش به محتوای اصلی
پرش به محتوای مقاله

انویدیا: بازدهی پردازش عامل‌های هوش مصنوعی در پلتفرم Vera Rubin ۳۵ برابر شد

·۲۶ اردیبهشت ۱۴۰۵۳ دقیقه مطالعه
انویدیا: بازدهی پردازش عامل‌های هوش مصنوعی در پلتفرم Vera Rubin ۳۵ برابر شد
اشتراک‌گذاری

اگر برای ساخت عامل‌های هوش مصنوعی با مشکل تأخیر و هزینه‌های بالا می‌جنگید، سخت‌افزار جدید انویدیا بازی را تغییر می‌دهد. طبق گزارش فنی انویدیا در ۱۴ مه ۲۰۲۶، پلتفرم Vera Rubin بازدهی پردازش را در هر مگاوات تا ۳۵ برابر افزایش داده است.

عامل‌های هوش مصنوعی زاینده (Generative AI) — شبیه مدیری هستند که فقط جواب نمی‌دهد، بلکه برای رسیدن به هدف، تصمیم می‌گیرد و ابزارها را مدیریت می‌کند — با چالش بزرگی به نام «مشکل مقیاس‌پذیری» روبرو هستند. در واقع، هرچه عامل پیچیده‌تر شود، تأخیر در پاسخ‌دهی بیشتر می‌شود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های استدلالی اشاره کردیم، این تأخیر در مدل‌های تریلیونی (MoE) یک بن‌بست واقعی است.

A conceptual diagram of a user request passing through agents and sub-agents with KV cache, prompts, tools, and history into a routed MoE model spread across multiple processors, emphasizing the need for fast, deterministic networking.

برای حل این مشکل، انویدیا از یک سیستم دو موتوره استفاده کرده است. Vera Rubin NVL72 کارهای سنگین را بر عهده دارد و ۳۶۰۰ PFLOPS قدرت محاسباتی فراهم می‌کند. در مقابل، شتاب‌دهنده‌های Groq 3 LPX بر اجرای قطعی و بدون لرزش تمرکز دارند. این تراشه‌ها با استفاده از یک کامپایلر، هزاران چیپ را به عنوان یک سطح اجرای واحد می‌بینند.

Line chart titled “NVIDIA Groq 3 LPX Scale-up Bandwidth” with scale-up bandwidth in TB/s on the y-axis and number of LPUs on the x-axis, showing a near-linear rise to about 640 TB/s at around 256 LPUs, annotated with “Unified Memory Pool of 128 GB of SRAM.”

مشخصات فنی کلیدی این سیستم عبارت است از:

  • پهنای باند LPU C2C: ۶۴۰ ترابایت بر ثانیه در سطح رک (۲۵۶ LPU).
  • حافظه یکپارچه: ۱۲۸ گیگابایت SRAM روی تراشه.
  • سرعت پاسخ‌دهی: ۴۰۰ توکن در ثانیه برای هر کاربر با پنجره متنی (Context Window) — مثل میز کاری که مقدار زیادی اطلاعات را هم‌زمان پیش چشم دارد — ۴۰۰ هزار توکنی.

مدیریت این دو موتور بر عهده‌ی NVIDIA Dynamo است. این سیستم از روشی به نام «جداسازی Attention-FFN» استفاده می‌کند. در این چرخه، GPUهای روبین کارهای پیش‌پردازش را انجام می‌دهند و شتاب‌دهنده‌های LPX بخش‌های مربوط به استنتاج (Inference) — یعنی همان لحظه‌ی تولید جواب، شبیه خودِ آشپزی نه آموزش آن — را تسریع می‌کنند.

Diagram of NVIDIA Dynamo coordinating two rack-scale systems: Vera Rubin NVL72 with prefill GPUs and decode GPUs for attention, and Groq 3 LPX with decode LPUs for FFN, connected by KV-aware routing and interim decode activations exchanged each token.

این معماری فرضیات قدیمی درباره‌ی توازن بین سرعت و تأخیر را می‌شکند. با انتقال حلقه‌ی رمزگشایی به LPU، مدل‌های تریلیونی برای استفاده‌ی آنی و تجاری به‌صرفه می‌شوند. به باور تحلیلگران، این تحول فرصتی برای ۱۰ برابر افزایش درآمد شرکت‌هایی ایجاد می‌کند که عامل‌های خودگردان سطح بالا می‌سازند.

گام بعدی شما

  • قیمت‌گذاری لایه‌های «پریمیوم» عامل‌های هوش مصنوعی را در ماه‌های آینده زیر نظر بگیرید.
  • بررسی کنید آیا مدل‌های MoE شما با معماری‌های توزیع‌شده سازگار هستند یا خیر.
  • منتظر کاهش چشمگیر هزینه هر توکن برای استدلال‌های پیچیده باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول باعث می‌شود مدل‌های تریلیونی از حالت نمایشی خارج شده و در کاربردهای واقعی و آنی به‌صرفه شوند. اعتبار این ادعا از ترکیب سخت‌افزار انویدیا و معماری LPU Groq می‌آید که گلوگاه‌های قدیمی شبکه را حذف کرده است.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

موضوع‌ها

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.