پرش به محتوای اصلی
پرش به محتوای مقاله

سیستم Vera Rubin انویدیا توان عملیاتی استنتاج را ۳.۷ برابر افزایش داد

·۲۵ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
نتایج اولیه MLPerf Inference برای سیستم NVIDIA Vera Rubin NVL72
نتایج اولیه MLPerf Inference برای سیستم NVIDIA Vera Rubin NVL72
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

سیگنال اصلی این خبر، دستیابی به توان عملیاتی ۳.۷ برابری در مدل‌های بینایی-زبانی (VLM) از طریق جداسازی سخت‌افزاری مراحل پردازش است، نه صرفاً افزایش سرعت کلاک GPUها.

اگر امروز برای اجرای مدل‌های عظیم هوش مصنوعی هزینه می‌کنید، باید بدانید که سقف توان پردازشی در حال تغییر است. سیستم جدید Vera Rubin NVL72 توانسته است در بنچمارک Qwen3-VL، توان عملیاتی را ۳.۷ برابر نسبت به نسل قبلی (GB300) افزایش دهد. این جهش عملکردی در واقع سقف استنتاج هوش مصنوعی را بازتعریف می‌کند.

طبق اعلام انویدیا در ۱۶ سپتامبر ۲۰۲۶، این نتایج بخشی از گزارش MLPerf Inference v6.1 است و نشان‌دهنده تلاشی تهاجمی برای کاهش هزینه هر توکن برای شرکت‌هاست. این تحول در حالی رخ می‌دهد که صنعت از رابط‌های چت ساده به سمت گردش‌های کاری عامل‌محور (Agentic) حرکت می‌کند؛ یعنی سیستم‌هایی شبیه به داشتن کارمندانی که نه تنها حرف می‌زنند، بلکه کارهای پیچیده را مرحله‌به‌مرحله اجرا می‌کنند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مراکز داده اشاره کردیم، نبرد فعلی دیگر بر سر قدرت خام محاسباتی نیست، بلکه بر سر توان عملیاتی (Throughput) است؛ یعنی اینکه یک رک سخت‌افزاری در هر ثانیه به چند کاربر پاسخ دهد بدون آنکه تأخیری ایجاد شود. این رویکرد بهینه‌سازی در پروژه‌های اخیر نیز دیده می‌شود، جایی که پلتفرم DSX انویدیا توانست توان عملیاتی توکن‌ها را تا ۲۴ درصد افزایش دهد. برای یک مدیر کسب‌وکار، این یک محاسبه مستقیم از درآمد هر رک در برابر هزینه‌های برق و سخت‌افزار است.

متدولوژی و بستر ارزیابی

بسته بنچمارک MLPerf Inference: Datacenter متعلق به انجمن MLCommons است و سرعت پردازش ورودی‌ها و تولید نتایج توسط یک مدل آموزش‌دیده را اندازه‌گیری می‌کند. انویدیا ارقام خود را از بخش «بسته» (Closed) استخراج کرده است. در این بخش، استفاده از همان مدلِ پیاده‌سازی مرجع الزامی است تا مقایسه‌ای دقیق و «سیب با سیب» بین سخت‌افزارها و چارچوب‌های نرم‌افزاری صورت گیرد.

نتایج Vera Rubin NVL72 در دسته‌ی «پیش‌نمایش» (Preview) ثبت شده است. طبق قوانین MLCommons، سیستم‌هایی که در این دسته قرار می‌گیرند باید در دوره‌ی بعدی ثبت‌نام، به عنوان سیستم‌های «در دسترس» (Available) ارائه شوند. ارقام ذکر شده از وب‌سایت mlcommons.org و از طریق ورودی‌های ثبت شده به شماره‌های 6.1-0106 و 6.1-0074 بازیابی شده‌اند.

کالبدشکافی بنچمارک‌ها

بر اساس گزارش‌های منتشر شده، سیستم Vera Rubin NVL72 در دو مورد از سخت‌ترین و پرتوقع‌ترین آزمون‌های مجموعه v6.1 برتری مطلق داشت:

  • Qwen3-VL: دستیابی به توان عملیاتی تا ۳.۷ برابر بیشتر از GB300 NVL72 در سناریوهای آفلاین، سرور و تعاملی. این نتیجه با استفاده از vLLM و فریم‌ورک استنتاج متن‌باز NVIDIA Dynamo به دست آمده است.
  • DeepSeek-R1: گزارش توان عملیاتی تا ۲.۵ برابر بیشتر نسبت به GB300 NVL72 با بهره‌گیری از کتابخانه TensorRT-LLM.
  • بار کاری عامل‌محور: در تست‌های پیش‌نمایش روی بنچمارک SemiAnalysis AgentX، این سیستم عملکردی ۳۰ برابر بهتر از GB300 ارائه داد.

رمز مهندسی انویدیا

انویدیا این موفقیت را مدیون رویکرد «طراحی مشترک تمام‌عیار» (Full-stack codesign) می‌داند. این سیستم از هسته‌های تنسور ارتقایافته و یک موتور ترنسفورمر برای شتاب‌دهی به هر دو مرحله‌ی پیش‌پُرکردن (Prefill) — لحظه‌ای که مدل سوال شما را می‌خواند و می‌فهمد — و رمزگشایی (Decoding) — یعنی همان لحظه‌ای که مدل کلمه به کلمه جواب می‌نویسد — استفاده می‌کند.

نکته حیاتی، استفاده از دقت NVFP4 است که اثر انگشت حافظه (Memory Footprint) برای وزن‌های مدل، مکانیزم Attention و KV Cacheها را کاهش می‌دهد. این امر اجازه می‌دهد داده‌های بیشتری با سرعت بالاتر و با کمترین افت در کیفیت خروجی جابجا شوند. این سخت‌افزار توسط نسل ششم NVLink و NVLink Switch به هم متصل شده است؛ تکنولوژی‌ای که طبق ادعای انویدیا، نرخ بسته‌های داده را ۱۰ برابر افزایش و تأخیر (Latency) را ۳ برابر نسبت به استاندارد اترنت کاهش داده است.

مکانیزم‌های فنی و مقیاس‌پذیری

برای رسیدن به این اعداد، انویدیا از چندین تکنیک معماری پیشرفته برای به حداکثر رساندن کارایی استفاده کرده است:

  • سرویس‌دهی مجزا (Disaggregated Serving): این روش مراحل پیش‌پُرکردن و رمزگشایی را از هم جدا می‌کند تا استفاده از منابع بهینه شود.
  • موازی‌سازی خبره‌ها (Expert Parallelism): موازی‌سازی در مقیاس بزرگ روی لایه‌های «ترکیب خبره‌ها» (Mixture-of-Experts) که در مدل‌های DeepSeek-R1 و Qwen3-VL به کار رفته، اعمال شده است.
  • اتصال در مقیاس رک: دامنه مقیاس‌پذیری NVL72 زیربنای لازم برای اجرای این تکنیک‌ها را در سطح رک فراهم می‌کند.

جالب اینجاست که این کارایی در مقیاس بزرگتر هم حفظ شده است. در ثبت نتایج DeepSeek-R1، انویدیا سیستم را از یک رک (۷۲ GPU) به چهار رک (۲۸۸ GPU) گسترش داد و به بازدهی مقیاس‌پذیری ۹۹ درصدی رسید (ورودی‌های 6.1-0073 و 6.1-0074). این یعنی افزودن سخت‌افزار منجر به افزایش تقریباً خطی در عملکرد می‌شود. این سطح از مقیاس‌پذیری در رک‌های انویدیا پیش‌تر نیز مورد توجه قرار گرفته بود، به‌طوری‌که OpenAI برای آموزش نسل جدید مدل‌های خود به سیستم‌های رک‌مقیاس GB200 روی آورد.

در بنچمارک متن-به-ویدیو WAN 2.2، سیستم GB300 NVL72 به نرخ ۰.۶۵ ویدیو با کیفیت 720p در هر ثانیه رسید (با میانگین ۵.۷ ثانیه برای هر ویدیو). این رقم نشان‌دهنده توان عملیاتی ۹ برابر بیشتر و تأخیر ۷.۵ برابر کمتر نسبت به یک نود (Node) واحد است.

همچنین انویدیا گزارش داد که عملکرد GB300 NVL72 در مدل Qwen3-VL در نسخه v6.1 نسبت به v6.0 تا ۱.۶ برابر بهبود یافته است. این پیشرفت ناشی از دقت پایین‌تر KV Cache، ادغام هسته‌های بیشتر (Kernel Fusion) و بهینه‌سازی کرنل‌ها بود. فراتر از مراکز داده، انویدیا نتایج Jetson AGX Thor را با استفاده از کتابخانه TensorRT Edge-LLM در بنچمارک Edge-Agentic با مدل Qwen3.6-27B ثبت کرد.

اکوسیستم و شرکای تجاری

اکوسیستم این فناوری به سرعت در حال گسترش است و ۱۹ شریک تجاری در این دور ارزیابی شرکت کردند. هشت مورد از آن‌ها نتایج خود را روی سیستم‌های چند-نودی Blackwell NVL72 ثبت کردند. این شرکا عبارتند از: Azure، Dell Technologies، Oracle Cloud Infrastructure، ASUS، Cisco، CoreWeave، Crusoe، Fujitsu، Giga Computing، HPE، Inventec، Lambda، MiTAC Computing، Nebius، Quanta Cloud Technology، Red Hat، ScitiX، Supermicro و Wiwynn. شرکت Nebius همچنین نتایج پیش‌نمایش خود از Vera Rubin NVL72 را ارائه کرد که انویدیا آن را دارای عملکردی عالی توصیف کرد.

نتیجه نهایی

این جهش ثابت می‌کند که قدرت خام GPU دیگر تنها اهرم رشد نیست. برنده واقعی کسی است که بتواند از «سرویس‌دهی مجزا» استفاده کند، جایی که سیستم پردازش اولیه پرامپت (Prefill) را از تولید توکن‌ها (Decode) جدا می‌کند.

برای کاربر نهایی، این یعنی عامل‌های هوش مصنوعی بدون آن تأخیر آزاردهنده‌ی «تایپ کردن» پاسخ می‌دهند و قادر به استدلال‌های چندمرحله‌ای به صورت آنی هستند. برای مدیر مالی (CFO)، این به معنای کاهش چشمگیر هزینه اجرای مدل‌های پیشرو (Frontier Models) به ازای هر درخواست واحد است. در این رقابت برای بازدهی، حتی رقبای سخت‌افزاری نیز در تلاش‌اند؛ برای مثال تراشه Jalapeño شرکت OpenAI در مقایسه با Blackwell برتری‌هایی در بازدهی انرژی نشان داده است.

در آینده باید منتظر بنچمارک MLPerf Endpoints باشیم که اولین اندازه‌گیری استاندارد برای استنتاج عامل‌محور، فراتر از اعداد ساده‌ی توان عملیاتی را ارائه خواهد داد.

گام بعدی شما

  • اگر در حال طراحی زیرساخت AI هستید، روی معماری‌های Disaggregated Serving تمرکز کنید تا هزینه استنتاج را کاهش دهید.
  • نتایج بنچمارک‌های MLPerf v6.1 را برای مقایسه هزینه-به-عملکرد مدل‌های VLM بررسی کنید.
  • منتظر بنچمارک MLPerf Endpoints باشید تا اولین معیار استاندارد برای استنتاج عامل‌محور منتشر شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت بر اساس اعتبار بنچمارک‌های MLPerf، هزینه‌ی عملیاتی مدل‌های چندوجهی را برای سازمان‌ها به شدت کاهش می‌دهد. در نتیجه، استقرار عامل‌های هوش مصنوعی در محیط‌های تولیدی (Production) از نظر اقتصادی توجیه‌پذیرتر می‌شود.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای سطح رک انویدیا، این تحول اثر مستقیمی بر زیرساخت‌های داخلی ایران ندارد و بیشتر برای پژوهشگران مدل‌های بنیادی اهمیت دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز انویدیا از افزایش TFLOPS خام به سمت بهینه‌سازی توان عملیاتی (Throughput) نشان می‌دهد که عصر «بیشتر داشتن» به عصر «بهینه‌تر مصرف کردن» تغییر کرده است. جداسازی مراحل Prefill و Decode یک چرخش استراتژیک است که اجازه می‌دهد مدل‌های استدلالی سنگین، بدون ایجاد گلوگاه در حافظه، در مقیاس میلیونی سرویس‌دهی شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.