اگر امروز برای اجرای مدلهای عظیم هوش مصنوعی هزینه میکنید، باید بدانید که سقف توان پردازشی در حال تغییر است. سیستم جدید Vera Rubin NVL72 توانسته است در بنچمارک Qwen3-VL، توان عملیاتی را ۳.۷ برابر نسبت به نسل قبلی (GB300) افزایش دهد. این جهش عملکردی در واقع سقف استنتاج هوش مصنوعی را بازتعریف میکند.
طبق اعلام انویدیا در ۱۶ سپتامبر ۲۰۲۶، این نتایج بخشی از گزارش MLPerf Inference v6.1 است و نشاندهنده تلاشی تهاجمی برای کاهش هزینه هر توکن برای شرکتهاست. این تحول در حالی رخ میدهد که صنعت از رابطهای چت ساده به سمت گردشهای کاری عاملمحور (Agentic) حرکت میکند؛ یعنی سیستمهایی شبیه به داشتن کارمندانی که نه تنها حرف میزنند، بلکه کارهای پیچیده را مرحلهبهمرحله اجرا میکنند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مراکز داده اشاره کردیم، نبرد فعلی دیگر بر سر قدرت خام محاسباتی نیست، بلکه بر سر توان عملیاتی (Throughput) است؛ یعنی اینکه یک رک سختافزاری در هر ثانیه به چند کاربر پاسخ دهد بدون آنکه تأخیری ایجاد شود. این رویکرد بهینهسازی در پروژههای اخیر نیز دیده میشود، جایی که پلتفرم DSX انویدیا توانست توان عملیاتی توکنها را تا ۲۴ درصد افزایش دهد. برای یک مدیر کسبوکار، این یک محاسبه مستقیم از درآمد هر رک در برابر هزینههای برق و سختافزار است.
متدولوژی و بستر ارزیابی
بسته بنچمارک MLPerf Inference: Datacenter متعلق به انجمن MLCommons است و سرعت پردازش ورودیها و تولید نتایج توسط یک مدل آموزشدیده را اندازهگیری میکند. انویدیا ارقام خود را از بخش «بسته» (Closed) استخراج کرده است. در این بخش، استفاده از همان مدلِ پیادهسازی مرجع الزامی است تا مقایسهای دقیق و «سیب با سیب» بین سختافزارها و چارچوبهای نرمافزاری صورت گیرد.
نتایج Vera Rubin NVL72 در دستهی «پیشنمایش» (Preview) ثبت شده است. طبق قوانین MLCommons، سیستمهایی که در این دسته قرار میگیرند باید در دورهی بعدی ثبتنام، به عنوان سیستمهای «در دسترس» (Available) ارائه شوند. ارقام ذکر شده از وبسایت mlcommons.org و از طریق ورودیهای ثبت شده به شمارههای 6.1-0106 و 6.1-0074 بازیابی شدهاند.
کالبدشکافی بنچمارکها
بر اساس گزارشهای منتشر شده، سیستم Vera Rubin NVL72 در دو مورد از سختترین و پرتوقعترین آزمونهای مجموعه v6.1 برتری مطلق داشت:
- Qwen3-VL: دستیابی به توان عملیاتی تا ۳.۷ برابر بیشتر از GB300 NVL72 در سناریوهای آفلاین، سرور و تعاملی. این نتیجه با استفاده از vLLM و فریمورک استنتاج متنباز NVIDIA Dynamo به دست آمده است.
- DeepSeek-R1: گزارش توان عملیاتی تا ۲.۵ برابر بیشتر نسبت به GB300 NVL72 با بهرهگیری از کتابخانه TensorRT-LLM.
- بار کاری عاملمحور: در تستهای پیشنمایش روی بنچمارک SemiAnalysis AgentX، این سیستم عملکردی ۳۰ برابر بهتر از GB300 ارائه داد.
رمز مهندسی انویدیا
انویدیا این موفقیت را مدیون رویکرد «طراحی مشترک تمامعیار» (Full-stack codesign) میداند. این سیستم از هستههای تنسور ارتقایافته و یک موتور ترنسفورمر برای شتابدهی به هر دو مرحلهی پیشپُرکردن (Prefill) — لحظهای که مدل سوال شما را میخواند و میفهمد — و رمزگشایی (Decoding) — یعنی همان لحظهای که مدل کلمه به کلمه جواب مینویسد — استفاده میکند.
نکته حیاتی، استفاده از دقت NVFP4 است که اثر انگشت حافظه (Memory Footprint) برای وزنهای مدل، مکانیزم Attention و KV Cacheها را کاهش میدهد. این امر اجازه میدهد دادههای بیشتری با سرعت بالاتر و با کمترین افت در کیفیت خروجی جابجا شوند. این سختافزار توسط نسل ششم NVLink و NVLink Switch به هم متصل شده است؛ تکنولوژیای که طبق ادعای انویدیا، نرخ بستههای داده را ۱۰ برابر افزایش و تأخیر (Latency) را ۳ برابر نسبت به استاندارد اترنت کاهش داده است.
مکانیزمهای فنی و مقیاسپذیری
برای رسیدن به این اعداد، انویدیا از چندین تکنیک معماری پیشرفته برای به حداکثر رساندن کارایی استفاده کرده است:
- سرویسدهی مجزا (Disaggregated Serving): این روش مراحل پیشپُرکردن و رمزگشایی را از هم جدا میکند تا استفاده از منابع بهینه شود.
- موازیسازی خبرهها (Expert Parallelism): موازیسازی در مقیاس بزرگ روی لایههای «ترکیب خبرهها» (Mixture-of-Experts) که در مدلهای DeepSeek-R1 و Qwen3-VL به کار رفته، اعمال شده است.
- اتصال در مقیاس رک: دامنه مقیاسپذیری NVL72 زیربنای لازم برای اجرای این تکنیکها را در سطح رک فراهم میکند.
جالب اینجاست که این کارایی در مقیاس بزرگتر هم حفظ شده است. در ثبت نتایج DeepSeek-R1، انویدیا سیستم را از یک رک (۷۲ GPU) به چهار رک (۲۸۸ GPU) گسترش داد و به بازدهی مقیاسپذیری ۹۹ درصدی رسید (ورودیهای 6.1-0073 و 6.1-0074). این یعنی افزودن سختافزار منجر به افزایش تقریباً خطی در عملکرد میشود. این سطح از مقیاسپذیری در رکهای انویدیا پیشتر نیز مورد توجه قرار گرفته بود، بهطوریکه OpenAI برای آموزش نسل جدید مدلهای خود به سیستمهای رکمقیاس GB200 روی آورد.
در بنچمارک متن-به-ویدیو WAN 2.2، سیستم GB300 NVL72 به نرخ ۰.۶۵ ویدیو با کیفیت 720p در هر ثانیه رسید (با میانگین ۵.۷ ثانیه برای هر ویدیو). این رقم نشاندهنده توان عملیاتی ۹ برابر بیشتر و تأخیر ۷.۵ برابر کمتر نسبت به یک نود (Node) واحد است.
همچنین انویدیا گزارش داد که عملکرد GB300 NVL72 در مدل Qwen3-VL در نسخه v6.1 نسبت به v6.0 تا ۱.۶ برابر بهبود یافته است. این پیشرفت ناشی از دقت پایینتر KV Cache، ادغام هستههای بیشتر (Kernel Fusion) و بهینهسازی کرنلها بود. فراتر از مراکز داده، انویدیا نتایج Jetson AGX Thor را با استفاده از کتابخانه TensorRT Edge-LLM در بنچمارک Edge-Agentic با مدل Qwen3.6-27B ثبت کرد.
اکوسیستم و شرکای تجاری
اکوسیستم این فناوری به سرعت در حال گسترش است و ۱۹ شریک تجاری در این دور ارزیابی شرکت کردند. هشت مورد از آنها نتایج خود را روی سیستمهای چند-نودی Blackwell NVL72 ثبت کردند. این شرکا عبارتند از: Azure، Dell Technologies، Oracle Cloud Infrastructure، ASUS، Cisco، CoreWeave، Crusoe، Fujitsu، Giga Computing، HPE، Inventec، Lambda، MiTAC Computing، Nebius، Quanta Cloud Technology، Red Hat، ScitiX، Supermicro و Wiwynn. شرکت Nebius همچنین نتایج پیشنمایش خود از Vera Rubin NVL72 را ارائه کرد که انویدیا آن را دارای عملکردی عالی توصیف کرد.
نتیجه نهایی
این جهش ثابت میکند که قدرت خام GPU دیگر تنها اهرم رشد نیست. برنده واقعی کسی است که بتواند از «سرویسدهی مجزا» استفاده کند، جایی که سیستم پردازش اولیه پرامپت (Prefill) را از تولید توکنها (Decode) جدا میکند.
برای کاربر نهایی، این یعنی عاملهای هوش مصنوعی بدون آن تأخیر آزاردهندهی «تایپ کردن» پاسخ میدهند و قادر به استدلالهای چندمرحلهای به صورت آنی هستند. برای مدیر مالی (CFO)، این به معنای کاهش چشمگیر هزینه اجرای مدلهای پیشرو (Frontier Models) به ازای هر درخواست واحد است. در این رقابت برای بازدهی، حتی رقبای سختافزاری نیز در تلاشاند؛ برای مثال تراشه Jalapeño شرکت OpenAI در مقایسه با Blackwell برتریهایی در بازدهی انرژی نشان داده است.
در آینده باید منتظر بنچمارک MLPerf Endpoints باشیم که اولین اندازهگیری استاندارد برای استنتاج عاملمحور، فراتر از اعداد سادهی توان عملیاتی را ارائه خواهد داد.
گام بعدی شما
- اگر در حال طراحی زیرساخت AI هستید، روی معماریهای Disaggregated Serving تمرکز کنید تا هزینه استنتاج را کاهش دهید.
- نتایج بنچمارکهای MLPerf v6.1 را برای مقایسه هزینه-به-عملکرد مدلهای VLM بررسی کنید.
- منتظر بنچمارک MLPerf Endpoints باشید تا اولین معیار استاندارد برای استنتاج عاملمحور منتشر شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو