پرش به محتوای اصلی
پرش به محتوای مقاله

تراشه‌های Raptor در زیرساخت‌های انویدیا برای کاهش تأخیر استنتاج ادغام شدند

·۱۹ شهریور ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
اتصال پردازنده‌های Raptor D-Matrix به کارخانه‌های هوش مصنوعی انویدیا از طریق NVLink Fusion
اتصال پردازنده‌های Raptor D-Matrix به کارخانه‌های هوش مصنوعی انویدیا از طریق NVLink Fusion
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین ادغام تجاری تراشه‌های XPU شخص ثالث در معماری رک-مقیاس انویدیا از طریق NVLink Fusion؛ گذار از مدل «تک‌تراشه» به مدل «توزیع بار بین سخت‌افزارهای مختلف» در یک رک.

تصور کنید سخت‌افزارهای تخصصی شرکت‌های ثالث بتوانند مستقیماً به قدرتمندترین زیرساخت هوش مصنوعی جهان متصل شوند. این رویایی که اکنون به واقعیت تبدیل شده، حاصل همکاری جدید d-Matrix و انویدیا (NVIDIA) است که در ۱۰ سپتامبر ۲۰۲۶، نقشه‌راهی چندساله برای ادغام تراشه‌های نسل جدید Raptor XPU در معماری رک-مقیاس MGX از طریق NVLink Fusion معرفی کردند.

یک مرکز داده را تصور کنید که در آن بار سنگین محاسبات هوش مصنوعی بین دو نوع «مغز» متفاوت تقسیم شده است. در حالی که GPUهای انویدیا استاندارد طلایی برای آموزش و پردازش‌های اولیه هستند، اما گاهی برای مرحله نهایی تولید پاسخ، بیش از حد سنگین یا کند عمل می‌کنند. d-Matrix سخت‌افزار خود را برای مدیریت همین مرحله نهایی و حساس به تأخیر طراحی کرده است؛ چیزی شبیه به یک تقویت‌کننده سرعت تخصصی برای کارخانه‌های هوش مصنوعی.

زمینه راهبردی

سید شت، مدیرعامل d-Matrix، این همکاری را یک «لحظه تعیین‌کننده» توصیف کرد و اشاره کرد که در حالی که تقاضا برای استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره‌ی آموزش آشپز — به‌شدت در حال افزایش است، سرمایه، زمان و انرژی همچنان محدود هستند. با استفاده از NVLink Fusion و MGX، شرکت d-Matrix می‌تواند سیلیکون‌های خود را در یک معماری خنک‌شونده با مایع (Liquid-cooled) که به‌طور گسترده مستقر شده است، ادغام کند. این امر زمان و ریسک مرتبط با استقرار در مقیاس بزرگ را به‌طور قابل‌توجهی کاهش می‌دهد.

به نقل از جن‌سن هوانگ، مدیرعامل انویدیا، فناوری NVLink Fusion به شرکا اجازه می‌دهد سیلیکون‌های سفارشی خود را با اکوسیستم پیشرفته بسته‌بندی، سیستم‌های رک-مقیاس و شبکه‌سازی انویدیا ادغام کنند. این رویکرد در راستای چشم‌انداز گسترده‌تر انویدیا برای تسریع رسیدن به هوش مصنوعی عمومی است، موضوعی که جن‌سن هوانگ پیش‌تر در تحلیل خود درباره مدل Astra شرکت OpenAI به آن اشاره کرده بود. این اقدام، انتخاب‌های شتاب‌دهنده را برای مشتریانی که در حال ساخت کارخانه‌های هوش مصنوعی جدید در مراکز داده ابری و محلی در سراسر جهان هستند، گسترش می‌دهد.

طبق گزارش انویدیا، این یکپارچگی بر پایه اتصال تراشه‌های Raptor به اکوسیستم گسترده‌تری شامل پردازنده‌های Vera CPU، واحدهای BlueField-4 DPU و شبکه‌سازی Spectrum-X استوار است. این ساختار امکان «استنتاج مجزا» (Disaggregated Inference) را فراهم می‌کند تا هر بار کاری بر اساس ماهیت وظیفه تقسیم شود.

جزئیات فنی و معماری

جزئیات فنی این معماری نشان‌دهنده یک جهش سخت‌افزاری است:

  • تراشه Raptor XPU: یک معماری حافظه‌محوری که از اولین روش پشته‌سازی سه‌بعدی DRAM استفاده می‌کند. در این طراحی، یک تراشه حافظه DRAM و یک تراشه محاسباتی SRAM در یک بسته «دو طبقه» قرار گرفته‌اند. این فناوری پیش‌تر توسط سودِیپ بوجا، مدیر فناوری (CTO)، در کنفرانس Hot Chips ۲۰۲۶ معرفی شده بود.
  • بهبود عملکرد: طبق اعلام انویدیا، NVLink Fusion تأخیر بین XPUها را ۳ برابر کمتر از اترنت استاندارد کرده و نرخ بسته‌ها را ۱۰ برابر افزایش داده است.
  • پهنای باند: این سیستم از طریق نسل ششم NVLink، پهنای باند ۳ ترابایت بر ثانیه (3 TB/s) برای هر XPU در حالت اتصال همگانی (All-to-all) فراهم می‌کند.
  • بهره‌وری انرژی: اتصال NVLink-C2C که XPUها را به CPUها متصل می‌کند، تا ۶ برابر بهینه‌تر از رابط PCIe است.
  • طراحی رک: رک‌های d-Matrix از سینی‌های ماژولار بدون کابل استفاده می‌کنند. این طراحی شامل پردازنده‌های NVIDIA Vera، سوئیچ‌های NVLink، واحدهای BlueField-4 DPU، کارت‌های شبکه ConnectX-9 SuperNIC و شبکه‌سازی اترنت Spectrum-X است.

برای تضمین جریان داده با توان عملیاتی بالا، d-Matrix با شرکت Astera Labs نیز همکاری می‌کند. جیتندرا موهان، مدیرعامل Astera Labs، اظهار داشت که این مشارکت، اتصال اختصاصی برای استنتاج هوش مصنوعی با تأخیر کم را به اکوسیستم می‌آورد. هدف این است که «سرویس‌های توکن سطح ممتاز» برای کاربردهایی که برای سرعت فوق‌العاده هزینه می‌کنند — مثل دستیارهای کدنویسی هوش مصنوعی و عامل‌های صوتی بلادرنگ — فراهم شود.

در این سناریوها، مرحله سنگین پیش‌پُرکردن (Prefill) روی GPUهای انویدیا اجرا می‌شود، اما مرحله حساس رمزگشایی (Decoding) — همان بخشی که هوش مصنوعی کلمات را یکی‌یکی تایپ می‌کند — بر عهده Raptor XPU است. این تقسیم کار، سخت‌افزار را برای هر فاز از فرآیند استنتاج بهینه می‌کند. این رک‌ها به‌گونه‌ای طراحی شده‌اند که در کنار سیستم‌های مبتنی بر GPU، از جمله Vera Rubin NVL72، فعالیت کنند.

اکوسیستم کارخانه هوش مصنوعی

فناوری NVLink Fusion با معماری مرجع DSX انویدیا همسو است؛ معماری‌ای که ساختمان‌ها، توان الکتریکی، سیستم‌های خنک‌کننده، محاسبات و شبکه‌سازی را به‌طور همزمان طراحی می‌کند. این رویکرد جامع در پروژه‌های صنعتی بزرگ نیز به کار گرفته شده است، مشابه آنچه در طراحی کارخانه ۸۰ مگاواتی LG برای ساخت ربات‌های انسان‌نما مشاهده می‌کنیم. نقشه راه NVIDIA Omniverse DSX AI Factory Blueprint یک دوقلوی دیجیتال برای تأسیساتی در مقیاس گیگاوات فراهم می‌کند. نرم‌افزارهای پشتیبان این سیستم شامل NCCL برای بارهای کاری توزیع‌شده، Dynamo و NIXL برای مجزاسازی (Disaggregation) و Mission Control برای مدیریت کلاستر و تله‌متری است.

این حرکت نشان‌دهنده یک چرخش راهبردی برای انویدیا است. با باز کردن پلتفرم NVLink Fusion برای شرکایی چون AWS، Intel، Samsung، Arm، Fujitsu، Marvell و MediaTek، انویدیا از یک فروشنده صرف تراشه به یک «ارکستراتور پلتفرم» تبدیل می‌شود. مشتریان اکنون می‌توانند «کارخانه‌های هوش مصنوعی نیمه‌سفارشی» بسازند و بهترین سیلیکون‌ها را با هم ترکیب کنند — با پشتیبانی از معماری‌های Arm، x86 و RISC-V — در حالی که همچنان در اکوسیستم نرم‌افزاری و سیستم‌های خنک‌کننده انویدیا باقی می‌مانند.

پلتفرم کامل انویدیا اکنون شامل Vera Rubin NVL72، Groq 3 LPX، رک‌های پردازنده Vera، ذخیره‌ساز Vera BlueField-4 STX و شبکه‌سازی اترنت Spectrum-6 SPX است.

برای کاربر نهایی، این یعنی فاصله بین ارسال یک پرامپت و دریافت پاسخ در ابزارهای پیچیده به‌شدت کوتاه می‌شود. همان‌طور که ابر-مقیاس‌ها (Hyperscalers) و نئو-کلودها این رویکرد مجزا را می‌پذیرند، هزینه حفظ تأخیر بسیار پایین در مقیاس وسیع، قابل مدیریت خواهد شد.

شرکت d-Matrix پیش‌بینی می‌کند که تراشه Raptor XPU، که توسط بیش از ۱۰۰ پتنت پشتیبانی می‌شود، تا پایان سال ۲۰۲۶ تولید (Tape-out) شود. انتظار می‌رود اولین دسترسی به رک‌های یکپارچه MGX در سه ماهه چهارم سال ۲۰۲۷ باشد.

گام بعدی شما

  • اگر مدیر زیرساخت هستید، معماری MGX انویدیا را برای جایگزینی GPUهای عمومی با شتاب‌دهنده‌های تخصصی بررسی کنید.
  • توسعه‌دهندگان اپلیکیشن‌های صوتی بلادرنگ، احتمال ظهور سرویس‌های «توکن ممتاز» با تأخیر نزدیک به صفر را در سال ۲۰۲۷ پیش‌بینی کنند.
  • مدل‌های استقرار ترکیبی (GPU + XPU) را به عنوان جایگزینی برای مقیاس‌دهی افقیِ صرفِ GPU در نظر بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این همکاری با تکیه بر اعتبار معماری MGX، استاندارد جدیدی برای کاهش تأخیر در استنتاج مقیاس‌بزرگ ایجاد می‌کند. نتیجه آن، دسترسی به کاربردهای بلادرنگ‌تر و ارزان‌تر برای میلیون‌ها کاربر نهایی است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های سخت‌افزاری، دسترسی مستقیم به این رک‌ها برای مراکز داده ایرانی ناممکن است، اما توسعه‌دهندگان ایرانی که از سرویس‌های ابری (Neoclouds) استفاده می‌کنند، به‌زودی کاهش تأخیر در مدل‌های پیشرفته را حس خواهند کرد.

·نگاه ما
تحریریه دات‌هوش

انویدیا با تبدیل شدن به یک پلتفرم باز، در واقع در حال ایجاد یک «ویندوز سخت‌افزاری» برای مراکز داده است. این استراتژی اجازه می‌دهد رقبای احتمالی در سطح تراشه، به جای جنگ با انویدیا، به بخشی از اکوسیستم آن تبدیل شوند و در عین حال، انویدیا کنترل لایه‌های حیاتی‌تر مثل شبکه و خنک‌کنندگی را در دست داشته باشد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.