پرش به محتوای اصلی
پرش به محتوای مقاله

زیرساخت CoreWeave: مدیریت صدها پردازنده Vera Rubin به عنوان یک سیستم

·۲۵ شهریور ۱۴۰۵۵ دقیقه مطالعه
خوشه چند رکابی CoreWeave با صدها پردازنده گرافیکی روبین
خوشه چند رکابی CoreWeave با صدها پردازنده گرافیکی روبین
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین اعتبارسنجی تجاری معماری چند-رکی Rubin NVL72 به عنوان یک سرویس ابری؛ تبدیل صدها GPU به یک سیستم واحد برای حذف تأخیر در مدل‌های عامل‌محور.

اگر در حال توسعهٔ مدل‌های هوش مصنوعی هستید که باید زنجیره‌ای از ده اقدام پیچیده را بدون وقفه اجرا کنند، هر میلی‌ثانیه تأخیر در دسترسی به داده می‌تواند کل فرآیند را متوقف کند. CoreWeave با اتصال صدها پردازنده گرافیکی Rubin در یک خوشهٔ واحد، این گلوگاه را برای سیستم‌های عامل‌محور از بین برد.

به نقل از اعلام رسمی این شرکت در ۱۶ سپتامبر ۲۰۲۶، CoreWeave موفق شد سیستم‌های چند-رکی Vera Rubin NVL72 را به صورت یک سرویس ابری قابل اعتماد فعال کند. این دستاورد به معنای تبدیل صدها واحد پردازش گرافیکی (GPU) به یک زیرساخت محاسباتی عظیم است که به جای مجموعه‌ای از سرورهای مجزا، مانند یک موجودیت واحد و یکپارچه عمل می‌کند. این اولین بار است که یک ارائه‌دهنده ابر هوش مصنوعی، این معماری را به عنوان یک سرویس ابری قابل اطمینان اعتبارسنجی کرده است تا بنیادی عظیم برای هوش مصنوعی عامل‌محور ایجاد کند.

چن گلدبرگ، نایب‌رئیس اجرایی محصول و مهندسی در CoreWeave، بیان کرد که اتصال صدها GPU روبیین به عنوان یک خوشه مقیاس‌پذیر واحد، به مشتریانی که در حال ساخت هوش مصنوعی عامل‌محور هستند، امکان مقیاس بیشتر، تکرار سریع‌تر و بهره‌وری بالاتر را می‌دهد؛ چرا که مدل‌ها و عامل‌ها به طور مداوم در حال یادگیری و بهبود هستند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی زیرساخت‌های محاسباتی مدل‌های بنیادی اشاره کردیم، صنعت اکنون از رابط‌های سادهٔ چت به سمت هوش مصنوعی عامل‌محور (Agentic AI) — سیستم‌هایی که مثل یک کارمند متخصص، استدلال‌های چندمرحله‌ای انجام داده و از ابزارهای مختلف استفاده می‌کنند — حرکت کرده است. این رویکرد در حالی توسعه می‌یابد که برخی تلاش می‌کنند توان محاسباتی محلی را برای اجرای این عامل‌ها در دسکتاپ‌های فوق‌فشرده فراهم کنند تا وابستگی به ابر کاهش یابد. این مدل‌ها به شدت به تأخیر (Latency) در دسترسی به داده‌ها حساس هستند؛ یک تأخیر کوچک در یک فراخوانی مدل می‌تواند در زنجیره‌ای از ده اقدام متوالی انباشته شده و کل عامل را متوقف کند. به همین دلیل CoreWeave کل رک‌های سخت‌افزاری را به جای سرورهای پراکنده، یکپارچه کرده است.

جزئیات سخت‌افزاری

هر رک Vera Rubin NVL72 یک نیروگاه متراکم است که بر اساس طراحی نسل سوم MGX ساخته شده است. طبق مستندات انویدیا (NVIDIA)، هر رک شامل موارد زیر است:

  • ۷۲ پردازنده گرافیکی Rubin همراه با ۳۶ پردازنده مرکزی Vera.
  • ۲۰.۷ ترابایت حافظه HBM4 با پهنای باند ۱,۴۰۰ ترابایت بر ثانیه.
  • ۳,۶۰۰ PFLOPS توان محاسباتی برای استنتاج (Inference) در قالب فرمت NVFP4 — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز.
  • نسل ششم NVLink با پهنای باند ۲۱۶ ترابایت بر ثانیه.
  • ۳۶ پردازنده مرکزی Vera با ۳,۱۶۸ هسته اختصاصی Olympus و تا ۵۴ ترابایت حافظه LPDDR5X.

برای اتصال این رک‌ها، CoreWeave از شبکه اترنت NVIDIA Spectrum-X استفاده می‌کند. هر GPU روبیین به دو کارت شبکه ConnectX-9 SuperNIC مجهز است که اتصال ۱.۶ ترابیت بر ثانیه را برای ارتباطات مقیاس‌پذیر (scale-out) از طریق مسیرهای چندصفحه‌ای و چندریلی فراهم می‌کند. این طراحی ماژولار اجازه می‌دهد تا تقریباً ۱۲۸,۰۰۰ پردازنده گرافیکی در هر ریل، در یک ساختار بدون مسدودسازی (non-blocking fabric) متصل شوند، بدون اینکه هنگام گسترش شبکه، نیاز به بازطراحی کامل سیستم باشد.

ارکستراسیون خودکار

مدیریت این مقیاس عظیم نیازمند اتوماسیون کامل است. CoreWeave چندین رک را به عنوان یک سیستم واحد از طریق کنترل خودکار چرخه حیات رک، اعتبارسنجی در سطح سیستم و مقیاس‌بندی شبکه فعال می‌کند.

CoreWeave از سیستمی به نام Mission Control برای مدیریت چرخه حیات رک‌ها از طریق کنترل‌کننده Rack LifeCycle استفاده می‌کند. این اتوماسیون چندین وظیفه حیاتی در مرحله راه‌اندازی را پوشش می‌دهد:

  • شناسایی سخت‌افزار (Hardware detection)
  • به‌روزرسانی فریم‌ورها (Firmware updates)
  • اعتبارسنجی سیستم (System validation)
  • مدیریت توان و خنک‌کننده (Power and cooling management)

ابزاری به نام Racky کنترل سطح رک و ابزار Valvey عملیات خنک‌کننده را مدیریت می‌کنند. طبق گزارش شرکت، هیچ رکی پیش از گذراندن یک سری تست‌های سخت‌گیرانه تشخیص میدانی انویدیا و آزمون‌های فشار کاری (workload testing) در سطح کامل رک، وارد مرحله تولید نمی‌شود. تنها رک‌هایی که به عنوان یک سیستم کامل این استانداردها را پاس کنند، فعال می‌شوند.

رفع گلوگاه داده‌ها

قدرت محاسباتی زمانی بی‌فایده است که GPUها منتظر دریافت داده باشند. CoreWeave برای حل این مشکل، AI Object Storage را با شتاب‌دهنده LOTA (Local Object Transport Accelerator) معرفی کرد. LOTA با اعمال حافظه پنهان (Caching) مدیریت‌شده روی هر گنه سرویس کوبرنتیز (Kubernetes) در CoreWeave، سرعت خواندن داده‌ها را به سطح حافظه‌های NVMe محلی می‌رساند و تأخیر را در مقایسه با خوشه‌های ذخیره‌سازی سنتی ۸ برابر کاهش می‌دهد. این سیستم تا ۷ گیگابایت بر ثانیه پهنای باند برای هر GPU فراهم می‌کند و با رشد خوشه‌ها، به صورت خطی مقیاس می‌پذیرد.

برای تیم‌های جهانی، قابلیت جدید شتاب‌دهی نوشتن بین‌منطقه‌ای (cross-region write acceleration) اضافه شده است. این یعنی نقاط بازرسی (Checkpoints) ابتدا با سرعت و تأخیر محلی در همان منطقه ذخیره شده و سپس در پس‌زمینه به یک منطقه دوم دورتر منتقل می‌شوند. از آنجایی که اپلیکیشن تنها یک «باکت» (Bucket) واحد را می‌بیند، هیچ تغییری در کدنویسی لازم نیست و قوانین دسترسی و نگهداری داده‌ها، فارغ از مبدأ نوشتن، یکسان باقی می‌مانند. این ویژگی توقف‌های زمان آموزش را به حداقل می‌رساند و نیاز به جابجایی دستی داده‌ها بین مناطق را از بین می‌برد.

سسیل رابرت-میشون، مدیر زیرساخت داخلی در شرکت Cohere، تأیید کرد که این ساختار یکپارچه باعث می‌شود زمان‌بندی آموزش مدل‌ها دیگر تابع تأخیرهای بازیابی داده بین‌منطقه‌ای نباشد و بیان کرد: «ذخیره‌ساز AI Object در CoreWeave به ما یک ردپای داده‌ای یکپارچه در مناطق مختلف می‌دهد که خواندن آن‌ها به صورت محلی کش می‌شود، بنابراین هیچ بخشی از فرآیند منتظر شبکه نمی‌ماند.»

همچنین یک لایه Archive کم‌هزینه برای ذخیره داده‌هایی که تیم‌ها معمولاً حذف می‌کنند اضافه شده است؛ مانند مجموعه‌داده‌های مورد نیاز برای بازتولید یک نتیجه، نسخه‌های مدل برای مراجعات آینده، یا نقاط بازرسی از اجرای مدلی که تقریباً به نتیجه رسیده بود. این لایه هیچ هزینه‌ای برای بازیابی داده‌ها، حذف زودهنگام یا خواندن از لایه آرشیو ندارد.

مزیت رقابتی و کاهش هزینه‌ها

این زیرساخت برای کاهش شدید هزینه استدلال‌های عمیق طراحی شده است. انویدیا ادعا می‌کند Vera Rubin NVL72 می‌تواند مدل‌های ترکیب خبره‌ها (Mixture-of-Experts) — مدلی که شبیه به یک بیمارستان است و هر سؤال را به پزشک متخصص همان حوزه ارجاع می‌دهد — را تنها با یک‌چهارم پردازنده‌های مورد نیاز در نسل قبلی (GB200 NVL72) آموزش دهد.

در بخش استنتاج، هدف کاهش ۱۰ برابری هزینه به ازای هر میلیون توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد — برای هوش مصنوعی عامل‌محور است، به طوری که تا ۱۰ برابر توکن بیشتر به ازای هر مگاوات انرژی تولید شود.

CoreWeave با کسب رتبه پلاتینیوم در SemiAnalysis ClusterMAX 1.0 و 2.0، خود را به عنوان جایگزین اصلی ابر-سرویس‌دهنده‌های بزرگ (Hyperscalers) معرفی کرده است. این شرکت به نتایج رکوردشکن بنچمارک MLPerf در هر دو بخش استنتاج و آموزش اشاره کرده است. علاوه بر این، بنچمارک‌های مستقل توسط Artificial Analysis، شرکت CoreWeave را در رتبه اول سرعت استنتاج و نسبت قیمت به عملکرد برای مدل‌های Kimi K2.6 و Kimi K2.7 Code متعلق به Moonshot AI قرار داده است.

در واقع، تغییر بنیادین در اینجا، گذار از ارائه «ماشین‌های مجازی» به سمت ارائه «ابرکامپیوتر به عنوان سرویس» (Supercomputer-as-a-Service) است. این تحول در لایه سخت‌افزار با تلاش‌هایی برای انتقال هوش مصنوعی به هسته سیستم‌عامل لینوکس همسو است تا مدیریت منابع در سطح پایین‌تر و بهینه‌تر صورت گیرد.

باید رصد کرد که این تغییر سخت‌افزاری چگونه بر انتشار مدل‌های استدلالی نسل بعد در آزمایشگاه‌هایی مانند Cohere تأثیر می‌گذارد، چرا که گلوگاه اصلی از توان محاسباتی خام (FLOPs) به بهره‌وری شبکه اتصال (Interconnect Fabric) منتقل شده است.

گام بعدی شما

  • اگر از مدل‌های استدلالی سنگین استفاده می‌کنید، تأثیر پهنای باند interconnect را در سرعت پاسخ‌دهی مدل‌های خود بسنجید.
  • برای کاهش هزینه استنتاج در مقیاس بالا، معماری‌های مبتنی بر Rubin را در نقشه راه زیرساختی خود قرار دهید.
  • بررسی کنید که آیا سیستم ذخیره‌سازی فعلی شما گلوگاه سرعت GPUهای شماست یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این استقرار با تکیه بر اعتبار فنی انویدیا، هزینه استنتاج مدل‌های پیچیده را تا ۱۰ برابر کاهش می‌دهد. این تغییر باعث می‌شود عامل‌های هوش مصنوعی از حالت نمونه‌های اولیه خارج شده و در مقیاس صنعتی قابل بهره‌برداری باشند.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های دسترسی به سخت‌افزارهای انویدیا، این زیرساخت مستقیماً در دسترس توسعه‌دهندگان ایرانی نیست و بیشتر اهمیت آن در کاهش هزینه‌های API سرویس‌های ابری جهانی برای کاربران ایرانی است.

·نگاه ما
تحریریه دات‌هوش

تمرکز CoreWeave بر تبدیل رک‌های سخت‌افزاری به یک موجودیت واحد، نشان می‌دهد که در عصر مدل‌های استدلالی، قدرت خام FLOPs دیگر اولویت اول نیست، بلکه «کارایی اتصال» (Interconnect Efficiency) تعیین‌کننده است. این رویکرد عملاً مرز بین دیتاسنترهای ابری و ابرکامپیوترهای تحقیقاتی را از بین می‌برد و مدل‌های عامل‌محور را از محیط آزمایشگاه به محیط عملیاتی تجاری می‌برد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.