پرش به محتوای اصلی
پرش به محتوای مقاله

MetaRoCE: انتقال مدیریت ترافیک شبکه از سوئیچ به کارت شبکه برای خوشه‌های AI

·۳ شهریور ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
متا آرآیی، متاروس را معرفی کرد: یک پروتکل انتقال داده از نوع صفر برای اترنت هوش مصنوعی‌محور
متا آرآیی، متاروس را معرفی کرد: یک پروتکل انتقال داده از نوع صفر برای اترنت هوش مصنوعی‌محور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «شبکه بدون اتلاف» به «شبکه دارای اتلاف با بازسازی در لبه»؛ MetaRoCE به‌جای تلاش برای جلوگیری از گم شدن بسته‌ها در سوئیچ، مدیریت خطا و ترتیب‌بندی را به کارت شبکه منتقل می‌کند.

تصور کنید هزاران شتاب‌دهنده گران‌قیمت در یک خوشه، تنها به دلیل تأخیر در یک لینک ارتباطی کوچک، دست از کار کشیده و منتظر بمانند. این همان کابوس «تأخیر دمی» (Tail Latency) است که اکنون به بزرگ‌ترین مانع در مسیر آموزش مدل‌های پیشرو تبدیل شده است. در گذشته، قدرت محاسباتی خام (Raw Compute) محدودیت اصلی برای آموزش و سرویس‌دهی مدل‌های پیشرو بود، اما اکنون گلوگاه به بهره‌وری شبکه تغییر یافته است.

در مقیاس‌های عظیم، عملیات‌های جمعی مانند all-reduce و all-to-all حکم ضربان قلب سیستم را دارند و باید هزاران شتاب‌دهنده را به‌طور هم‌زمان همگام کنند. طبق اعلام متا (Meta)، چون این عملیات‌ها هم‌گام (Synchronous) هستند، کل فرآیند آموزش توسط کندترین انتقال داده محدود می‌شود. این اصطکاک شبکه‌ای یا ازدحام، باعث می‌شود ظرفیت محاسباتی گران‌بهای GPUها بلااستفاده بماند و ناکارآمدی‌های گسترده‌ای در بهره‌وری پردازنده‌های گرافیکی ایجاد شود. برای حل این مشکل، متا پروتکل MetaRoCE را معرفی کرد؛ یک پروتکل انتقال دسترسی مستقیم به حافظه از راه دور (RDMA) که از ابتدا (Clean-sheet) و به‌طور خاص برای بارهای کاری هوش مصنوعی روی اتترنت‌های معمولی (Commodity Ethernet) طراحی شده است.

برای درک نوآوری MetaRoCE، باید ابتدا محدودیت‌های استاندارد RoCE (RDMA over Converged Ethernet) را بشناسیم. RoCE استاندارد بر این فرض بنیادین استوار است که شبکه باید «بدون اتلاف» (Lossless) باشد و هر فریم را دقیقاً به همان ترتیبی که ارسال شده است، تحویل دهد. برای رسیدن به این هدف، این پروتکل به شدت به کنترل جریان اولویت‌بندی (PFC) متکی است که با متوقف کردن ترافیک، از گم شدن بسته‌ها جلوگیری می‌کند. اما این رویکرد مانع از «پاشش بسته‌ها» (Packet Spraying) می‌شود؛ یعنی توزیع بسته‌ها در مسیرهای مختلف برای حداکثر کردن پهنای باند. در شبکه‌های چندصفحه‌ای (Multiplane) و مقیاس‌بزرگ، عدم توانایی در پاشش مؤثر بسته‌ها منجر به ایجاد نقاط داغ (Hotspots) و ازدحام می‌شود که در نهایت باعث توقف‌های زنجیره‌ای PFC می‌گردد که در کل بافت شبکه پخش شده و باعث افت شدید عملکرد می‌شود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی زیرساخت‌های محاسباتی مدل‌های زبانی اشاره کردیم، بهینه‌سازی لایه‌ی انتقال داده به اندازه بهینه‌سازی خودِ مدل اهمیت یافته است. MetaRoCE این فلسفه سنتی را می‌شکند. این پروتکل به‌جای تقاضای یک بافت بدون اتلاف، با اتترنت را به‌طور ذاتی «دارای اتلاف» (Lossy) می‌پذیرد. MetaRoCE مسئولیت ترتیب‌بندی بسته‌ها، انتخاب مسیر و بازیابی خطا را از دوش سوئیچ‌های شبکه برداشته و مستقیماً به کارت شبکه (NIC) منتقل می‌کند.

با این تغییر، MetaRoCE پاشش تهاجمی بسته‌ها در تمام مسیرهای موجود را ممکن می‌سازد. این یعنی پهنای باند کل شبکه (Bisection Bandwidth) به‌طور کامل مورد استفاده قرار می‌گیرد، بدون آنکه خطر مسدود شدن ابتدای صف (Head-of-line blocking) یا ناپایداری‌های مرتبط با PFC وجود داشته باشد. در این معماری، کارت شبکه به یک ارکستراتور هوشمند تبدیل می‌شود که «قصد» ارتباط را از میان بسته‌های تکه‌تکه شده‌ای که بدون ترتیب می‌رسند، بازسازی می‌کند.

این چرخش معماری، شبکه را از یک خط لوله صلب به یک بافت منعطف تبدیل می‌کند. در محیط RoCE استاندارد، بافت شبکه بسته‌ها را می‌بیند و سعی می‌کند یک توالی سختگیرانه را حفظ کند؛ اما در محیط MetaRoCE، بافت شبکه صرفاً داده‌ها را با حداکثر سرعت ممکن جابه‌جا می‌کند، در حالی که منطق بازسازی بر عهده NIC است. این موضوع برای خوشه‌هایی که به صدها هزار GPU در مراکز داده و مناطق (Regions) مختلف گسترش می‌یابند حیاتی است، چرا که در این مقیاس، احتمال ازدحام در حداقل یک لینک تقریباً ۱۰۰٪ است. متا با جداسازی منطق انتقال از تحویل فیزیکی، تضمین می‌کند که کندترین لینک دیگر تعیین‌کننده سرعت کل یک Epoch آموزشی نباشد.

به نقل از مستندات متا، این شرکت متعهد به ایجاد یک اکوسیستم باز برای این فناوری است. متا مشخصات فنی MetaRoCE، یک پیاده‌سازی نرم‌افزاری مرجع و یک مجموعه آزمون انطباق جامع را از طریق پروژه محاسبات باز (OCP) منتشر می‌کند. هدف از این اقدام، جلوگیری از وابستگی به یک فروشنده خاص (Vendor Lock-in) و تشویق یک رویکرد استاندارد برای شبکه‌های هوش مصنوعی در سراسر صنعت است. با این حال، استقرار گسترده این فناوری فوری نیست. متا پیش‌بینی می‌کند که نسخه‌های نهایی، از جمله پیاده‌سازی مرجع نرم‌افزاری بهینه شده با DPDK و چارچوب انطباق تولیدی، در اجلاس جهانی OCP در سال ۲۰۲۶ رسماً منتشر شوند. این جدول زمانی نشان می‌دهد که اگرچه تئوری اثبات شده، اما اکوسیستم سخت‌افزاری برای رسیدن به این استاندارد به زمان نیاز دارد.

در حال حاضر، پشتیبانی سخت‌افزاری در مراحل اولیه است. متا موفق شده است این پروتکل را با استفاده از کارت‌های شبکه برنامه‌پذیر AMD Pensando به نمایش بگذارد که انعطاف‌پذیری لازم برای پیاده‌سازی منطق انتقال جدید در سخت‌افزار تعریف‌شده با نرم‌افزار (Software-defined hardware) را فراهم می‌کنند. گزارش‌ها حاکی از آن است که سایر تولیدکنندگان نیز در حال کار بر روی پیاده‌سازی‌های بومی (Native) هستند تا سربار را بیشتر کاهش و توان عملیاتی را افزایش دهند. برای صنعت، این یک تصمیم بنیادین در معماری بافت شبکه است، نه یک به‌روزرسانی ساده در خرید تجهیزات. این سیگنالی است به سوی «لبه‌های هوشمند»؛ جایی که NICها پیچیدگی لایه انتقال را مدیریت می‌کنند تا هسته شبکه ساده، سریع و مبتنی بر سخت‌افزارهای معمولی باقی بماند.

در نهایت، MetaRoCE پاسخی به این واقعیت است که بارهای کاری هوش مصنوعی به‌طور بنیادین با ترافیک معمولی مراکز داده متفاوت‌اند. انفجارهای عظیم و هم‌گام داده‌ها که مشخصه عملیات all-reduce هستند، نیازمند لایه انتقالی است که بتواند هرج‌ومرج — یعنی گم شدن بسته‌ها و تحویل بدون ترتیب — را بپذیرد و آن را در نقطه انتهایی (Endpoint) حل کند. متا با انتقال هوشمندی به NIC، راه را برای خوشه‌های هوش مصنوعی هموار می‌کند که می‌توانند به‌صورت خطی مقیاس شوند، بدون آنکه توسط محدودیت‌های ذاتی کنترل جریان اتترنت سنتی خفه شوند.

گام بعدی شما

  • بررسی مستندات منتشر شده در OCP برای درک نحوه پیاده‌سازی لایه انتقال در سخت‌افزارهای برنامه‌پذیر.
  • رصد کردن معرفی سخت‌افزارهای Native در سال ۲۰۲۵ که سربار نرم‌افزاری MetaRoCE را حذف می‌کنند.
  • تحلیل اثر این پروتکل بر کاهش هزینه‌های زیرساختی در خوشه‌هایی که از اتترنت معمولی به‌جای InfiniBand استفاده می‌کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell و استراتژی شبکه انویدیا مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف وابستگی به شبکه‌های بدون اتلاف، اجازه می‌دهد خوشه‌های AI بدون افت شدید کارایی، روی سخت‌افزارهای ارزان‌تر و استانداردتر مقیاس شوند. اعتبار این رویکرد با انتشار در OCP و استفاده از سخت‌افزارهای AMD تأیید شده است.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران زیرساخت‌های مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران، زیرا پیاده‌سازی آن نیازمند سخت‌افزارهای خاص NIC و دسترسی به خوشه‌های عظیم GPU است.

·نگاه ما
تحریریه دات‌هوش

انتقال هوشمندی از هسته شبکه به لبه (NIC) نشان می‌دهد که متا در حال حرکت به سمتی است که در آن سخت‌افزارهای Commodity جایگزین زیرساخت‌های اختصاصی و گران‌قیمت مانند InfiniBand شوند. این رویکرد در واقع پذیرش «هرج‌ومرج» در لایه فیزیکی برای دستیابی به مقیاس‌پذیری بی‌نهایت است. به نظر ما، این استراتژی در بلندمدت قدرت چانه‌زنی تولیدکنندگان کارت شبکه را در برابر غول‌های سوئیچینگ افزایش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.