پرش به محتوای اصلی
پرش به محتوای مقاله

Mingxin FX100: کاهش ۹.۳ برابری زمان بارگذاری مدل DeepSeek-70B

·۲ مرداد ۱۴۰۵۵ دقیقه مطالعه۴ بازدید
بررسی عملکرد NVMe-oF با RoCEv2 در سناریوهای استنتاج هوش مصنوعی: مطالعه موردی FX100
بررسی عملکرد NVMe-oF با RoCEv2 در سناریوهای استنتاج هوش مصنوعی: مطالعه موردی FX100
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل پشته TCP/NFS با RDMA/NVMe-oF در لایه ذخیره‌ساز برای مدل‌های زبانی، که منجر به کاهش ۹.۳ برابری زمان بارگذاری وزن‌ها و ۱۸ برابری توان عملیاتی بازیابی حافظه شده است.

۱۳۹۹ ثانیه؛ این تمام زمانی بود که برای بارگذاری وزن‌های مدل DeepSeek-70B از طریق سیستم‌های سنتی NFS نیاز بود. حالا تصور کنید این زمان به تنها ۱۵۰ ثانیه کاهش یابد.

این جهش ۹.۳ برابری در سرعت، که روی پلتفرم Huawei Atlas 910B اندازه‌گیری شده، یک حقیقت تلخ را برملا می‌کند: پروتکل‌های قدیمی سیستم فایل‌های شبکه‌ای، بزرگ‌ترین گلوگاه در مسیر استنتاج مدل‌های عظیم هستند. چنین تفاوت شدیدی نشان می‌دهد که به‌روزرسانی لایه ذخیره‌ساز برای بارهای کاری هوش مصنوعی دیگر یک انتخاب نیست، بلکه یک ضرورت فنی است.

بسیاری از مراکز محاسباتی هنوز به NFS تکیه می‌کنند؛ سیستمی که به دلیل قفل‌های فایل، عملیات متادیتای پیچیده و تأخیرهای پروتکل TCP، دچار سربار نرم‌افزاری بسیار بالایی است. این موضوع به‌ویژه در لحظات «بازیابی سرد» (Cold Recovery) — یعنی زمانی که باید KV Cache (حافظه کلید-مقدار) پس از یک دوره طولانی از غیرفعال بودن دوباره بارگذاری شود — تبدیل به یک بحران عملکردی و یک ریسک عملیاتی بزرگ می‌شود. همان‌طور که در پوشش‌های پیشین ما درباره نحوه بهینه‌سازی جریان‌های کاری توسط Saymon اشاره کردیم، تمرکز صنعت اکنون از لایه‌های برنامه‌ریزی نرم‌افزاری به لایه‌های سخت‌افزاری خام منتقل شده است، جایی که جابه‌جایی واقعی داده‌ها رخ می‌دهد.

برای حل این مشکل، Mingxin از معماری NVMe-oF (NVMe over Fabrics) روی پروتکل RoCEv2 استفاده می‌کند. این ساختار، دستورات NVMe را مستقیماً روی RDMA (دسترسی مستقیم به حافظه از راه دور) بسته‌بندی می‌کند و به‌طور کامل CPU را دور می‌زند. با حذف پشته TCP، سیستم به تأخیر تک‌پرشی (single-hop latency) بسیار پایین در محدوده ۱ تا ۲ میکروثانیه و پهنای باند ۱۰۰ گیگابیتی (100 GbE) دست می‌یابد. در نتیجه، تأخیر خواندن و نوشتن KV Cache به سرعت حافظه‌های SSD محلی NVMe نزدیک می‌شود.

زمینه: اعتبارسنجی معماری

این مزایای معماری از طریق تست‌های عملکردی با استفاده از Mingxin FX100 روی پلتفرمی متشکل از ۸ پردازنده AMD MI308X اعتبارسنجی شدند. هدف اصلی این آزمایش‌ها، اندازه‌گیری میزان شتاب‌دهی در سناریوهای شتاب‌دهی لایه‌ای KV Cache و همچنین وضعیت‌های بازیابی سرد بود.

در یک بنچ‌مارک خاص، تفاوت در توان عملیاتی (Throughput) بین یک دیسک محلی NVMe به عنوان خط مبنا (PCIe Gen4، ظرفیت ۲ ترابایت) و یک آرایه FX100 (پیکربندی RAID0 چهار دیسکی، RoCEv2، تک پورت ۱۰۰ گیگابیتی) به محدوده قابل قبولی کاهش یافت. با این حال، قدرت واقعی FX100 در بازیابی شبکه‌ای ظاهر شد؛ جایی که توان عملیاتی از ۴.۱ توکن بر ثانیه به ۷۴.۹ توکن بر ثانیه رسید که نشان‌دهنده یک جهش خیره‌کننده ۱۸.۳ برابری است. این نتایج در راستای تلاش‌های گسترده‌تر صنعت برای افزایش نرخ تولید توکن است، مشابه آنچه در بهینه‌سازی استنتاج مدل Qwen3.5 روی پلتفرم DGX Spark مشاهده شد تا سرعت پاسخ‌دهی به استانداردهای تجاری برسد.

کالبدشکافی اعداد و عملکرد

طبق گزارش ۲۴ جولای ۲۰۲۶ منتشر شده در dev.to، دستاوردهای عملکردی در سه محور اصلی متمرکز شده است:

  • بارگذاری مدل: سرعت ۹.۳ برابری ذکر شده در ابتدا، نشان‌دهنده توانایی سیستم در انتقال وزن‌ها به حافظه GPU بدون انباشت تأخیرهای متادیتای NFS است (منبع: اندازه‌گیری شده، گزارش R9).
  • توان عملیاتی بازیابی سرد: در تست‌های انجام شده با یک مدل ۴۸۰ میلیارد پارامتری، توان عملیاتی از ۴.۱ توکن بر ثانیه به ۷۴.۹ توکن بر ثانیه جهش کرد که یک بهبود ۱۸.۳ برابری است (منبع: اندازه‌گیری شده، گزارش R2).
  • کاهش زمان تا نخستین توکن (TTFT): شتاب‌دهی بازیابی سرد، مقدار TTFT را بین ۲۶ تا ۳۲ درصد کاهش داد که مستقیماً سرعت پاسخ‌دهی perceived (از دید کاربر) را بهبود می‌بخشد (منبع: اندازه‌گیری شده، گزارش R2/R3).

بهینه‌سازی LMCache و خواندن موازی

سخت‌افزار به‌تنهایی کافی نیست؛ لایه نرم‌افزاری نیز باید بتواند خواندن‌های موازی را مدیریت کند. در فرآیند استنتاج، خواندن‌های KV Cache اغلب به‌طور هم‌زمان توسط چندین رشته (Thread) انجام می‌شود. پیاده‌سازی‌های سنتی NVMe-oF معمولاً بر خواندن‌های سریال در یک صف واحد متکی هستند که خود باعث ایجاد یک گلوگاه عملکردی جدید می‌شود.

شرکت Mingxin برای رفع این مشکل، وصله (Patch) خواندن موازی LMCache را در نسخه vLLM 0.20.1+rocm721 ادغام کرد. این بهینه‌سازی اجازه می‌دهد سیستم KV Cache را بین صف‌های مختلف I/O توزیع (Shard) کند و به‌طور مؤثر از تأخیرهای صف‌بندی سیستم‌های تک‌صفه اجتناب نماید. این تلاش برای مدیریت بهینه حافظه در لایه نرم‌افزاری، مکمل رویکردهایی است که در تکنولوژی TriAttention برای کاهش مصرف حافظه مدل‌های زبانی به کار گرفته شده است.

نتایج این اقدام بسیار چشمگیر بود. در شرایط بارگذاری دیسک با ۱۶ خواندن سرد هم‌زمان روی یک GPU، مقدار TTFT از ۳۷.۹۷ ثانیه به ۹.۳۰ ثانیه کاهش یافت. این بهبود ۴.۱ برابری با افزایش پهنای باند از ۰.۹۸ گیگابایت بر ثانیه به ۵.۲۳ گیگابایت بر ثانیه همراه بود (منبع: اندازه‌گیری شده، گزارش R1).

الزامات مهندسی برای استقرار

برای بازتولید این نتایج در محیط‌های عملیاتی، تیم‌های فنی باید دو لایه خاص را بهینه کنند:

  • موازی‌سازی چندصفه (Multi-Queue Parallelism): پروتکل NVMe-oF به‌طور بومی از حداکثر ۶۴ هزار صف I/O پشتیبانی می‌کند. درایورها و اپلیکیشن‌ها (مانند vLLM و LMCache) باید به‌درستی پیکربندی شوند تا از این صف‌ها برای جلوگیری از گلوگاه‌های سریال استفاده کنند.
  • کنترل جریان شبکه (Network Flow Control): پروتکل RoCEv2 نیازمند پیکربندی سخت‌گیرانه PFC (کنترل جریان اولویت‌بندی شده) و ECN (اعلان صریح احتقان) است. هرگونه عدم بهینگی در کنترل جریان می‌تواند منجر به گم شدن بسته‌ها (Packet Loss) و بازپخش آن‌ها شود که عملاً مزایای خواندن موازی را از بین می‌برد.

در محیط تست FX100، استفاده از RDMA با آف‌لود سخت‌افزاری، پایداری را بدون گم شدن قابل توجه بسته‌ها تضمین کرد. توصیه می‌شود تصمیم‌گیرندگان پیش از استقرار، تأیید کنند که سوئیچ‌های شبکه آن‌ها از علامت‌گذاری ECN در RoCEv2 پشتیبانی می‌کنند.

حذف محاسبات خارجی در بازیابی سرد

در بازیابی سرد معمولاً یک انتخاب وجود دارد: یا بارگذاری مجدد KV Cache از روی ذخیره‌ساز، یا انجام «محاسبه مجدد خارجی» (External Recalculation) که در آن کل حافظه از روی وزن‌های مدل دوباره محاسبه می‌شود. برای مدل‌های مقیاس بزرگ، مانند مدل‌های ۴۸۰ میلیارد پارامتری، محاسبه مجدد به‌شدت زمان‌بر است.

با استفاده از یک مدل ۴۸۰ میلیارد پارامتری با پیکربندی TP8 و بارگذاری ۱۶ رشته هم‌زمان، مقدار TTFT p50 بدون محاسبه مجدد خارجی، ۱۴۹.۵ ثانیه بود. اما با بهره‌گیری از شتاب‌دهنده ذخیره‌ساز KV Cache در FX100، این مقدار به ۱۱.۸۵ ثانیه کاهش یافت که یک شتاب ۱۲.۶ برابری است. به‌طور کلی، نرخ بهبود برای بازیابی سرد بسته به میزان هم‌زمانی و طول کانتکست، بین ۸.۶ تا ۲۰ برابر متغیر است.

این شتاب به این دلیل ممکن است که خواندن‌های KV Cache از نوع I/O بلوکی بزرگ و متوالی هستند. در حالی که بردارهای KV هر توکن حدود ۲ تا ۴ کیلوبایت هستند، خواندن‌های دسته‌ای (Batch) به سطح مگابایت می‌رسند. عملیات خواندن RDMA در NVMe-oF، وقفه‌های CPU را دور می‌زند و داده‌ها را مستقیماً از NIC به حافظه GPU منتقل می‌کند. در مقابل، پشته TCP در NFS و مکانیسم‌های قفل فایل، ۱۰ تا ۱۰۰ میکروثانیه تأخیر به هر I/O اضافه می‌کنند که در بارهای کاری با هم‌زمانی بالا، منجر به تأخیرهایی در سطح ثانیه می‌شود.

اثر بر سرویس‌های چند‌مستاجری (Multi-tenant)

برای مدیران سرمایه‌گذاری، این تحول در محیط‌های چند‌مستاجری که در آن‌ها مدل‌ها به‌طور مکرر جابه‌جا یا سوئیچ می‌شوند، بیشترین ارزش را دارد. از آنجایی که زمان بازیابی سرد با افزایش طول کانتکست رشد خطی دارد، رویکرد مبتنی بر RDMA تأخیر خواندن را تقریباً ثابت نگه می‌دارد، فارغ از اینکه اندازه مدل چقدر باشد.

این بدان معناست که با حرکت مدل‌ها به سمت کانتکست‌های طولانی‌تر، شکاف عملکردی بین NFS و NVMe-oF تنها بیشتر خواهد شد. توانایی دور زدن وقفه‌های CPU و انتقال مستقیم داده از کارت شبکه به حافظه GPU، ذخیره‌ساز را از یک گلوگاه به یک «لوله شفاف» تبدیل می‌کند.

تیم‌های فنی اکنون می‌توانند این معیارها را از طریق یک فرآیند تست مشترک که Mingxin ارائه می‌دهد، تأیید کنند. این فرآیند تقریباً ۱۰ هفته زمان می‌برد؛ از پذیرش ورود سخت‌افزار (G1) تا تست‌های پایداری (G4). این مسیر به تیم‌ها کمک می‌کند تا معیارهای درون‌باندی (in-band) مانند کاهش TTFT به میزان ۲۵٪ یا بیشتر و بهبود توان عملیاتی ۲۹ تا ۴۰ درصدی را در محیط‌های خاص خود تأیید کنند.

گام بعدی شما

  • بررسی سازگاری سوئیچ‌های شبکه با پروتکل RoCEv2 و قابلیت ECN برای جلوگیری از افت بسته.
  • ارزیابی جایگزینی NFS با NVMe-oF در خوشه‌هایی که نرخ بالای Cold Start دارند.
  • به‌روزرسانی vLLM به نسخه‌هایی که از بهینه‌سازی‌های LMCache برای خواندن موازی پشتیبانی می‌کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره معماری حافظه‌های HBM و تأثیر آن‌ها بر پهنای باند استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف تأخیرهای نرم‌افزاری پروتکل TCP، سرعت پاسخ‌دهی مدل‌های غول‌پیکر را در محیط‌های تجاری به‌شدت افزایش می‌دهد. تخصص Mingxin در لایه RDMA باعث می‌شود هزینه‌های عملیاتی ناشی از انتظار برای بارگذاری مدل (Cold Start) به شکل چشم‌گیری کاهش یابد.

تأثیر برای ایران

این فناوری بیشتر برای اپراتورهای بزرگ مراکز داده و پژوهشگران مدل‌های بنیادی اهمیت دارد و اثر مستقیمی بر کاربران نهایی در ایران ندارد.

·نگاه ما
تحریریه دات‌هوش

انتقال گلوگاه از پردازش به انتقال داده (I/O) در مدل‌های عظیم، نشان می‌دهد که سخت‌افزارهای عمومی برای مقیاس‌های فعلی هوش مصنوعی دیگر پاسخگو نیستند. استفاده از RDMA برای دور زدن CPU، عملاً لایه ذخیره‌ساز را به بخشی از حافظه سیستم تبدیل می‌کند. این روند پیش‌بینی می‌کند که در آینده، مرز بین حافظه رم (RAM) و ذخیره‌سازهای سریع (SSD) در مراکز داده AI کاملاً محو خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.