پرش به محتوای اصلی
پرش به محتوای مقاله

خوشهٔ OceanStor M900 هواوی ۶۴ پتابایت حافظه برای استنتاج هوش مصنوعی فراهم کرد

·۲۶ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
سیستم ذخیره‌سازی OceanStor M900 حافظه زمینه‌ای پتابایتی را برای ابررایانه‌های SuperPoD هوآوی فراهم می‌کند.
سیستم ذخیره‌سازی OceanStor M900 حافظه زمینه‌ای پتابایتی را برای ابررایانه‌های SuperPoD هوآوی فراهم می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی DRAM با لایه‌ی SSD مشترک برای مدیریت KV Cache در مقیاس پتابایت؛ این اولین بار است که ذخیره‌سازی به‌طور بومی با معناشناسی KV برای کاهش ۹۰ درصدی تأخیر استنتاج ادغام شده است.

اگر امروز در حال توسعهٔ عامل‌هایی هستید که باید هزاران صفحه مستند فنی را به‌طور هم‌زمان تحلیل کنند، احتمالاً با دیوار حافظه برخورد کرده‌اید. هواوی با معرفی OceanStor M900، این دیوار را با فراهم کردن ۶۴ پتابایت ظرفیت KV Cache در یک خوشه واحد فرو ریخت.

طبق اعلام این شرکت در ۱۷ سپتامبر ۲۰۲۶ طی رویداد HUAWEI CONNECT در شانگهای، این سامانه برای پایان دادن به محدودیت‌های حافظه در استنتاج (Inference) — که شبیه لحظهٔ نهایی آشپزی است، نه دوره‌ی آموزش آشپز — طراحی شده است. دیوید وانگ، نایب‌رئیس هیئت‌مدیره و رئیس چرخان هواوی، این محصول را در سخنرانی کلیدی خود با عنوان «پیشبرد دنیای عامل‌محور، ساخت یک بنیاد سیلیکونی مستحکم» معرفی کرد.

گذار به هوش مصنوعی عامل‌محور (Agentic AI)

با تبدیل چت‌بات‌های ساده به عامل‌های هوش مصنوعی (AI Agents) — مثل دستیاران هوشمندی که به‌جای حرف زدن، واقعاً کارهای پیچیده را برای شما انجام می‌دهند — مدل‌ها به سمت ۱۰ تریلیون پارامتر حرکت می‌کنند. این عامل‌ها برای مدیریت وظایف پیچیده و چندمرحله‌ای در بخش‌هایی مانند تحقیقات علمی، مراقبت‌های بهداشتی، امور مالی و خدمات عمومی، به پنجره‌های زمینه (Context Window) — شبیه میز کاری که تعیین می‌کند مدل هم‌زمان چند ورق را در ذهن دارد — با ظرفیت بیش از یک میلیون توکن نیاز دارند. هواوی این تغییر را آغاز عصر «هوش مصنوعی عامل‌محور» می‌نامد؛ عصری که در آن برنامه‌ها به‌طور خودمختار وظایف پیچیده را به سرانجام می‌رسانند.

با این حال، حافظه‌های روی تراشه (On-chip) و DRAM سنتی نمی‌توانند بدون تبدیل شدن به هزینه‌های کمرشکن، با این تقاضاها سازگار شوند. داده‌های KV Cache — که در واقع ذخیره‌سازی داده‌های کلید (Key) و مقدار (Value) تولید شده در طول استنتاج برای جلوگیری از محاسبات تکراری است — به‌سرعت انباشته می‌شوند. این موضوع باعث شده است که حافظه‌های روی تراشه و DRAM هم از نظر ظرفیت و هم از نظر مقرون‌به‌صرفه بودن، به محدودیت‌های نهایی خود برسند.

برای حل این مشکل، هواوی زیرساخت هوش مصنوعی را از یک مدل «محاسبه‌محور» به مدلی تغییر می‌دهد که در آن محاسبات، شبکه و ذخیره‌سازی به‌طور عمیق با یکدیگر همکاری می‌کنند. M900 به‌عنوان یک لایه‌ی «ذخیره‌سازی حافظه زمینه» برای SuperPoDs عمل می‌کند و یک فضای حافظه کاملاً مشترک ایجاد می‌کند که کش را در کل خوشه تجمیع می‌کند. این رویکرد، حافظه روی تراشه، DRAM و SSDها را در یک فضای واحد هماهنگ می‌کند تا گلوگاه‌های استنتاج با زمینه بسیار بلند (Ultra-long context) برطرف شود. این تلاش برای بهینه‌سازی حافظه در راستای روندی است که در آن راهکارهای دیگر نیز مانند پلتفرم FX100 با استفاده از ذخیره‌سازی لایه‌ای KV Cache سعی در افزایش توان عملیاتی استنتاج مدل‌های زبانی دارند.

معماری فنی و عملکرد

معماری M900 بر سه ستون تکنولوژیک اصلی استوار است تا سرعت و مقیاس‌پذیری را حفظ کند:

  • اتصال UnifiedBus: این شبکه یک کش KV چندلایه جهانی با اتصالات تک‌پرشی (One-hop) ایجاد می‌کند. این فناوری ظرفیت کش در دسترس برای هر NPU را از گیگابایت به ترابایت ارتقا می‌دهد که به گفته هواوی، نرخ برخورد (Hit Ratio) کش KV را به‌طور قابل‌توجهی افزایش می‌دهد. این مکانیسم اجازه می‌دهد یک خوشه واحد با گسترش کش SuperPoD از حافظه روی تراشه و DRAM به سمت SSDها، ظرفیت ۶۴ پتابایتی را ارائه دهد.
  • معماری کنترل‌کننده یکپارچه: این سامانه اولین سیستمی است که CPU، واحد کنترل‌کننده شبکه و واحد کنترل‌کننده NAND را با هم ادغام می‌کند. با ارائه معناشناسی (Semantics) بومی KV و حذف تبدیل پروتکل و فورواردینگ توسط CPU، تأخیر دسترسی از میلی‌ثانیه به ۶۰ میکروثانیه رسید که یک کاهش ۹۰ درصدی است.
  • ذخیره‌سازی تطبیقی KV-Aware: این فناوری چرخه عمر داده‌های کش را بر اساس ارزش داده پیش‌بینی می‌کند تا آن‌ها را در رسانه‌های مختلف توزیع نماید. هواوی گزارش می‌دهد که این قابلیت، استقامت SSDها را ۱۶ برابر افزایش داده، از حداکثر ۲۴ بار نوشتن در روز پشتیبانی می‌کند و پایداری سیستم را برای سه سال تضمین می‌نماید که منجر به کاهش هزینه‌های نگهداری و جایگزینی می‌شود.

بر اساس گزارش شرکت، یک خوشه واحد پهنای باند دسترسی تجمیعی ۴۰ ترابایت بر ثانیه را فراهم می‌کند که ۱.۵ برابر بیشتر از راهکارهای رقیب است. در سناریوهای برنامه‌نویسی عملی، این معماری توان عملیاتی توکن‌ها (Token Throughput) را دو برابر کرده و زمان رسیدن به نخستین توکن (Time to First Token) را به نصف کاهش می‌دهد.

زمینه زیرساختی

این تغییر رویکرد نشان می‌دهد که گلوگاه بعدی برای عامل‌های هوش مصنوعی دیگر فقط قدرت پردازشی خام (FLOPS) نیست، بلکه توانایی «به خاطر آوردن» حجم عظیمی از وضعیت‌ها (State) در طول تعاملات طولانی است. هواوی با انتقال KV Cache به یک لایه‌ی مشترک مبتنی بر SSD، در واقع ذخیره‌سازی را به عنوان امتداد RAM در نظر گرفته است. M900 به‌عنوان زیرساخت داده‌ای ضروری برای مراکز داده در مقیاس هایپر (Hyperscale) معرفی شده تا کارایی دسترسی به کش‌های KV در استنتاج‌های عظیم را بهبود بخشد.

برای اپراتورهای تجاری، این بدان معناست که هزینه اجرای عامل‌های با زمینه بلند کاهش می‌یابد، زیرا SSDهای ارزان‌تر جایگزین DRAMهای گران‌قیمت برای ذخیره وضعیت‌های طولانی‌مدت می‌شوند. این امر به سازمان‌ها اجازه می‌دهد عامل‌هایی را مستقر کنند که می‌توانند کل کتابخانه‌های دفترچه‌های راهنمای فنی یا سوابق پزشکی را بدون نیاز به محاسبات تکراری تحلیل کنند.

این خبر در جریان رویداد HUAWEI CONNECT 2026 با تم «پیشبرد دنیای عامل‌محور» ارائه شد. این رویداد از ۱۷ تا ۱۹ سپتامبر در مرکز نمایشگاه و کنوانسیون اکسپو شانگهای و مرکز اکسپو شانگهای برگزار گردید. برنامه این رویداد شامل سه سخنرانی کلیدی، ۲۰ نشست سران (Summit)، بیش از ۶۰ جلسه تخصصی و ۲۰۰ سخنرانی آزاد بود. از میان سخنرانان برجسته می‌توان به جیم زملین (مدیرعامل بنیاد لینوکس)، لیو چینگ‌فنگ (رئیس iFLYTEK) و پیتر ژو (مدیرعامل هواوی کلاود) اشاره کرد.

باید منتظر ماند و دید سایر تامین‌کنندگان سخت‌افزار چگونه به این رویکرد حافظه مشترک پاسخ می‌دهند، زیرا صنعت به سمت «عصر عامل‌محور» حرکت می‌کند؛ جایی که تداوم وضعیت (State Persistence) ارزشمندتر از سرعت خام محاسباتی است.

گام بعدی شما

  • اگر از زیرساخت‌های ابری استفاده می‌کنید، بررسی کنید که آیا لایه‌های حافظه مشترک (Shared Memory) برای کاهش هزینه استنتاج در دسترس هستند یا خیر.
  • در طراحی عامل‌های خود، به جای افزایش مداوم پنجره متنی، روی استراتژی‌های مدیریت حافظه در سطح سخت‌افزار تمرکز کنید.
  • تحولات مربوط به جایگزینی DRAM با SSDهای سریع را در معماری‌های استنتاجی دنبال کنید.

اما اثر این تغییر بر سرعت واقعی پاسخ‌دهی در مدل‌های بازمتن حتی پیچیده‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی vLLM مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با تکیه بر اعتبار مهندسی زیرساخت هواوی، امکان استقرار عامل‌های هوش مصنوعی با حافظه بلندمدت را در مراکز داده فراهم می‌کند. نتیجه این است که تحلیل داده‌های حجیم در لحظه، از یک رویای محاسباتی به یک واقعیت اقتصادی تبدیل می‌شود.

تأثیر برای ایران

به‌دلیل تحریم‌ها، دسترسی مستقیم مراکز داده ایران به سخت‌افزارهای OceanStor محدود است، اما این معماری الگویی برای توسعه‌دهندگان داخلی جهت بهینه‌سازی حافظه در خوشه‌های GPU فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز هواوی بر لایه‌ی ذخیره‌سازی به‌جای افزایش صرفِ قدرت پردازشی، نشان می‌دهد که صنعت در حال پذیرش این واقعیت است که «حافظه» گلوگاه اصلی استنتاج در مقیاس بزرگ است. تبدیل SSD به امتداد RAM، پارادایم سخت‌افزاری را از مدل‌های متمرکز به مدل‌های توزیع‌شده‌ی حافظه می‌برد که در نهایت هزینه هر توکن را برای کاربر نهایی کاهش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.