اگر امروز در حال توسعهٔ عاملهایی هستید که باید هزاران صفحه مستند فنی را بهطور همزمان تحلیل کنند، احتمالاً با دیوار حافظه برخورد کردهاید. هواوی با معرفی OceanStor M900، این دیوار را با فراهم کردن ۶۴ پتابایت ظرفیت KV Cache در یک خوشه واحد فرو ریخت.
طبق اعلام این شرکت در ۱۷ سپتامبر ۲۰۲۶ طی رویداد HUAWEI CONNECT در شانگهای، این سامانه برای پایان دادن به محدودیتهای حافظه در استنتاج (Inference) — که شبیه لحظهٔ نهایی آشپزی است، نه دورهی آموزش آشپز — طراحی شده است. دیوید وانگ، نایبرئیس هیئتمدیره و رئیس چرخان هواوی، این محصول را در سخنرانی کلیدی خود با عنوان «پیشبرد دنیای عاملمحور، ساخت یک بنیاد سیلیکونی مستحکم» معرفی کرد.
گذار به هوش مصنوعی عاملمحور (Agentic AI)
با تبدیل چتباتهای ساده به عاملهای هوش مصنوعی (AI Agents) — مثل دستیاران هوشمندی که بهجای حرف زدن، واقعاً کارهای پیچیده را برای شما انجام میدهند — مدلها به سمت ۱۰ تریلیون پارامتر حرکت میکنند. این عاملها برای مدیریت وظایف پیچیده و چندمرحلهای در بخشهایی مانند تحقیقات علمی، مراقبتهای بهداشتی، امور مالی و خدمات عمومی، به پنجرههای زمینه (Context Window) — شبیه میز کاری که تعیین میکند مدل همزمان چند ورق را در ذهن دارد — با ظرفیت بیش از یک میلیون توکن نیاز دارند. هواوی این تغییر را آغاز عصر «هوش مصنوعی عاملمحور» مینامد؛ عصری که در آن برنامهها بهطور خودمختار وظایف پیچیده را به سرانجام میرسانند.
با این حال، حافظههای روی تراشه (On-chip) و DRAM سنتی نمیتوانند بدون تبدیل شدن به هزینههای کمرشکن، با این تقاضاها سازگار شوند. دادههای KV Cache — که در واقع ذخیرهسازی دادههای کلید (Key) و مقدار (Value) تولید شده در طول استنتاج برای جلوگیری از محاسبات تکراری است — بهسرعت انباشته میشوند. این موضوع باعث شده است که حافظههای روی تراشه و DRAM هم از نظر ظرفیت و هم از نظر مقرونبهصرفه بودن، به محدودیتهای نهایی خود برسند.
برای حل این مشکل، هواوی زیرساخت هوش مصنوعی را از یک مدل «محاسبهمحور» به مدلی تغییر میدهد که در آن محاسبات، شبکه و ذخیرهسازی بهطور عمیق با یکدیگر همکاری میکنند. M900 بهعنوان یک لایهی «ذخیرهسازی حافظه زمینه» برای SuperPoDs عمل میکند و یک فضای حافظه کاملاً مشترک ایجاد میکند که کش را در کل خوشه تجمیع میکند. این رویکرد، حافظه روی تراشه، DRAM و SSDها را در یک فضای واحد هماهنگ میکند تا گلوگاههای استنتاج با زمینه بسیار بلند (Ultra-long context) برطرف شود. این تلاش برای بهینهسازی حافظه در راستای روندی است که در آن راهکارهای دیگر نیز مانند پلتفرم FX100 با استفاده از ذخیرهسازی لایهای KV Cache سعی در افزایش توان عملیاتی استنتاج مدلهای زبانی دارند.
معماری فنی و عملکرد
معماری M900 بر سه ستون تکنولوژیک اصلی استوار است تا سرعت و مقیاسپذیری را حفظ کند:
- اتصال UnifiedBus: این شبکه یک کش KV چندلایه جهانی با اتصالات تکپرشی (One-hop) ایجاد میکند. این فناوری ظرفیت کش در دسترس برای هر NPU را از گیگابایت به ترابایت ارتقا میدهد که به گفته هواوی، نرخ برخورد (Hit Ratio) کش KV را بهطور قابلتوجهی افزایش میدهد. این مکانیسم اجازه میدهد یک خوشه واحد با گسترش کش SuperPoD از حافظه روی تراشه و DRAM به سمت SSDها، ظرفیت ۶۴ پتابایتی را ارائه دهد.
- معماری کنترلکننده یکپارچه: این سامانه اولین سیستمی است که CPU، واحد کنترلکننده شبکه و واحد کنترلکننده NAND را با هم ادغام میکند. با ارائه معناشناسی (Semantics) بومی KV و حذف تبدیل پروتکل و فورواردینگ توسط CPU، تأخیر دسترسی از میلیثانیه به ۶۰ میکروثانیه رسید که یک کاهش ۹۰ درصدی است.
- ذخیرهسازی تطبیقی KV-Aware: این فناوری چرخه عمر دادههای کش را بر اساس ارزش داده پیشبینی میکند تا آنها را در رسانههای مختلف توزیع نماید. هواوی گزارش میدهد که این قابلیت، استقامت SSDها را ۱۶ برابر افزایش داده، از حداکثر ۲۴ بار نوشتن در روز پشتیبانی میکند و پایداری سیستم را برای سه سال تضمین مینماید که منجر به کاهش هزینههای نگهداری و جایگزینی میشود.
بر اساس گزارش شرکت، یک خوشه واحد پهنای باند دسترسی تجمیعی ۴۰ ترابایت بر ثانیه را فراهم میکند که ۱.۵ برابر بیشتر از راهکارهای رقیب است. در سناریوهای برنامهنویسی عملی، این معماری توان عملیاتی توکنها (Token Throughput) را دو برابر کرده و زمان رسیدن به نخستین توکن (Time to First Token) را به نصف کاهش میدهد.
زمینه زیرساختی
این تغییر رویکرد نشان میدهد که گلوگاه بعدی برای عاملهای هوش مصنوعی دیگر فقط قدرت پردازشی خام (FLOPS) نیست، بلکه توانایی «به خاطر آوردن» حجم عظیمی از وضعیتها (State) در طول تعاملات طولانی است. هواوی با انتقال KV Cache به یک لایهی مشترک مبتنی بر SSD، در واقع ذخیرهسازی را به عنوان امتداد RAM در نظر گرفته است. M900 بهعنوان زیرساخت دادهای ضروری برای مراکز داده در مقیاس هایپر (Hyperscale) معرفی شده تا کارایی دسترسی به کشهای KV در استنتاجهای عظیم را بهبود بخشد.
برای اپراتورهای تجاری، این بدان معناست که هزینه اجرای عاملهای با زمینه بلند کاهش مییابد، زیرا SSDهای ارزانتر جایگزین DRAMهای گرانقیمت برای ذخیره وضعیتهای طولانیمدت میشوند. این امر به سازمانها اجازه میدهد عاملهایی را مستقر کنند که میتوانند کل کتابخانههای دفترچههای راهنمای فنی یا سوابق پزشکی را بدون نیاز به محاسبات تکراری تحلیل کنند.
این خبر در جریان رویداد HUAWEI CONNECT 2026 با تم «پیشبرد دنیای عاملمحور» ارائه شد. این رویداد از ۱۷ تا ۱۹ سپتامبر در مرکز نمایشگاه و کنوانسیون اکسپو شانگهای و مرکز اکسپو شانگهای برگزار گردید. برنامه این رویداد شامل سه سخنرانی کلیدی، ۲۰ نشست سران (Summit)، بیش از ۶۰ جلسه تخصصی و ۲۰۰ سخنرانی آزاد بود. از میان سخنرانان برجسته میتوان به جیم زملین (مدیرعامل بنیاد لینوکس)، لیو چینگفنگ (رئیس iFLYTEK) و پیتر ژو (مدیرعامل هواوی کلاود) اشاره کرد.
باید منتظر ماند و دید سایر تامینکنندگان سختافزار چگونه به این رویکرد حافظه مشترک پاسخ میدهند، زیرا صنعت به سمت «عصر عاملمحور» حرکت میکند؛ جایی که تداوم وضعیت (State Persistence) ارزشمندتر از سرعت خام محاسباتی است.
گام بعدی شما
- اگر از زیرساختهای ابری استفاده میکنید، بررسی کنید که آیا لایههای حافظه مشترک (Shared Memory) برای کاهش هزینه استنتاج در دسترس هستند یا خیر.
- در طراحی عاملهای خود، به جای افزایش مداوم پنجره متنی، روی استراتژیهای مدیریت حافظه در سطح سختافزار تمرکز کنید.
- تحولات مربوط به جایگزینی DRAM با SSDهای سریع را در معماریهای استنتاجی دنبال کنید.
اما اثر این تغییر بر سرعت واقعی پاسخدهی در مدلهای بازمتن حتی پیچیدهتر است — به تحلیل ما دربارهی بهینهسازی vLLM مراجعه کنید.




گفتگو