پرش به محتوای اصلی
پرش به محتوای مقاله

پلتفرم FX100 توان عملیاتی استنتاج مدل‌های زبانی را ۴۰٪ افزایش داد

·۱۷ شهریور ۱۴۰۵۵ دقیقه مطالعه
بهینه‌سازی موقعیت مکانی حافظه پنهان KV: از صفحه‌بندی تا ذخیره‌سازی لایه‌ای
بهینه‌سازی موقعیت مکانی حافظه پنهان KV: از صفحه‌بندی تا ذخیره‌سازی لایه‌ای
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از مدیریت فضای حافظه (Paging) به مدیریت جریان داده (Tiering) بر اساس موضعیت مکانی؛ این تغییر باعث شد سرعت بازیابی حافظه در مدل‌های بسیار بزرگ تا ۲۰ برابر افزایش یابد.

اگر برای استقرار مدل‌های زبانی با پنجره‌های متنی عظیم روی سخت‌افزارهای فعلی برنامه‌ریزی می‌کنید، باید بدانید که گلوگاه اصلی دیگر قدرت پردازش خام نیست، بلکه نحوه چیدمان فیزیکی داده‌ها در حافظه است. شرکت Mingxin ثابت کرد که با پیاده‌سازی یک معماری ذخیره‌سازی لایه‌ای (Tiered Storage) برای KV Cache، می‌توان توان عملیاتی (Throughput) استنتاج را بین ۲۹ تا ۴۰ درصد افزایش داد و زمان تا نخستین توکن (Time to First Token - TTFT) را در استقرار‌های مقیاس تولیدی بین ۲۶ تا ۳۲ درصد کاهش داد. این نتایج روی پلتفرم Mingxin FX100 و در سناریوهای بازیابی سرد (Cold-recovery) برای مدل‌های ۴۸۰ میلیارد پارامتری اندازه‌گیری شده و در گزارش‌های R2 و R3 ثبت شده است.

این تحول در حالی رخ می‌دهد که پنجره‌های زمینه در مدل‌های زبانی بزرگ (LLM) از ظرفیت حافظه پهنای‌باند بالا (HBM) تک‌پردازنده فراتر رفته‌اند. در حالی که تلاش‌های قبلی صنعت بر حل مشکل تکه‌تکه شدن حافظه (Fragmentation) در داخل GPU متمرکز بود، چالش فعلی شکاف عظیم پهنای‌باند بین HBM و ذخیره‌سازهای خارجی است. با تکیه بر تحلیل‌های قبلی ما درباره‌ی سخت‌افزارهای تخصصی استنتاج و مدل Mingxin FX100، این تحلیل فنی جدید فاش می‌کند که چگونه «موضعیّت مکانی» (Spatial Locality) یا همان ترتیب فیزیکی قرارگیری داده‌ها، تعیین می‌کند که مدل در بازیابی زمینه‌های بلند، روان عمل کند یا دچار لکنت شود.

شکست سیستم‌های صفحه‌بندی ساده

مدیریت سنتی KV Cache (حافظه کلید-مقدار)، مانند مکانیزم PagedAttention که در vLLM استفاده می‌شود، با حافظه مانند یک سیستم‌عامل مجازی برخورد می‌کند تا از تکه‌تکه شدن فضای حافظه جلوگیری کند. بر اساس مقاله Efficient Memory Management for Large Language Model Serving with PagedAttention (SOSP '23)، انگیزه اصلی برای مدیریت صفحه‌بندی KV Cache، تکه‌تکه شدن HBM است؛ چرا که بلوک‌های آزاد غیرپیوسته را نمی‌توان به طور بهینه مورد استفاده قرار داد و این امر منجر به کاهش بهره‌وری حافظه می‌شود.

اما صفحه‌بندی تنها فضای داخلی HBM را بهینه می‌کند. وقتی زمینه مدل از ظرفیت HBM فراتر رود و نیاز به انتقال (Offload) به ذخیره‌ساز خارجی باشد، موضعیت مکانی به عامل تعیین‌کننده تبدیل می‌شود. دسترسی به KV در حین استنتاج (Inference) از یک نظم زمانی مشخص پیروی می‌کند: توکن‌های جدید تولید شده، تازه‌ترین ورودی‌های KV را می‌خوانند، در حالی که ورودی‌های قدیمی‌تر ممکن است در سناریوهای زمینه بلند، مانند بازگشت به تاریخچه (History Rollback) در گفتگوهای چندمرحله‌ای، دوباره فراخوانی شوند.

اگر چیدمان داده‌ها در آن ذخیره‌ساز با ترتیبی که مدل داده‌ها را می‌خواند همخوانی نداشته باشد، سیستم هزاران درخواست I/O کوچک و تصادفی را فعال می‌کند. این عدم تطابق، جریمه‌ای سنگین در تأخیر (Latency) ایجاد کرده و عملاً سرعت بالای GPU را خنثی می‌کند.

سازوکار ذخیره‌سازی لایه‌ای

شرکت Mingxin این مشکل را با نگاشت مستقیم ترتیب دسترسی زمانی توکن‌ها روی رسانه‌های ذخیره‌سازی فیزیکی حل کرده است. در این معماری لایه‌ای، داده‌ها بر اساس فرکانس دسترسی به دسته‌های زیر تقسیم می‌شوند:

  • داده‌های گرم (Hot Data): در HBM یا رسانه‌های نزدیک به حافظه برای دسترسی فوری قرار می‌گیرند.
  • داده‌های سرد (Cold Data): روی آرایه‌های فلش با پهنای‌باند بالا قرار داده می‌شوند.
  • لایه انتقال (Transport): مسیرهای NVMe-oF با تأخیر کم، بازیابی سریع داده‌های سرد را ممکن می‌سازند.

این بهره‌برداری سیستماتیک از موضعیت مکانی تضمین می‌کند که چیدمان فیزیکی با الگوی دسترسی همسو باشد. در ۸ سپتامبر ۲۰۲۶، داده‌های پلتفرم Mingxin FX100 نشان داد که برای یک مدل ۴۸۰ میلیارد پارامتری (با پیکربندی TP8) تحت بارهای کاری بازیابی سرد زمینه بلند، مقدار p50 برای TTFT از بازه ۱۰.۱۷ تا ۳۵.۷۳ ثانیه به ۷.۵۳ تا ۲۶.۳۵ ثانیه کاهش یافته است. این کاهش دقیقاً در بازه اندازه‌گیری شده ۲۶ تا ۳۲ درصد قرار می‌گیرد (گزارش R2).

تحلیل شکاف عملکرد

بر اساس گزارش‌های R2 و R3، تفاوت عملکرد بین NVMe محلی استاندارد و آرایه All-Flash در FX100 بسیار چشمگیر است. در سناریویی با ۱۶ کاربر هم‌زمان و مدل ۴۸۰ میلیارد پارامتری، TTFT از ۱۴۹.۵ ثانیه (زمانی که مدل مجبور بود حافظه پنهان را از صفر بازسازی کند) به تنها ۱۱.۸۵ ثانیه رسید که نشان‌دهنده شتابی ۱۲.۶ برابری است.

این عدد ۱۴۹.۵ ثانیه‌ای، نمایانگر یک مورد حدی (Extreme Case) است که در آن موضعیت مکانی کاملاً غایب است. FX100 با ماندگاری (Persisting) داده‌های KV و بهینه‌سازی چیدمان بر اساس الگوهای دسترسی، این هزینه را به ۱۱.۸۵ ثانیه کاهش داده و به شتابی بین ۸.۶ تا ۲۰ برابر دست یافته است (گزارش R2).

توان عملیاتی تغییر شدیدتری داشت و از ۴.۱ توکن بر ثانیه به ۷۴.۹ توکن بر ثانیه جهش کرد که نشان‌دهنده افزایش ۱۸.۳ برابری است. دستاوردهای مشابهی در پلتفرم Ascend با استفاده از مدل DeepSeek-70B مشاهده شد، جایی که بار استنتاج از ۱۳۹۹ ثانیه (از طریق NFS) به ۱۵۰ ثانیه کاهش یافت که یک شتاب ۹.۳ برابری است (گزارش R9). این تلاش‌ها برای بهینه‌سازی سخت‌افزاری در کنار راهکارهای نرم‌افزاری مانند استفاده از DSpark برای افزایش سرعت پاسخ‌دهی در سخت‌افزارهای محلی، مسیر دستیابی به استنتاج بلادرنگ را هموارتر می‌کند.

بهینه‌سازی‌های مکمل

این لایه ذخیره‌سازی فیزیکی در کنار بهینه‌سازی‌های منطقی عمل می‌کند. برای مثال، RadixAttention در SGLang بازاستفاده منطقی از KV Cache را از طریق بازاستفاده از درخت پیشوند (Prefix-tree reuse) بهینه می‌کند (NeurIPS '24). در حالی که RadixAttention نرخ برخورد (Hit Rate) حافظه را در گفتگوهای چندمرحله‌ای و سناریوهای پیشوند مشترک بالا می‌برد، ذخیره‌سازی لایه‌ای تضمین می‌کند که هنگام وقوع این برخورد، مسیر فیزیکی به آن داده‌ها کوتاه‌ترین و عریض‌ترین مسیر ممکن باشد. این رویکرد مکمل است با استراتژی‌هایی مانند پیاده‌سازی حافظه معنایی برای کاهش فراخوانی‌های تکراری مدل که با کاهش حجم درخواست‌ها، فشار روی زیرساخت حافظه را می‌کاهد.

علاوه بر این، مقاله Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving (arXiv 2024) تأکید می‌کند که معماری‌های مجزا (Disaggregated) از طریق بازاستفاده از پیشوند-کش و استخر KV بین گره‌ها (Cross-node KV pooling)، مشکلات I/O را کاهش می‌دهند. تحلیل‌های مربوط به توازن‌های طراحی در Mooncake نشان می‌دهد که چیدمان فیزیکی KV مستقیماً بر سربار انتقال بین گره‌ها اثر می‌گذارد که در واقع تجلی موضعیت مکانی در سطح توزیع‌شده است.

محدودیت‌ها و معیارهای انتخاب

بهینه‌سازی موضعیت مکانی یک راهکار جهانی نیست و اثربخشی آن به سه متغیر کلیدی بستگی دارد: توزیع طول زمینه، الگوهای هم‌زمانی و پهنای‌باند رسانه.

  • طول زمینه: برای وظایف با زمینه کوتاه (۲ تا ۸ هزار توکن)، KV Cache معمولاً در HBM جای می‌گیرد و لایه‌بندی ذخیره‌سازی اضافی است. دستاوردهای FX100 در بارهای کاری بالای ۳۲ هزار توکن متمرکز است، جایی که ظرفیت KV به صدها گیگابایت می‌رسد و بسیار فراتر از ۱۹۲ گیگابایت HBM موجود برای هر GPU در پیکربندی تست شده است (گزارش R2).
  • هم‌زمانی (Concurrency): هم‌زمانی مانند یک ضریب عمل می‌کند. کمترین بهبود توان عملیاتی (+۲۹٪) در هم‌زمانی ۸ و بیشترین آن (+۴۰٪) در هم‌زمانی ۱۶ رخ داده است. هم‌زمانی بالاتر، فرصت‌های بیشتری برای بازاستفاده از KV ایجاد کرده و مزایای چیدمان لایه‌ای را تقویت می‌کند.
  • انتخاب سخت‌افزار: هم‌زمانی پایین (کمتر یا مساوی ۸) با زمینه‌های کوتاه را می‌توان با یک درایو NVMe محلی مدیریت کرد. اما هم‌زمانی بالا (بیشتر یا مساوی ۱۶) در کنار زمینه‌های بلند، ذخیره‌سازی لایه‌ای را به یک شرط لازم برای رعایت توافق‌نامه‌های سطح خدمات (SLA) تبدیل می‌کند.

جایگاه در صنعت

این رویکرد با روندهای کلی صنعت همسو است. پلتفرم CMX شرکت NVIDIA نیز به طور مشابه خود را به عنوان یک لایه ذخیره‌سازی زمینه AI-native معرفی کرده (G3.5) و ادعای افزایش تا ۵ برابری توان عملیاتی و ۵ برابری بهره‌وری انرژی نسبت به ذخیره‌سازهای سنتی را دارد. این موضوع تأیید می‌کند که مسیر ذخیره‌سازی خارجی KV اکنون توسط پیشروان سخت‌افزار به عنوان گلوگاه اصلی توان عملیاتی شناخته می‌شود.

برای تیم‌های فنی، این بدان معناست که مسیر ذخیره‌سازی KV دیگر نمی‌تواند یک موضوع ثانویه یا afterthought باشد، بلکه باید به عنوان یک محدودیت معماری درجه اول در نظر گرفته شود. تغییر از صفحه‌بندی (Paging) به لایه‌بندی (Tiering)، در واقع گذار از مدیریت «فضا» به مدیریت «جریان» است.

معماران زیرساخت باید اکنون بارهای کاری خود را بر اساس حاصل‌ضرب «هم‌زمانی در طول زمینه» ارزیابی کنند. اگر استقرار شما شامل هم‌زمانی بالا و زمینه‌های بلند است، لایه ذخیره‌سازی اختصاصی دیگر برای رعایت SLA اختیاری نیست.

برای کمک به تیم‌ها در اعتبارسنجی این دستاوردها، Mingxin یک مدل تعامل تست مشترک محدود (Gated) در بازه زمانی تقریبی ۱۰ هفته ارائه می‌دهد. این فرآیند کاهش TTFT و افزایش توان عملیاتی را تحت بارهای کاری واقعی تأیید می‌کند و در صورتی که اهداف تعیین شده محقق نشوند، امکان خاتمه زودهنگام پروژه وجود دارد.

در آینده منتظر ظهور معماری‌های مجزای بیشتری مانند فریم‌ورک Mooncake باشید که استخر KV را بیشتر از گره‌های پردازشی جدا می‌کند تا این دستاوردها را در سطح کل خوشه‌ها مقیاس‌پذیر کند.

گام بعدی شما

  • تحلیل بارهای کاری خود بر اساس حاصل‌ضرب هم‌زمانی و طول زمینه (Concurrency × Context Length) برای شناسایی نیاز به لایه‌بندی حافظه.
  • بررسی جایگزینی سیستم‌های NFS با مسیرهای NVMe-oF برای کاهش تأخیر در بازیابی KV Cache.
  • مطالعه معماری‌های مجزای KV مانند فریم‌ورک Mooncake برای مقیاس‌پذیری در سطح خوشه.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با رفع گلوگاه I/O در زمینه‌های بلند، استقرار مدل‌های عظیم را از حالت تجربی به حالت عملیاتی با تأخیر پایین می‌برد. تخصص Mingxin در هم‌راستاسازی لایه‌های ذخیره‌سازی با الگوی دسترسی مدل، استانداردی جدید برای زیرساخت‌های سرویس‌دهی LLM ایجاد می‌کند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران زیرساخت مدل‌های بنیادی اهمیت دارد تا بازار مصرف ایران. با این حال، تیم‌های توسعه مدل‌های محلی می‌توانند از استراتژی لایه‌بندی KV برای بهینه‌سازی استنتاج در سخت‌افزارهای محدود استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از بهینه‌سازی فضای حافظه به سمت بهینه‌سازی جریان داده‌ها در حال تغییر است. این رویکرد نشان می‌دهد که در مقیاس مدل‌های ۴۸۰ میلیاردی، سخت‌افزار باید با ساختار زمانی دسترسی به توکن‌ها هم‌راستا شود تا قدرت GPU هدر نرود. در واقع، مدیریت فیزیکی I/O اکنون به اندازه بهینه‌سازی وزن‌های مدل در سرعت استنتاج تعیین‌کننده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.