پرش به محتوای اصلی
پرش به محتوای مقاله

فشرده‌سازی ۱ بیتی حافظه KV اندازهٔ دسته‌های پردازشی را ۱۴ برابر کرد

·۱۵ مهر ۱۴۰۵۵ دقیقه مطالعه
گردآورده
حافظه KV حالا گلوگاه است: کوانتیزاسیون ۱-بیتی، تأخیرهای MoE و صورت‌حساب ثانیه‌ای GPU
حافظه KV حالا گلوگاه است: کوانتیزاسیون ۱-بیتی، تأخیرهای MoE و صورت‌حساب ثانیه‌ای GPU
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال از کوانتش وزن‌ها به کوانتش تهاجمی ۱ بیتی در حافظه KV و تغییر مدل تجاری زیرساخت‌ها از رزرو ساعتی به پرداخت ثانیه‌ای.

اگر امروز برای اجرای مدل‌های زبانی هزینه می‌کنید، احتمالاً متوجه شده‌اید که حافظه، نه قدرت پردازش، سد راه شماست. روش جدیدی به نام TaSQ اکنون اجازه می‌دهد اندازهٔ دسته‌های پردازشی (Batch Size) — یعنی تعداد درخواست‌هایی که مدل هم‌زمان پردازش می‌کند — تا ۱۴ برابر افزایش یابد.

این دستاورد با فشرده‌سازی حافظه KV (KV Cache) به تنها ۱ بیت ممکن شده است. حافظه KV — شبیه به یک دفترچه یادداشت سریع است که مدل برای هر توکن تولید شده، تاریخچهٔ گفتگو را در آن می‌نویسد تا مجبور نباشد هر بار همه چیز را از اول بخواند — بزرگ‌ترین گلوگاه حافظه در استنتاج مدرن است. در بسیاری از موارد، هزینهٔ ذخیره این تاریخچه از هزینهٔ خودِ وزن‌های مدل بیشتر می‌شود. این چالش دقیقاً همان چیزی است که در بررسی علت شکست مقیاس‌دهی سنتی در مدل‌های زبانی به عنوان گلوگاه پهنای‌باند حافظه تحلیل کردیم.

برای اکثر کسب‌وکارها، این «دیوار حافظه» به این معناست که با افزایش تعداد کاربران یا طول پرامپت، حافظهٔ GPU (واحد پردازش گرافیکی) فوراً پر می‌شود. این وضعیت تیم‌ها را مجبور می‌کند یا سخت‌افزارهای گران‌تری بخرند یا پنجرهٔ زمینه (Context Window) — یعنی میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، شبیه به میز کاری که جا برای چند ورق دارد — را محدود کنند؛ اتفاقی که کاربرد عامل‌های استدلالی (Reasoning-heavy agents) را از بین می‌برد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی استنتاج اشاره کردیم، رقابت فعلی دیگر بر سر قدرت خام محاسباتی (FLOPs) نیست، بلکه بر سر نحوهٔ جابه‌جایی و ذخیره بهینه داده‌ها در مرحلهٔ رمزگشایی (Decoding) است.

زمینه و بستر «دیوار حافظه»

به گزارش منابع پژوهشی در بازه ۳۰ سپتامبر تا ۷ اکتبر ۲۰۲۶، یک فشار سیستماتیک برای مهندسی «سرویس‌محور» (Serving-aware) ایجاد شده است. هدف، کاهش ردپای حافظه برای سرویس‌دهی به متون طولانی است؛ موضوعی که برای بارهای کاری عامل‌محور (Agentic) که پیش‌پُرکردن (Prefill) سنگینی دارند، حیاتی است.

در این راستا، پیشنهاداتی مانند KITE از شرکت StepFun، استفاده از «گسترش ناوردا KV» (KV-invariant expansion) را مطرح کرده‌اند تا از حافظه‌های پیش‌پُر شده در مرحله رمزگشایی مجدداً استفاده شود. این رویکرد به تیم‌ها اجازه می‌دهد تا از محاسبات تکراری در حلقه‌های پیچیده و چندمرحله‌ای عامل‌ها جلوگیری کنند. این تلاش‌ها در راستای راهکارهای سخت‌افزاری مشابهی است که برای مثال پلتفرم FX100 با مدیریت لایه‌ای حافظه KV توان عملیاتی استنتاج را به طور چشمگیری افزایش داد.

طبق مستندات منتشر شده در ۲ اکتبر ۲۰۲۶، روش TaSQ از وزن‌دهی کانال‌های هدایت‌شده توسط پرس‌وجو (Query-guided channel weighting)، نرمال‌سازی متقاطع (Cross-head normalization) و گروه‌بندی کانال‌های آگاه از کوواریانس (Covariance-aware channel grouping) برای رسیدن به فشرده‌سازی ۱ بیتی استفاده می‌کند. این روش با RoPE سازگار است و می‌تواند در وزن‌های تصویرسازی (Projection weights) و کدبوک‌های موجود ادغام شود. در آزمایش‌های انجام شده روی یک کارت RTX 6000 Ada با پیاده‌سازی SGLang، این متد توان عملیاتی (Throughput) را ۱.۸۷ برابر نسبت به فرمت استاندارد BF16 افزایش داد.

حافظه KV حالا گلوگاه است: کوانتیزاسیون ۱ بیتی، تأخیر در MoE و صورت‌حساب ثانیه‌ای GPU

جزئیات فنی بهینه‌سازی حافظه و محاسبات

پژوهشگران دیگر از زوایای متفاوتی به این مشکل حمله کرده‌اند:

  • PatchKV (۳۰ سپتامبر): یک تکنیک بدون نیاز به آموزش است که از یک «وصله وزنی» (Weight patch) مبتنی بر رگرسیون ریج در فرم بسته استفاده می‌کند که برای هر زمینه (Context) یک بار محاسبه می‌شود. این روش به جای ذخیره در حافظه کش، زمینه از دست رفته را در وزن‌های مدل جایگذاری می‌کند و به عنوان یک لایه بازیابی کیفیت برای تیم‌هایی عمل می‌کند که از حذف تهاجمی حافظه (Aggressive cache eviction) استفاده می‌کنند.

  • DynaCore (۵ اکتبر): یک طراحی مشترک سخت‌افزار-نرم‌افزار است که دارای یک واحد آرایه سیستولیک (Systolic-array) بازپیکربندی‌پذیر و «کوانتش مجزا» (Disaggregated quantization) است. این سیستم از کوانتش دوطرفه برای پیش‌پُرکردن و کوانتش فقط-وزن برای رمزگشایی استفاده می‌کند. گزارش‌ها نشان می‌دهد که این روش زمان تا نخستین توکن (TTFT) را ۳.۵۰ برابر و ۲.۹۷ برابر بهبود بخشیده و زمان هر توکن خروجی (TPOT) را به طور خیره‌کننده‌ای ۳۶.۵۵ برابر و ۸.۰۲ برابر نسبت به مدل‌های پایه افزایش داده است. این نوع بهینه‌سازی‌های کوانتش، مکمل فرمت‌های استقرار مدل مانند GGUF و AWQ هستند که هر کدام برای محیط‌های سخت‌افزاری متفاوتی بهینه شده‌اند.

  • MegaFlux (۳۰ سپتامبر): این روش به مشکل «عقب‌ماندگان GPU» (GPU stragglers) در مدل‌های ترکیب خبره‌ها (MoE) می‌پردازد که ناشی از انحراف در مسیریابی (Routing skew) است. با تبدیل تکثیر خبره‌ها به یک تصمیم در زمان اجرا و خط لوله‌سازی (Pipelining) انتقال وزن و کاهش گرادیان در داخل مگاکرنل، این روش به میانگین هندسی سرعت ۱.۴۵ برابر (در مسیر پیش‌رو) و ۱.۲۸ برابر (در مسیر بازگشت) روی ۸ عدد NVIDIA B200 دست یافت که در حالت اوج به ۲.۶ برابر رسید. همچنین هنگام ادغام در vLLM برای پیش‌پُرکردن DeepSeek-V4-Pro، سرعت کلی را ۱.۱۳ تا ۱.۲۶ برابر افزایش داد.

  • SpecScale (۳۰ سپتامبر): تمرز این روش بر مقیاس‌بندی زمان تست (Test-time-scaling) برای بارهای کاری استدلالی است. این متد با افزودن هرس زودهنگام کاندیداهای ضعیف، حذف تکرار در محاسبات و تأخیر در تأیید (Deferred verification)، سرعت اجرای گمانه‌زنانه را افزایش می‌دهد که نتایج آن در محک‌های MATH و المپیاد مشاهده شده است.

زیرساخت‌ها نیز هم‌گام با این پیشرفت‌ها تغییر می‌کنند. در ۱ اکتبر ۲۰۲۶، پلتفرم Modal خوشه‌های GPU چندگره‌ای خود را به صورت عمومی عرضه کرد. این پلتفرم اکنون از زمان‌بندی گروهی (Gang scheduling) — یعنی تخصیص اتمی N گره گروه‌بندی شده بر اساس منطقه دسترسی (AZ) یا توپولوژی شبکه — و RDMA با سرعت ۶.۴ ترابیت بر ثانیه در هر گره پشتیبانی می‌کند.

این سرعت سخت‌افزاری ضروری است زیرا یک حافظه KV برای مدل Llama 3.1 70B با ۳۲ هزار توکن (حدود ۱۰ گیگابایت) باید در عرض چند صد میلی‌ثانیه بین گره‌ها جابه‌جا شود تا عملکرد مدل حفظ گردد. نکته کلیدی این است که Modal مدل پرداخت را از رزرو ساعتی به پرداخت ثانیه‌ای تغییر داده است؛ تغییری که ریاضیات هزینه برای بارهای کاری توزیع‌شده مانند تولید ویدیو در چندین گره را به‌طور بنیادی عوض می‌کند.

ارائه‌دهندگان تجاری نیز این بهینه‌ها را در قیمت‌های خود اعمال کرده‌اند. در رویداد DevDay ۲۰۲۶ شرکت OpenAI در ۳۰ سپتامبر، مدل GPT-6.1 Sol را با قیمت ۲ دلار و ۱۰ دلار به ازای هر میلیون توکن معرفی کرد، اما برای ورودی‌های کش‌شده (Input Caching)، تخفیف ۹۵ درصدی (۰.۱۰ دلار) ارائه داد. همچنین حالت «Ultrafast» را برای تولید ۳۰۰ توکن در ثانیه روی Codex (۶ برابر سریع‌تر از API) عرضه کرد، هرچند قیمت آن با مبلغ ۶۰ دلار و ۳۰۰ دلار به ازای هر میلیون توکن بسیار بالاتر است.

سایر محک‌ها نیز جهش‌های سریعی را نشان می‌دهند. رمزگشایی گمانه‌زنانه (Speculative Decoding) در llama.cpp به سرعت ۱۱۰ توکن در ثانیه (در مقابل ۳۲.۱ توکن در ثانیه) روی M3 Ultra رسیده است. موتور سرویس‌دهی Baseten نیز زمان رمزگشایی را ۹۰٪ کاهش و TTFT را ۵۷٪ نسبت به مدل‌های پایه متن‌باز کم کرده است. در همین حال، مسیریابی مبتنی بر هزینه از طریق Cline نشان داده است که می‌توان به همان امتیازات محک با هزینه ۰.۲۴ دلار در مقابل ۱۳.۴۱ دلار به ازای هر تسک دست یافت.

هم‌گرایی کوانتش ۱ بیتی، جبران در فضای وزن‌ها و پرداخت ثانیه‌ای نشان می‌دهد که عصر «زور خالص» در مقیاس‌بندی GPU به سقف خود رسیده است. برندگان چرخه بعدی، کسانی نیستند که بیشترین GPU را دارند، بلکه کسانی هستند که می‌توانند بیشترین توکن را از هر گیگابایت VRAM بیرون بکشند.

برای کاربر نهایی، این یعنی شکاف بین مدل‌های «ارزان و کند» و «گران و سریع» عمیق‌تر می‌شود. ما به سمتی می‌رویم که هزینه اضافی را نه برای هوش مدل، بلکه برای کارایی حافظه و سرعت اتصالات می‌پردازیم.

منتظر ادغام TaSQ و PatchKV در موتورهای سرویس‌دهی جریان اصلی مانند vLLM و SGLang باشید، زیرا این‌ها اهرم‌های اصلی برای کاهش هزینه گردش‌های کاری عامل‌محور با زمینه طولانی خواهند بود.

گام بعدی شما

  • اگر از vLLM یا SGLang استفاده می‌کنید، منتظر ادغام TaSQ و PatchKV باشید تا هزینه اجرای عامل‌های با زمینه طولانی را کاهش دهید.
  • مدل‌های پرداخت ثانیه‌ای (مانند Modal) را برای بارهای کاری متناوب جایگزین رزروهای ساعتی کنید تا هزینه‌های زیرساختی را بهینه کنید.
  • در طراحی پرامپت‌ها، از قابلیت Input Caching در APIهای جدید برای کاهش ۹۰ درصدی هزینه‌های ورودی استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحولات با تکیه بر تخصص در مهندسی سیستم، هزینه استنتاج را به‌شدت کاهش داده و امکان اجرای عامل‌های پیچیده را فراهم می‌کند. در نتیجه، دسترسی به مدل‌های سریع و با زمینه طولانی از یک کالای لوکس به یک استاندارد صنعتی تبدیل می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به GPUهای سطح بالا و APIهای جدید، این بهینه‌ها بیشتر برای توسعه‌دهندگانی که از مدل‌های بازمتن روی سخت‌افزارهای محدود استفاده می‌کنند، راهکاری برای کاهش هزینه‌هاست.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از افزایش پارامترها به سمت بهینه‌سازی شدید حافظه در زمان استنتاج تغییر کرده است. این یعنی «بهره‌وری حافظه» جایگزین «قدرت محاسباتی» به عنوان معیار اصلی رقابت شده است. احتمالاً در آینده نزدیک، مدل‌های کوچک‌تر با حافظه بهینه، در عمل سریع‌تر و ارزان‌تر از مدل‌های غول‌پیکر اما ناکارآمد ظاهر خواهند شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.