اگر امروز برای اجرای مدلهای زبانی هزینه میکنید، احتمالاً متوجه شدهاید که حافظه، نه قدرت پردازش، سد راه شماست. روش جدیدی به نام TaSQ اکنون اجازه میدهد اندازهٔ دستههای پردازشی (Batch Size) — یعنی تعداد درخواستهایی که مدل همزمان پردازش میکند — تا ۱۴ برابر افزایش یابد.
این دستاورد با فشردهسازی حافظه KV (KV Cache) به تنها ۱ بیت ممکن شده است. حافظه KV — شبیه به یک دفترچه یادداشت سریع است که مدل برای هر توکن تولید شده، تاریخچهٔ گفتگو را در آن مینویسد تا مجبور نباشد هر بار همه چیز را از اول بخواند — بزرگترین گلوگاه حافظه در استنتاج مدرن است. در بسیاری از موارد، هزینهٔ ذخیره این تاریخچه از هزینهٔ خودِ وزنهای مدل بیشتر میشود. این چالش دقیقاً همان چیزی است که در بررسی علت شکست مقیاسدهی سنتی در مدلهای زبانی به عنوان گلوگاه پهنایباند حافظه تحلیل کردیم.
برای اکثر کسبوکارها، این «دیوار حافظه» به این معناست که با افزایش تعداد کاربران یا طول پرامپت، حافظهٔ GPU (واحد پردازش گرافیکی) فوراً پر میشود. این وضعیت تیمها را مجبور میکند یا سختافزارهای گرانتری بخرند یا پنجرهٔ زمینه (Context Window) — یعنی میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه به میز کاری که جا برای چند ورق دارد — را محدود کنند؛ اتفاقی که کاربرد عاملهای استدلالی (Reasoning-heavy agents) را از بین میبرد.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی استنتاج اشاره کردیم، رقابت فعلی دیگر بر سر قدرت خام محاسباتی (FLOPs) نیست، بلکه بر سر نحوهٔ جابهجایی و ذخیره بهینه دادهها در مرحلهٔ رمزگشایی (Decoding) است.
زمینه و بستر «دیوار حافظه»
به گزارش منابع پژوهشی در بازه ۳۰ سپتامبر تا ۷ اکتبر ۲۰۲۶، یک فشار سیستماتیک برای مهندسی «سرویسمحور» (Serving-aware) ایجاد شده است. هدف، کاهش ردپای حافظه برای سرویسدهی به متون طولانی است؛ موضوعی که برای بارهای کاری عاملمحور (Agentic) که پیشپُرکردن (Prefill) سنگینی دارند، حیاتی است.
در این راستا، پیشنهاداتی مانند KITE از شرکت StepFun، استفاده از «گسترش ناوردا KV» (KV-invariant expansion) را مطرح کردهاند تا از حافظههای پیشپُر شده در مرحله رمزگشایی مجدداً استفاده شود. این رویکرد به تیمها اجازه میدهد تا از محاسبات تکراری در حلقههای پیچیده و چندمرحلهای عاملها جلوگیری کنند. این تلاشها در راستای راهکارهای سختافزاری مشابهی است که برای مثال پلتفرم FX100 با مدیریت لایهای حافظه KV توان عملیاتی استنتاج را به طور چشمگیری افزایش داد.
طبق مستندات منتشر شده در ۲ اکتبر ۲۰۲۶، روش TaSQ از وزندهی کانالهای هدایتشده توسط پرسوجو (Query-guided channel weighting)، نرمالسازی متقاطع (Cross-head normalization) و گروهبندی کانالهای آگاه از کوواریانس (Covariance-aware channel grouping) برای رسیدن به فشردهسازی ۱ بیتی استفاده میکند. این روش با RoPE سازگار است و میتواند در وزنهای تصویرسازی (Projection weights) و کدبوکهای موجود ادغام شود. در آزمایشهای انجام شده روی یک کارت RTX 6000 Ada با پیادهسازی SGLang، این متد توان عملیاتی (Throughput) را ۱.۸۷ برابر نسبت به فرمت استاندارد BF16 افزایش داد.

جزئیات فنی بهینهسازی حافظه و محاسبات
پژوهشگران دیگر از زوایای متفاوتی به این مشکل حمله کردهاند:
PatchKV (۳۰ سپتامبر): یک تکنیک بدون نیاز به آموزش است که از یک «وصله وزنی» (Weight patch) مبتنی بر رگرسیون ریج در فرم بسته استفاده میکند که برای هر زمینه (Context) یک بار محاسبه میشود. این روش به جای ذخیره در حافظه کش، زمینه از دست رفته را در وزنهای مدل جایگذاری میکند و به عنوان یک لایه بازیابی کیفیت برای تیمهایی عمل میکند که از حذف تهاجمی حافظه (Aggressive cache eviction) استفاده میکنند.
DynaCore (۵ اکتبر): یک طراحی مشترک سختافزار-نرمافزار است که دارای یک واحد آرایه سیستولیک (Systolic-array) بازپیکربندیپذیر و «کوانتش مجزا» (Disaggregated quantization) است. این سیستم از کوانتش دوطرفه برای پیشپُرکردن و کوانتش فقط-وزن برای رمزگشایی استفاده میکند. گزارشها نشان میدهد که این روش زمان تا نخستین توکن (TTFT) را ۳.۵۰ برابر و ۲.۹۷ برابر بهبود بخشیده و زمان هر توکن خروجی (TPOT) را به طور خیرهکنندهای ۳۶.۵۵ برابر و ۸.۰۲ برابر نسبت به مدلهای پایه افزایش داده است. این نوع بهینهسازیهای کوانتش، مکمل فرمتهای استقرار مدل مانند GGUF و AWQ هستند که هر کدام برای محیطهای سختافزاری متفاوتی بهینه شدهاند.
MegaFlux (۳۰ سپتامبر): این روش به مشکل «عقبماندگان GPU» (GPU stragglers) در مدلهای ترکیب خبرهها (MoE) میپردازد که ناشی از انحراف در مسیریابی (Routing skew) است. با تبدیل تکثیر خبرهها به یک تصمیم در زمان اجرا و خط لولهسازی (Pipelining) انتقال وزن و کاهش گرادیان در داخل مگاکرنل، این روش به میانگین هندسی سرعت ۱.۴۵ برابر (در مسیر پیشرو) و ۱.۲۸ برابر (در مسیر بازگشت) روی ۸ عدد NVIDIA B200 دست یافت که در حالت اوج به ۲.۶ برابر رسید. همچنین هنگام ادغام در vLLM برای پیشپُرکردن DeepSeek-V4-Pro، سرعت کلی را ۱.۱۳ تا ۱.۲۶ برابر افزایش داد.
SpecScale (۳۰ سپتامبر): تمرز این روش بر مقیاسبندی زمان تست (Test-time-scaling) برای بارهای کاری استدلالی است. این متد با افزودن هرس زودهنگام کاندیداهای ضعیف، حذف تکرار در محاسبات و تأخیر در تأیید (Deferred verification)، سرعت اجرای گمانهزنانه را افزایش میدهد که نتایج آن در محکهای MATH و المپیاد مشاهده شده است.
زیرساختها نیز همگام با این پیشرفتها تغییر میکنند. در ۱ اکتبر ۲۰۲۶، پلتفرم Modal خوشههای GPU چندگرهای خود را به صورت عمومی عرضه کرد. این پلتفرم اکنون از زمانبندی گروهی (Gang scheduling) — یعنی تخصیص اتمی N گره گروهبندی شده بر اساس منطقه دسترسی (AZ) یا توپولوژی شبکه — و RDMA با سرعت ۶.۴ ترابیت بر ثانیه در هر گره پشتیبانی میکند.
این سرعت سختافزاری ضروری است زیرا یک حافظه KV برای مدل Llama 3.1 70B با ۳۲ هزار توکن (حدود ۱۰ گیگابایت) باید در عرض چند صد میلیثانیه بین گرهها جابهجا شود تا عملکرد مدل حفظ گردد. نکته کلیدی این است که Modal مدل پرداخت را از رزرو ساعتی به پرداخت ثانیهای تغییر داده است؛ تغییری که ریاضیات هزینه برای بارهای کاری توزیعشده مانند تولید ویدیو در چندین گره را بهطور بنیادی عوض میکند.
ارائهدهندگان تجاری نیز این بهینهها را در قیمتهای خود اعمال کردهاند. در رویداد DevDay ۲۰۲۶ شرکت OpenAI در ۳۰ سپتامبر، مدل GPT-6.1 Sol را با قیمت ۲ دلار و ۱۰ دلار به ازای هر میلیون توکن معرفی کرد، اما برای ورودیهای کششده (Input Caching)، تخفیف ۹۵ درصدی (۰.۱۰ دلار) ارائه داد. همچنین حالت «Ultrafast» را برای تولید ۳۰۰ توکن در ثانیه روی Codex (۶ برابر سریعتر از API) عرضه کرد، هرچند قیمت آن با مبلغ ۶۰ دلار و ۳۰۰ دلار به ازای هر میلیون توکن بسیار بالاتر است.
سایر محکها نیز جهشهای سریعی را نشان میدهند. رمزگشایی گمانهزنانه (Speculative Decoding) در llama.cpp به سرعت ۱۱۰ توکن در ثانیه (در مقابل ۳۲.۱ توکن در ثانیه) روی M3 Ultra رسیده است. موتور سرویسدهی Baseten نیز زمان رمزگشایی را ۹۰٪ کاهش و TTFT را ۵۷٪ نسبت به مدلهای پایه متنباز کم کرده است. در همین حال، مسیریابی مبتنی بر هزینه از طریق Cline نشان داده است که میتوان به همان امتیازات محک با هزینه ۰.۲۴ دلار در مقابل ۱۳.۴۱ دلار به ازای هر تسک دست یافت.
همگرایی کوانتش ۱ بیتی، جبران در فضای وزنها و پرداخت ثانیهای نشان میدهد که عصر «زور خالص» در مقیاسبندی GPU به سقف خود رسیده است. برندگان چرخه بعدی، کسانی نیستند که بیشترین GPU را دارند، بلکه کسانی هستند که میتوانند بیشترین توکن را از هر گیگابایت VRAM بیرون بکشند.
برای کاربر نهایی، این یعنی شکاف بین مدلهای «ارزان و کند» و «گران و سریع» عمیقتر میشود. ما به سمتی میرویم که هزینه اضافی را نه برای هوش مدل، بلکه برای کارایی حافظه و سرعت اتصالات میپردازیم.
منتظر ادغام TaSQ و PatchKV در موتورهای سرویسدهی جریان اصلی مانند vLLM و SGLang باشید، زیرا اینها اهرمهای اصلی برای کاهش هزینه گردشهای کاری عاملمحور با زمینه طولانی خواهند بود.
گام بعدی شما
- اگر از vLLM یا SGLang استفاده میکنید، منتظر ادغام TaSQ و PatchKV باشید تا هزینه اجرای عاملهای با زمینه طولانی را کاهش دهید.
- مدلهای پرداخت ثانیهای (مانند Modal) را برای بارهای کاری متناوب جایگزین رزروهای ساعتی کنید تا هزینههای زیرساختی را بهینه کنید.
- در طراحی پرامپتها، از قابلیت Input Caching در APIهای جدید برای کاهش ۹۰ درصدی هزینههای ورودی استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو