تصور کنید ۳۲٬۰۰۰ توکن در یک زنجیره تفکر (Chain-of-Thought)، دهها گیگابایت از حافظه VRAM را میبلعند و سیستم شما را به زانو درآورند. متد جدیدی به نام TriAttention این گلوگاه را هدف گرفته و ردپای حافظه در استنتاج (Inference) مدلهای با متن بلند را تا ۱۰.۷ برابر کاهش میدهد، آن هم بدون هیچگونه افت در دقت.
همانطور که در تحلیل قبلی ما دربارهی تنظیم کارآمد با پارامتر اندک (PEFT) اشاره کردیم، تمرکز آن متد بر کاهش حافظه در مرحله آموزش از طریق آداپتورهای رتبه-پایین (low-rank adapters) بود؛ اما TriAttention دقیقاً نقطه مقابل را هدف قرار داده است: بهرهوری زمان اجرا در معادله حافظه. در حالی که PEFT مرحله آموزش را بهینه میکند، این روش بر کارایی مدلها در هنگام تولید متون طولانی تمرکز دارد. این متد شکافی حیاتی را پر میکند که در آن نتایج فشردهسازی آزمایشگاهی، هنگام استقرار در استکهای سرویسدهی واقعی در محیط تولید، معمولاً شکست میخورند.
به نقل از پژوهشی که در ۲۰ جولای ۲۰۲۶ توسط MIT، NVIDIA و دانشگاه Zhejiang منتشر شد، فشردهسازیهای فعلی KV Cache بهدلیل مشکل دیدهشدن در توجه برقآسا (FlashAttention) و تکهتکه شدن حافظه صفحهای (Paged Memory Fragmentation) دچار اختلال میشوند. این چالشها در مدیریت حافظه، مشابه پیچیدگیهایی است که در راهکارهای اشتراکگذاری حافظه در سطح سختافزار برای بهینهسازی KV Cache مشاهده شده است. طبق این گزارش، روشهای سنتی برای حذف توکنها (Token Eviction) به کل ماتریس امتیاز توجه نیاز دارند تا تصمیم بگیرند کدام توکنها باید حذف شوند، در حالی که FlashAttention محاسبات را در SRAM تکهتکه (tile) میکند و هرگز این ماتریس را در حافظه GPU نمینویسد. علاوه بر این، حذف توکنها به روش استاندارد باعث میشود توکنهای «بازمانده» بهصورت پراکنده در بلوکهای حافظه قرار گیرند و این امر مانع از آن میشود که تخصیصدهندههای صفحهای (Paged Allocators) بتوانند فضای خالی را بازپس گیرند.
سازوکار فنی
TriAttention بهجای مشاهده لحظهای در زمان اجرا، از یک ترفند هندسی پیشبینانه استفاده میکند تا این مشکلات را دور بزند:
- تمرکز Q/K: تیم تحقیق دریافت که در فضای پیش از RoPE، حدود ۹۰٪ از سرهای توجه حول مراکز پایدار و غیرصفر خوشهبندی میشوند.
- تقریب مثلثاتی: چون این مراکز فارغ از موقعیت توالی ثابت میماند، این متد لاجیتهای توجه را به شکل یک سری مثلثاتی تقریب میزند. این یعنی اهمیت توکنها بدون نیاز به ماتریس زنده امتیاز توجه، محاسبه میشود.
- فشردهسازی بستهبندی پیشرو: برای حل مشکل تکهتکه شدن حافظه، سیستم هر ۱۲۸ گام رمزگشایی، توکنهای بازمانده را بهطور فیزیکی جابهجا کرده تا آنها را در بلوکهای کمتری تجمیع و متراکم کند.
بنچمارکهای عملکرد
در محک AIME 2025 با تولید ۳۲٬۰۰۰ توکن، TriAttention جهش خیرهکنندهای در بهرهوری داشت. با استفاده از بودجه حافظه تنها ۳٬۰۷۲ توکن (که نشاندهنده کاهش ۱۰ برابری است)، این متد به صحت ۴۰.۸٪ رسید که دقیقاً برابر با حالت توجه کامل بود. در مقابل، رقبایی مثل SnapKV در همین نسبتهای فشردهسازی، شاهد سقوط صحت به حدود ۲۰٪ بودند.
در مجموعه داده MATH 500، TriAttention تنها ۱٬۰۲۴ توکن از مجموع ۳۲٬۷۶۸ توکن را حفظ کرد و امتیاز ۶۸.۴٪ گرفت، در حالی که امتیاز توجه کامل ۶۹.۶٪ بود. این یعنی یک شکاف ناچیز ۱.۲ درصدی در مقابل یک نسبت فشردهسازی ۳۲ برابری. در عمل، این پیشرفت اجازه میدهد مدلی مثل Qwen3-32B در تکالیف با متن بلند روی یک کارت گرافیک واحد RTX 4090 اجرا شود، در حالی که در حالت عادی، این تسکها باعث بروز خطاهای Out-of-memory میشدند.
این تغییر رویکرد از «اندازهگیری اهمیت» به «پیشبینی اهمیت از طریق هندسه یادگرفتهشده»، مفروضات بنیادی مدیریت KV Cache را تغییر میدهد. با همراستاسازی منطق فشردهسازی با محدودیتهای فیزیکی vLLM و SGLang، محققان صرفهجویی نظری را به افزایش واقعی توان عملیاتی (Throughput) تبدیل کردهاند. این بهینهسازی در لایه استنتاج، مکمل پیشرفتهایی در لایه زیرساختی است که برای مثال ترکیب KServe و KEDA برای رفع گلوگاههای مقیاسدهی GPU در محیطهای کوبرنتیزی به کار گرفته شدهاند. افزایش ۲.۵ برابری توان عملیاتی گزارششده نشان میدهد که بهرهوری حافظه اکنون مستقیماً به تحویل سریعتر توکنها تبدیل شده است.
برای مهندسان و پژوهشگران، ارزش فوری این متد در ادغامهای موجود برای llama.cpp با پشتیبانی از HIP/ROCm نهفته است. کسانی که ورکلودهای متنی بلند را در مقیاس بالا اجرا میکنند، باید جزئیات پیادهسازی موجود در مقاله arXiv و مخزن گیتهاب accompanying را ارزیابی کنند.
گام بعدی شما
- بررسی جزئیات پیادهسازی در مقاله arXiv و مخزن GitHub مربوطه برای بهینهسازی استنتاج مدلهای محلی.
- تست جایگزین SnapKV با TriAttention در ورکلودهای با پنجره متنی بالا برای کاهش مصرف VRAM.
- ارزیابی اثر این متد بر تأخیر (Latency) در مدلهای سری Qwen.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو