پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه TriAttention مصرف حافظه مدل‌های زبانی را ۱۰ برابر کاهش داد؟

·۲۹ تیر ۱۴۰۵۵ دقیقه مطالعه
تریک هندسی سه‌گانه: کاهش ۱۰ برابری حافظه LLM بدون افت دقت
تریک هندسی سه‌گانه: کاهش ۱۰ برابری حافظه LLM بدون افت دقت
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مشاهدهٔ runtime با تقریب مثلثاتی برای تعیین اهمیت توکن‌ها؛ این تغییر اجازه می‌دهد فشرده‌سازی حافظه بدون تداخل با FlashAttention و بدون افت شدید صحت (برخلاف SnapKV) انجام شود.

تصور کنید ۳۲٬۰۰۰ توکن در یک زنجیره تفکر (Chain-of-Thought)، ده‌ها گیگابایت از حافظه VRAM را می‌بلعند و سیستم شما را به زانو درآورند. متد جدیدی به نام TriAttention این گلوگاه را هدف گرفته و ردپای حافظه در استنتاج (Inference) مدل‌های با متن بلند را تا ۱۰.۷ برابر کاهش می‌دهد، آن هم بدون هیچ‌گونه افت در دقت.

همان‌طور که در تحلیل قبلی ما درباره‌ی تنظیم کارآمد با پارامتر اندک (PEFT) اشاره کردیم، تمرکز آن متد بر کاهش حافظه در مرحله آموزش از طریق آداپتورهای رتبه-پایین (low-rank adapters) بود؛ اما TriAttention دقیقاً نقطه مقابل را هدف قرار داده است: بهره‌وری زمان اجرا در معادله حافظه. در حالی که PEFT مرحله آموزش را بهینه می‌کند، این روش بر کارایی مدل‌ها در هنگام تولید متون طولانی تمرکز دارد. این متد شکافی حیاتی را پر می‌کند که در آن نتایج فشرده‌سازی آزمایشگاهی، هنگام استقرار در استک‌های سرویس‌دهی واقعی در محیط تولید، معمولاً شکست می‌خورند.

به نقل از پژوهشی که در ۲۰ جولای ۲۰۲۶ توسط MIT، NVIDIA و دانشگاه Zhejiang منتشر شد، فشرده‌سازی‌های فعلی KV Cache به‌دلیل مشکل دیده‌شدن در توجه برق‌آسا (FlashAttention) و تکه‌تکه شدن حافظه صفحه‌ای (Paged Memory Fragmentation) دچار اختلال می‌شوند. این چالش‌ها در مدیریت حافظه، مشابه پیچیدگی‌هایی است که در راهکارهای اشتراک‌گذاری حافظه در سطح سخت‌افزار برای بهینه‌سازی KV Cache مشاهده شده است. طبق این گزارش، روش‌های سنتی برای حذف توکن‌ها (Token Eviction) به کل ماتریس امتیاز توجه نیاز دارند تا تصمیم بگیرند کدام توکن‌ها باید حذف شوند، در حالی که FlashAttention محاسبات را در SRAM تکه‌تکه (tile) می‌کند و هرگز این ماتریس را در حافظه GPU نمی‌نویسد. علاوه بر این، حذف توکن‌ها به روش استاندارد باعث می‌شود توکن‌های «بازمانده» به‌صورت پراکنده در بلوک‌های حافظه قرار گیرند و این امر مانع از آن می‌شود که تخصیص‌دهنده‌های صفحه‌ای (Paged Allocators) بتوانند فضای خالی را بازپس گیرند.

سازوکار فنی

TriAttention به‌جای مشاهده لحظه‌ای در زمان اجرا، از یک ترفند هندسی پیش‌بینانه استفاده می‌کند تا این مشکلات را دور بزند:

  • تمرکز Q/K: تیم تحقیق دریافت که در فضای پیش از RoPE، حدود ۹۰٪ از سرهای توجه حول مراکز پایدار و غیرصفر خوشه‌بندی می‌شوند.
  • تقریب مثلثاتی: چون این مراکز فارغ از موقعیت توالی ثابت می‌ماند، این متد لاجیت‌های توجه را به شکل یک سری مثلثاتی تقریب می‌زند. این یعنی اهمیت توکن‌ها بدون نیاز به ماتریس زنده امتیاز توجه، محاسبه می‌شود.
  • فشرده‌سازی بسته‌بندی پیشرو: برای حل مشکل تکه‌تکه شدن حافظه، سیستم هر ۱۲۸ گام رمزگشایی، توکن‌های بازمانده را به‌طور فیزیکی جابه‌جا کرده تا آن‌ها را در بلوک‌های کم‌تری تجمیع و متراکم کند.

بنچمارک‌های عملکرد

در محک AIME 2025 با تولید ۳۲٬۰۰۰ توکن، TriAttention جهش خیره‌کننده‌ای در بهره‌وری داشت. با استفاده از بودجه حافظه تنها ۳٬۰۷۲ توکن (که نشان‌دهنده کاهش ۱۰ برابری است)، این متد به صحت ۴۰.۸٪ رسید که دقیقاً برابر با حالت توجه کامل بود. در مقابل، رقبایی مثل SnapKV در همین نسبت‌های فشرده‌سازی، شاهد سقوط صحت به حدود ۲۰٪ بودند.

در مجموعه داده MATH 500، TriAttention تنها ۱٬۰۲۴ توکن از مجموع ۳۲٬۷۶۸ توکن را حفظ کرد و امتیاز ۶۸.۴٪ گرفت، در حالی که امتیاز توجه کامل ۶۹.۶٪ بود. این یعنی یک شکاف ناچیز ۱.۲ درصدی در مقابل یک نسبت فشرده‌سازی ۳۲ برابری. در عمل، این پیشرفت اجازه می‌دهد مدلی مثل Qwen3-32B در تکالیف با متن بلند روی یک کارت گرافیک واحد RTX 4090 اجرا شود، در حالی که در حالت عادی، این تسک‌ها باعث بروز خطاهای Out-of-memory می‌شدند.

این تغییر رویکرد از «اندازه‌گیری اهمیت» به «پیش‌بینی اهمیت از طریق هندسه‌ یادگرفته‌شده»، مفروضات بنیادی مدیریت KV Cache را تغییر می‌دهد. با همراستاسازی منطق فشرده‌سازی با محدودیت‌های فیزیکی vLLM و SGLang، محققان صرفه‌جویی نظری را به افزایش واقعی توان عملیاتی (Throughput) تبدیل کرده‌اند. این بهینه‌سازی در لایه استنتاج، مکمل پیشرفت‌هایی در لایه زیرساختی است که برای مثال ترکیب KServe و KEDA برای رفع گلوگاه‌های مقیاس‌دهی GPU در محیط‌های کوبرنتیزی به کار گرفته شده‌اند. افزایش ۲.۵ برابری توان عملیاتی گزارش‌شده نشان می‌دهد که بهره‌وری حافظه اکنون مستقیماً به تحویل سریع‌تر توکن‌ها تبدیل شده است.

برای مهندسان و پژوهشگران، ارزش فوری این متد در ادغام‌های موجود برای llama.cpp با پشتیبانی از HIP/ROCm نهفته است. کسانی که ورک‌لودهای متنی بلند را در مقیاس بالا اجرا می‌کنند، باید جزئیات پیاده‌سازی موجود در مقاله arXiv و مخزن گیت‌هاب accompanying را ارزیابی کنند.

گام بعدی شما

  • بررسی جزئیات پیاده‌سازی در مقاله arXiv و مخزن GitHub مربوطه برای بهینه‌سازی استنتاج مدل‌های محلی.
  • تست جایگزین SnapKV با TriAttention در ورک‌لودهای با پنجره متنی بالا برای کاهش مصرف VRAM.
  • ارزیابی اثر این متد بر تأخیر (Latency) در مدل‌های سری Qwen.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی MIT و انویدیا، محدودیت حافظه VRAM را به عنوان سد اصلی در برابر استنتاج مدل‌های Long-Context می‌شکند. نتیجه این است که هزینه عملیاتی سرویس‌دهنده‌های AI به شدت کاهش و سرعت پاسخ‌دهی مدل‌ها افزایش می‌یابد.

تأثیر برای ایران

این متد فرصتی برای توسعه‌دهندگان ایرانی است تا مدل‌های حجیم مانند Qwen3 را روی سخت‌افزارهای محدودتر (مثل RTX 4090) در محیط‌های محلی اجرا کنند.

·نگاه ما
تحریریه دات‌هوش

انتقال از مشاهدهٔ لحظه‌ای به پیش‌بینی هندسی در KV Cache، پایان عصر «حدس زدن» اهمیت توکن‌هاست. TriAttention ثابت کرد که ساختار توجه در مدل‌های زبانی، نظم ریاضیاتی پیش‌بینی‌پذیرتری از آن چیزی دارد که پیش‌تر تصور می‌شد. این رویکرد اجازه می‌دهد مدل‌های غول‌پیکر را بدون نیاز به سخت‌افزارهای صنعتی، روی GPUهای مصرف‌کننده با همان کیفیت اجرا کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.