هزینهٔ حافظه برای «بهخاطر سپردن»، اکنون معمار اصلی قدرتمندترین هوش مصنوعیهای جهان است. تا ۹ اوت ۲۰۲۶، طراحی مدلهای زبانی پیشرو دیگر تنها بر اساس تعداد پارامترها نیست، بلکه بر مدیریت KV Cache (حافظه کلید-مقدار) — یعنی ردپای حافظهای که هنگام رمزگشایی خودبازگشتی باقی میماند — متمرکز شده است.
برای متخصصان, KV Cache بزرگترین گلوگاه در محیط عملیاتی است. در حالی که وزنهای مدل ثابت هستند، این حافظه با هر توکن جدید و هر کاربر همزمان بهصورت خطی رشد میکند. طبق یک راهنمای فنی در dev.to، این یعنی در پنجرههای متنی بلند، حافظه نه وزنهای مدل، بلکه همین کش است که بخش اعظم حافظه شتابدهنده را میبلعد.
مکانیسم حافظه کش
در طول تولید متن، یک ترنسفورمر (Transformer) — شبیه به مهندسی که برای سرعت بیشتر، نتایج محاسبات قبلی را روی کاغذ مینویسد تا دوباره آنها را حساب نکند — بردارهای کلید و مقدار هر توکن گذشته را ذخیره میکند تا در هر گام نیازی به محاسبه مجدد نباشد. این بهای رمزگشایی سریع است و هزینه آن با فرمولی بیرحمانه محاسبه میشود:
KV bytes = 2 (K and V) × layers × kv_heads × head_dim × seq_len × batch × dtype_bytes
دو پیامد فوری از این ریاضیات استخراج میشود. نخست، کش با اندازه بستر متن و اندازه دسته رشد میکند؛ یعنی دو برابر شدن متن، حافظه را دو برابر میکند. دوم، رمزگشایی محدود به پهنایباند حافظه است، نه قدرت محاسباتی. تولید یک توکن واحد نیازمند دسترسی به کل حافظه کش است. شما با محدودیت FLOPs روبرو نیستید، بلکه محدود به سرعت انتقال داده از حافظه پهنایباند بالا (HBM) هستید. برای درک عمیقتر از نحوه پردازش دادهها در این لایهها، میتوانید کالبدشکافی مهندسی مدلهای زبانی را که از توکنسازی تا حافظه خارجی را بررسی میکند، مطالعه کنید.
تصور کنید KV Cache مثل یک تختهسفید است که هوش مصنوعی باید پیش از نوشتن هر کلمه جدید، تمام آن را بخواند. اگر تخته بیش از حد بزرگ شود، مدل تمام وقتش را صرف اسکرول کردن یادداشتهای قدیمی میکند، نه فکر کردن. بنابراین، کوچک کردن کش مستقیمترین راه برای افزایش تعداد توکن در ثانیه است.
تکامل روشهای کاهش حافظه
برای حل این مشکل، صنعت از چندین فاز معماری عبور کرده است تا فرمول KV را بدون تخریب مدل کوچک کند:
- از MQA به GQA (کاهش سرهای KV): ابتدا توجه تک-پرسوجو (MQA) سعی کرد تمام سرهای پرسوجو را روی یک سر KV مشترک جمع کند. در حالی که این کار کاهش حافظه چشمگیری ایجاد کرد، اما اغلب به قیمت افت کیفیت و ناپایداری در آموزش تمام شد. توجه پرسوجوی گروهی (GQA) سازشی بود که پیروز شد. با تقسیم سرهای پرسوجو به گروهها (مثلاً ۸ سر KV برای ۶۴ سر پرسوجو)، بیشترِ صرفهجویی MQA را با افت کیفیت بسیار کمتر به دست آورد. GQA اکنون پیشفرض اکثر مدلهای وزنهای باز (Open Weights) است.
- MLA (توجه نهان چندسر): رویکردی تهاجمیتر که مستقیماً به حاصلضرب
head_dim × kv_headsحمله میکند. بهجای ذخیره سرهای کمتر، MLA یک نهان کمرتبه (low-rank latent) را ذخیره میکند. کلیدها و مقادیر به یک بردار نهان کوچک و مشترک فشرده شده و در کش ذخیره میشوند، و سپس سرهای K و V برای هر سر در لحظه بازسازی میشوند. این اجازه میدهد مدلها پنجرههای متنی عظیم را در سطور حافظه بهینه و مناسب برای سرویسدهی مدیریت کنند. - توجه خطی و SSMها: مدلهایی مثل Mamba عملیات را به صورت یک بازگشت با حالت ثابت بازنویسی میکنند. این باعث میشود حافظه نسبت به طول متن ثابت (O(1)) باشد، به این معنی که هیچ کشی وجود ندارد که با افزایش طول توالی رشد کند. اما مشکل اینجاست که حالت ثابت، یک خلاصه با اتلاف داده است؛ این مدلها در بازیابی دقیق اطلاعات از فاصلههای دور (مثلاً شناسایی یک توکن دقیق از ۴۰ هزار جایگاه قبل) ضعیفترند. در همین راستا، مدل LFM2.5 نمونهای از پیشرفتها در پردازش متون طولانی است که حتی بدون نیاز به GPUهای سنگین عمل میکند.
- توجه پنجره لغزان و Sinks: این روش محدود میکند که هر توکن تا چه فاصلهای به عقب نگاه کند (مثلاً فقط چند هزار توکن اخیر) و حافظه را به اندازه ثابتی میرساند. برای جلوگیری از تخریب رفتار متنهای بلند، این روش با «چاههای توجه» (Attention Sinks) جفت میشود؛ یعنی توکنهای ابتدایی همیشه در دید مدل باقی میمانند تا تولید متنهای بسیار بلند پایدار بماند.
همانطور که در تحلیلهای قبلی ما درباره بهینهسازی استنتاج اشاره کردیم، معماریهای جدید دیگر به دنبال کمال مطلق نیستند، بلکه به دنبال تعادل بین دقت و هزینه هستند.
اجماع ترکیبی سال ۲۰۲۶
در سال ۲۰۲۶، الگوی غالب بهجای انتخاب یک روش، «درهمتنیدگی لایهها» است. مدلها اکنون اقلیتی از لایههای سافتمکس (Softmax) را برای بازیابی دقیق و اکثری از لایههای خطی یا SSM را برای مدیریت ارزانِ متون بلند ترکیب میکنند. این رویکرد منجر به مقیاسپذیری نزدیک به خطی حافظه میشود در حالی که کیفیت توجه کامل حفظ میگردد.
فراتر از معماری، لایه سرویسدهی نیز به شریک طراحی تبدیل شده است. دو ضربکننده حیاتی اکنون استاندارد شدهاند:
- کوانتیزه کردن KV Cache: تغییر ترم
dtype_bytesیک برد تقریباً رایگان است. ذخیره کش در FP8 یا INT8 بهجای FP16، ردپای حافظه را نصف یا یکچهارم میکند، در حالی که تأثیر کیفیت آن اندک است. این روش برای سرویسدهی متون بلند در سال ۲۰۲۶ تقریباً استاندارد است. - PagedAttention: هسته اصلی vLLM است که حافظه را تکهتکه (صفحهبندی شده) تخصیص میدهد. این روش کش را کوچک نمیکند، اما مانع از هدررفت آن میشود. با تخصیص حافظه در صفحات ثابت بهجای یک بلوک پیوسته برای هر درخواست، تکهتکه شدن حافظه (fragmentation) حذف شده و اجازه میدهد توالیهای همزمان بیشتری در همان فضای HBM جای بگیرند.
این چرخش یعنی ارزیابی یک مدل جدید اکنون نیازمند پاسخ به یک سؤال است: با KV Cache چه اتفاقی میافتد؟ مدلهایی که در محیط عملیاتی سریعترند، آنهایی هستند که با واقعیت بیرحم محدودیتهای HBM شکل گرفتهاند.
راهنمای پیادهسازی
انتخاب استراتژی درست به هدف استقرار شما بستگی دارد:
- مدلهای عمومی وزنباز: GQA یک خط پایه امن و اثباتشده است.
- متون بلند / حافظه بهینه برای سرویسدهی: فشردهسازی نهان به سبک MLA قویترین اهرم است، هرچند پیچیدگی پیادهسازی بالاتری دارد.
- استقرار در لبه (Edge) / متون کوتاه: ترکیبی از توجه پنجره لغزان، GQA و کش کوانتیزه شده، ارزان و مستحکم است.
- متون بسیار بلند (با پذیرش افت بازیابی): درهمتنیدگی لایههای خطی و کامل، مقیاسپذیری نزدیک به خطی را فراهم میکند.
برای هر یک از موارد بالا، کمزحمتترین بردها، کوانتیزه کردن کش و استفاده از یک رانتایم صفحهبندی شده (Paged) است، زیرا اینها با هر معماری سازگار هستند.
منتظر موج بعدی مدلهای ترکیبی باشید تا ببینیم آیا آنها میتوانند در نهایت شکاف بین بستر متنی نامحدود SSMها و بازیابی بینقص ترنسفورمرهای سنتی را پر کنند.
گام بعدی شما
- اگر مدلهای وزنباز را مستقر میکنید، از رانتایمهای مبتنی بر vLLM برای بهرهمندی از PagedAttention استفاده کنید.
- برای کاهش فوری هزینه حافظه، کوانتیزه کردن کش به FP8 را در اولویت قرار دهید.
- هنگام انتخاب مدل برای متون بسیار بلند، بررسی کنید که آیا از معماریهای ترکیبی (Hybrid) یا MLA استفاده شده است یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell و مدیریت پهنایباند مراجعه کنید.




گفتگو