پرش به محتوای اصلی
پرش به محتوای مقاله

«بحران حافظه»؛ اولویت جدید معماری مدل‌های پیشرو در سال ۲۰۲۶

·۱۸ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
راهنما
راهنمای ۲۰۲۶: انواع توجه؛ حافظه KV گلوگاه اصلی است
راهنمای ۲۰۲۶: انواع توجه؛ حافظه KV گلوگاه اصلی است
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از مدل‌های تک‌معماری به مدل‌های ترکیبی (Hybrid) در سال ۲۰۲۶؛ جایی که لایه‌های SSM و Attention برای حل تضاد بین «دقت بازیابی» و «مصرف حافظه» در یک مدل ادغام شده‌اند.

هزینهٔ حافظه برای «به‌خاطر سپردن»، اکنون معمار اصلی قدرتمندترین هوش مصنوعی‌های جهان است. تا ۹ اوت ۲۰۲۶، طراحی مدل‌های زبانی پیشرو دیگر تنها بر اساس تعداد پارامترها نیست، بلکه بر مدیریت KV Cache (حافظه کلید-مقدار) — یعنی ردپای حافظه‌ای که هنگام رمزگشایی خودبازگشتی باقی می‌ماند — متمرکز شده است.

برای متخصصان, KV Cache بزرگ‌ترین گلوگاه در محیط عملیاتی است. در حالی که وزن‌های مدل ثابت هستند، این حافظه با هر توکن جدید و هر کاربر هم‌زمان به‌صورت خطی رشد می‌کند. طبق یک راهنمای فنی در dev.to، این یعنی در پنجره‌های متنی بلند، حافظه نه وزن‌های مدل، بلکه همین کش است که بخش اعظم حافظه شتاب‌دهنده را می‌بلعد.

مکانیسم حافظه کش

در طول تولید متن، یک ترنسفورمر (Transformer) — شبیه به مهندسی که برای سرعت بیشتر، نتایج محاسبات قبلی را روی کاغذ می‌نویسد تا دوباره آن‌ها را حساب نکند — بردارهای کلید و مقدار هر توکن گذشته را ذخیره می‌کند تا در هر گام نیازی به محاسبه مجدد نباشد. این بهای رمزگشایی سریع است و هزینه آن با فرمولی بی‌رحمانه محاسبه می‌شود:

KV bytes = 2 (K and V) × layers × kv_heads × head_dim × seq_len × batch × dtype_bytes

دو پیامد فوری از این ریاضیات استخراج می‌شود. نخست، کش با اندازه بستر متن و اندازه دسته رشد می‌کند؛ یعنی دو برابر شدن متن، حافظه را دو برابر می‌کند. دوم، رمزگشایی محدود به پهنای‌باند حافظه است، نه قدرت محاسباتی. تولید یک توکن واحد نیازمند دسترسی به کل حافظه کش است. شما با محدودیت FLOPs روبرو نیستید، بلکه محدود به سرعت انتقال داده از حافظه پهنای‌باند بالا (HBM) هستید. برای درک عمیق‌تر از نحوه پردازش داده‌ها در این لایه‌ها، می‌توانید کالبدشکافی مهندسی مدل‌های زبانی را که از توکن‌سازی تا حافظه خارجی را بررسی می‌کند، مطالعه کنید.

تصور کنید KV Cache مثل یک تخته‌سفید است که هوش مصنوعی باید پیش از نوشتن هر کلمه جدید، تمام آن را بخواند. اگر تخته بیش از حد بزرگ شود، مدل تمام وقتش را صرف اسکرول کردن یادداشت‌های قدیمی می‌کند، نه فکر کردن. بنابراین، کوچک کردن کش مستقیم‌ترین راه برای افزایش تعداد توکن در ثانیه است.

تکامل روش‌های کاهش حافظه

برای حل این مشکل، صنعت از چندین فاز معماری عبور کرده است تا فرمول KV را بدون تخریب مدل کوچک کند:

  • از MQA به GQA (کاهش سرهای KV): ابتدا توجه تک-پرس‌وجو (MQA) سعی کرد تمام سرهای پرس‌وجو را روی یک سر KV مشترک جمع کند. در حالی که این کار کاهش حافظه چشمگیری ایجاد کرد، اما اغلب به قیمت افت کیفیت و ناپایداری در آموزش تمام شد. توجه پرس‌وجوی گروهی (GQA) سازشی بود که پیروز شد. با تقسیم سرهای پرس‌وجو به گروه‌ها (مثلاً ۸ سر KV برای ۶۴ سر پرس‌وجو)، بیشترِ صرفه‌جویی MQA را با افت کیفیت بسیار کمتر به دست آورد. GQA اکنون پیش‌فرض اکثر مدل‌های وزن‌های باز (Open Weights) است.
  • MLA (توجه نهان چندسر): رویکردی تهاجمی‌تر که مستقیماً به حاصل‌ضرب head_dim × kv_heads حمله می‌کند. به‌جای ذخیره سرهای کمتر، MLA یک نهان کم‌رتبه (low-rank latent) را ذخیره می‌کند. کلیدها و مقادیر به یک بردار نهان کوچک و مشترک فشرده شده و در کش ذخیره می‌شوند، و سپس سرهای K و V برای هر سر در لحظه بازسازی می‌شوند. این اجازه می‌دهد مدل‌ها پنجره‌های متنی عظیم را در سطور حافظه بهینه و مناسب برای سرویس‌دهی مدیریت کنند.
  • توجه خطی و SSMها: مدل‌هایی مثل Mamba عملیات را به صورت یک بازگشت با حالت ثابت بازنویسی می‌کنند. این باعث می‌شود حافظه نسبت به طول متن ثابت (O(1)) باشد، به این معنی که هیچ کشی وجود ندارد که با افزایش طول توالی رشد کند. اما مشکل اینجاست که حالت ثابت، یک خلاصه با اتلاف داده است؛ این مدل‌ها در بازیابی دقیق اطلاعات از فاصله‌های دور (مثلاً شناسایی یک توکن دقیق از ۴۰ هزار جایگاه قبل) ضعیف‌ترند. در همین راستا، مدل LFM2.5 نمونه‌ای از پیشرفت‌ها در پردازش متون طولانی است که حتی بدون نیاز به GPUهای سنگین عمل می‌کند.
  • توجه پنجره لغزان و Sinks: این روش محدود می‌کند که هر توکن تا چه فاصله‌ای به عقب نگاه کند (مثلاً فقط چند هزار توکن اخیر) و حافظه را به اندازه ثابتی می‌رساند. برای جلوگیری از تخریب رفتار متن‌های بلند، این روش با «چاه‌های توجه» (Attention Sinks) جفت می‌شود؛ یعنی توکن‌های ابتدایی همیشه در دید مدل باقی می‌مانند تا تولید متن‌های بسیار بلند پایدار بماند.

همان‌طور که در تحلیل‌های قبلی ما درباره بهینه‌سازی استنتاج اشاره کردیم، معماری‌های جدید دیگر به دنبال کمال مطلق نیستند، بلکه به دنبال تعادل بین دقت و هزینه هستند.

اجماع ترکیبی سال ۲۰۲۶

در سال ۲۰۲۶، الگوی غالب به‌جای انتخاب یک روش، «درهم‌تنیدگی لایه‌ها» است. مدل‌ها اکنون اقلیتی از لایه‌های سافت‌مکس (Softmax) را برای بازیابی دقیق و اکثری از لایه‌های خطی یا SSM را برای مدیریت ارزانِ متون بلند ترکیب می‌کنند. این رویکرد منجر به مقیاس‌پذیری نزدیک به خطی حافظه می‌شود در حالی که کیفیت توجه کامل حفظ می‌گردد.

فراتر از معماری، لایه سرویس‌دهی نیز به شریک طراحی تبدیل شده است. دو ضرب‌کننده حیاتی اکنون استاندارد شده‌اند:

  • کوانتیزه کردن KV Cache: تغییر ترم dtype_bytes یک برد تقریباً رایگان است. ذخیره کش در FP8 یا INT8 به‌جای FP16، ردپای حافظه را نصف یا یک‌چهارم می‌کند، در حالی که تأثیر کیفیت آن اندک است. این روش برای سرویس‌دهی متون بلند در سال ۲۰۲۶ تقریباً استاندارد است.
  • PagedAttention: هسته اصلی vLLM است که حافظه را تکه‌تکه (صفحه‌بندی شده) تخصیص می‌دهد. این روش کش را کوچک نمی‌کند، اما مانع از هدررفت آن می‌شود. با تخصیص حافظه در صفحات ثابت به‌جای یک بلوک پیوسته برای هر درخواست، تکه‌تکه شدن حافظه (fragmentation) حذف شده و اجازه می‌دهد توالی‌های هم‌زمان بیشتری در همان فضای HBM جای بگیرند.

این چرخش یعنی ارزیابی یک مدل جدید اکنون نیازمند پاسخ به یک سؤال است: با KV Cache چه اتفاقی می‌افتد؟ مدل‌هایی که در محیط عملیاتی سریع‌ترند، آن‌هایی هستند که با واقعیت بی‌رحم محدودیت‌های HBM شکل گرفته‌اند.

راهنمای پیاده‌سازی

انتخاب استراتژی درست به هدف استقرار شما بستگی دارد:

  • مدل‌های عمومی وزن‌باز: GQA یک خط پایه امن و اثبات‌شده است.
  • متون بلند / حافظه بهینه برای سرویس‌دهی: فشرده‌سازی نهان به سبک MLA قوی‌ترین اهرم است، هرچند پیچیدگی پیاده‌سازی بالاتری دارد.
  • استقرار در لبه (Edge) / متون کوتاه: ترکیبی از توجه پنجره لغزان، GQA و کش کوانتیزه شده، ارزان و مستحکم است.
  • متون بسیار بلند (با پذیرش افت بازیابی): درهم‌تنیدگی لایه‌های خطی و کامل، مقیاس‌پذیری نزدیک به خطی را فراهم می‌کند.

برای هر یک از موارد بالا، کم‌زحمت‌ترین بردها، کوانتیزه کردن کش و استفاده از یک ران‌تایم صفحه‌بندی شده (Paged) است، زیرا این‌ها با هر معماری سازگار هستند.

منتظر موج بعدی مدل‌های ترکیبی باشید تا ببینیم آیا آن‌ها می‌توانند در نهایت شکاف بین بستر متنی نامحدود SSMها و بازیابی بی‌نقص ترنسفورمرهای سنتی را پر کنند.

گام بعدی شما

  • اگر مدل‌های وزن‌باز را مستقر می‌کنید، از ران‌تایم‌های مبتنی بر vLLM برای بهره‌مندی از PagedAttention استفاده کنید.
  • برای کاهش فوری هزینه حافظه، کوانتیزه کردن کش به FP8 را در اولویت قرار دهید.
  • هنگام انتخاب مدل برای متون بسیار بلند، بررسی کنید که آیا از معماری‌های ترکیبی (Hybrid) یا MLA استفاده شده است یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell و مدیریت پهنای‌باند مراجعه کنید.

چرا این موضوع مهم است؟

این تحول بر اساس تخصص در مهندسی سیستم‌های توزیع‌شده رخ داده و باعث می‌شود هزینه سرویس‌دهی مدل‌های متنی بلند به‌شدت کاهش یابد. در نتیجه، کاربردهای عملی مانند تحلیل هزاران سند هم‌زمان از حالت آزمایشی به حالت تجاری و مقرون‌به‌صرفه تبدیل می‌شوند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که با محدودیت شدید GPU و VRAM روبرو هستند، استفاده از تکنیک‌های کوانتیزه کردن KV Cache و vLLM تنها راه اجرای مدل‌های پیشرو روی سخت‌افزارهای موجود است.

·نگاه ما
تحریریه دات‌هوش

تمرکز صنعت از «افزایش هوش» به «بهینه‌سازی حافظه» تغییر کرده است. این نشان می‌دهد که ما به سقف فیزیکی سخت‌افزار رسیده‌ایم و پیشرفت‌های بعدی نه در ریاضیات مدل، بلکه در مهندسی انتقال داده رخ خواهد داد. مدل‌های آینده احتمالاً بیشتر شبیه به سیستم‌های مدیریت حافظه سیستم‌عامل‌ها خواهند بود تا شبکه‌های عصبی کلاسیک.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.