پرش به محتوای اصلی
پرش به محتوای مقاله

DeepSeek: کاهش ۴۳۷ برابری اشغال حافظه KV Cache در مدل V4.1-Flash

·۱۹ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
نسخه فلش دیپ‌سیک V4.1 با حافظه متنی یک میلیون توکن، فشرده‌سازی FP4 و بازاستفاده توجه بین‌لایه‌ای عرضه شد.
نسخه فلش دیپ‌سیک V4.1 با حافظه متنی یک میلیون توکن، فشرده‌سازی FP4 و بازاستفاده توجه بین‌لایه‌ای عرضه شد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش خیره‌کننده ۴۳۷ برابری اثر حافظه KV Cache از طریق معماری رمزگذار-رمزگشای علی و کوانتش FP4؛ در حالی که اکثر مدل‌ها برای پنجره‌های بلند به افزایش خطی حافظه نیاز دارند، این مدل هزینه را تقریباً ثابت نگه می‌دارد.

گلوگاه‌های حافظه در عامل‌های هوش مصنوعی با افق زمانی بلند دیگر یک اجبار فنی نیستند. DeepSeek AI با معرفی مدل DeepSeek-V4.1-Flash، اثر حافظه KV Cache (حافظهٔ کلید-مقدار) را به تنها ۸۹۰ بایت به‌ازای هر توکن رساند؛ عددی که تقریباً ۴۳۷ برابر کوچک‌تر از نسخه V1 و حدود یک‌چهارم نسخه V4-Flash است.

سرویس‌دهی به پنجره‌های متنی (Context Window) یک میلیون توکنی معمولاً به‌دلیل پیش‌پُرکردن‌های (Prefill) مکرر، فشار شدیدی به حافظه HBM (حافظه پهنای‌باند بالا)، ظرفیت SSD و پهنای‌باند وارد می‌کند. به گزارش Marktechpost، هدف این نسخه حذف دقیق همین گلوگاه برای تبدیل عامل‌های با زمینه بلند به ابزارهایی قابل‌استقرار در مقیاس واقعی است. این مدل دارای یک بدنه ۵۵۲ میلیارد پارامتری با ۱۹۶ میلیارد پارامتر اضافی Engram است، اما در مرحله پیش‌پُرکردن تنها ۸ میلیارد و در مرحله رمزگشایی (Decoding) ۱۶ میلیارد پارامتر را فعال می‌کند.

کارایی معماری

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی استنتاج در مدل‌های MoE اشاره کردیم، کاهش پارامترهای فعال بدون افت کیفیت، کلید مقیاس‌پذیری است. در این مدل، یک ساختار رمزگذار-رمزگشای علی (Causal Encoder-Decoder) به کار رفته که بدنه ۴۰ لایه‌ای آن به‌طور مساوی بین ۲۰ لایه رمزگذار و ۲۰ لایه رمزگشا تقسیم شده است. با الهام از معماری YOCO، رمزگشا دیگر KV جهانی خود را محاسبه نمی‌کند، بلکه آن را از آخرین حالت پنهان رمزگذار از طریق وزن‌های تصویر (Projection Weights) هر لایه استخراج می‌کند. این طراحی محاسبات پیش‌پُرکردن را تقریباً نصف می‌کند زیرا توکن‌های پرامپت در رمزگذار متوقف می‌شوند و دیگر نیازی به پردازش مجدد در لایه‌های رمزگشا نیست.

برای حفظ زمینه محلی، مدل از توجه پنجره لغزان (Sliding-Window Attention یا SWA) با پنجره ۱۲۸ توکنی استفاده می‌کند. از طریق فرآیندی به نام Decoder SWA Bounded Replay، سیستم حالت‌های رمزگشا را با بازپخش تنها ۱۲۸ توکن آخر پرامپت بازسازی می‌کند و نیازی به پردازش کل توالی نیست. این مکانیسم اجازه می‌دهد تا مدل بدون مصرف حافظه نجومی، جزئیات نزدیک را به‌طور دقیق حفظ کند.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

توجه پراکنده فشرده ۲ (CSA2)

مدل V4.1-Flash برای حمله به اندازه حافظه در محور لایه‌ها، از مکانیزم توجه پراکنده فشرده ۲ (CSA2) استفاده می‌کند. در حالی که نسخه V4 ترکیبی از CSA و توجه به‌شدت فشرده (Heavily Compressed Attention) بود، نسخه جدید به‌طور خالص از CSA2 بهره می‌برد. در این ساختار، هر لایه به یکی از سه حالت زیر اختصاص می‌یابد:

  • Full: محاسبه KV اصلی، تصویر کردن K شاخص‌ساز (Indexer K) از آن و انتخاب ۵۱۲ شاخص برتر (Top-512) جدید.
  • Reindex: استفاده مجدد از KV اصلی و K شاخص‌ساز لایه Full قبلی، اما امتیازدهی مجدد به آن‌ها با استفاده از Q شاخص‌ساز لایه فعلی.
  • Reuse: حذف کامل شاخص‌ساز و استفاده مجدد از هر دو مورد KV اصلی و آخرین شاخص‌های Top-K.

در ۱۸ لایه رمزگذار CSA2، نسبت فشرده‌سازی ۲ در ۳ گروه ۶تایی است (۱ لایه Full و ۵ لایه Reuse). ۲۰ لایه رمزگشا نیز از نسبت ۱ در ۵ گروه ۴تایی استفاده می‌کنند: لایه اول Full به همراه ۳ لایه Reuse است و بقیه لایه‌ها شامل یک Reindex به همراه ۳ لایه Reuse هستند. هر لایه همچنان Q اصلی و SWA KV مخصوص به خود را حفظ می‌کند.

علاوه بر این، یک شاخص‌ساز پراکنده سلسله‌مراتبی (Hierarchical Sparse Indexer) با ساخت یک استخر کاندیدا تا ۱۶,۳۸۴ موقعیت (شامل ۲۰۴۸ بلوک ۸تایی)، رمزگشا را بهینه می‌کند. این امر تضمین می‌کند که لایه‌های Reindex بعدی به‌جای امتیازدهی به کل زمینه، روی یک مجموعه محدود و بهینه امتیازدهی کنند.

کوانتش و مدیریت حافظه

بر اساس مستندات فنی، ذخیره‌سازی با کوانتش (Quantization) حافظه KV اصلی به فرمت E2M1 (FP4) با یک مقیاس E4M3 به‌ازای هر ۱۶ کانال بیشتر کاهش یافته است. این روش از استاندارد NVFP4 پیروی می‌کند اما بدون مقیاس جهانی آن است. این آموزشِ آگاه از کوانتش که در مرحله پس‌آموزش (Post-training) معرفی شده، فضای ذخیره‌سازی را در مقایسه با حافظه FP8 در نسخه V4 تقریباً نصف کرده است.

در سطح استقرار، SWA KV دیگر روی SSD ذخیره نمی‌شود، بلکه در یک استخر توزیع‌شده که از ۱۰٪ از DRAM میزبان جدا شده، با زمان ماندگاری (TTL) چند دقیقه‌ای قرار می‌گیرد. در مقابل، KV جهانی دارای ضمانت ماندگاری ۷۲ ساعته است. در صورت نبود داده در حافظه (Miss)، مکانیزم Encoder SWA Bounded Replay به‌جای محاسبه تمام لایه‌ها ضربدر پنجره، تنها ۱۲۸ توکن را بازسازی می‌کند.

توسعه‌های فنی تکمیلی

DeepSeek چندین بهینه‌سازی دیگر را برای کاهش سربار پیاده کرده است:

  • Single-Pass mHC: جابجایی ضرایب ترکیب ورودی به اندازه یک بلوک، که اجازه می‌دهد یک کرنل ادغام‌شده Mega-mHC ترافیک حافظه فعال‌سازها را نصف کند.
  • ماژول Engram: یک ماژول حافظه شرطی که در لایه‌های ۱ و ۱۴ قرار گرفته است.
  • DSpark: رمزگشایی گمانه‌زنانه (Speculative Decoding) که پس از پیش‌آموزش، در حالی که بدنه مدل منجمد (Frozen) بود، آموزش دیده است.
  • Head-wise Muon: اعمال این بهینه‌ساز برای بهبود وزن‌های مدل.

بنچمارک‌های آموزشی و عملکردی

پیش‌آموزش این مدل روی ۴۵ تریلیون توکن چندوجهی با نسبت ۷ به ۱ (متن به چندوجهی) انجام شده است. توجه پراکنده از ابتدا با طول توالی ۶۴ هزار توکن و بدون گرم‌کردن (Warmup) متراکم آموزش دیده و سپس زمینه تا ۱ میلیون توکن در ۳۴ تریلیون توکن گسترش یافته است. این مدل در کدنویسی و دانش جهانی با DeepSeek-V4-Pro-Base برابری می‌کند، در حالی که تنها از یک‌سوم کل پارامترها و یک‌چهارم پارامترهای فعال استفاده می‌کند.

در مراحل پس‌آموزش، تمرکز بر سنتز مقیاس‌بزرگ وظایف عامل‌های قابل‌تأیید و یادگیری تقویتی (RL) روی چارچوب‌هایی مانند Claude Code، Codex، OpenCode، Pi، mini-SWE و DeepSeek Harness بود، که در آن از تقطیر (Distillation) On-policy از بیش از ۴۰ مدل معلم استفاده شد. این رویکرد در ادامه تلاش‌های DeepSeek برای ارتقای توانمندی‌های عامل‌های هوشمند است که پیش‌تر در مدل V4-Flash-Vision-Exp نیز شاهد رقابت تنگاتنگ آن با مدل Opus 4.8 بودیم. در آزمون‌های رودررو، V4.1-Flash از Opus-5 و GPT-5.6 Sol در محک Terminal-Bench 2.1 (امتیاز ۹۰.۶ در برابر ۸۸.۸) و DeepSWE v1.1 (امتیاز ۷۴.۲ در برابر ۷۳.۰) پیشی گرفت. همچنین این مدل امتیاز ۳۱.۲ در Terminal-Bench 4.0 و ۵۴.۸ در Automation-Bench کسب کرد.

نکته قابل توجه این است که با گسترش زمینه از ۴ هزار به ۱ میلیون توکن، عملیات اعشاری (FLOPs) رمزگشایی تک‌توکنی تنها ۲۵٪ افزایش می‌یابد. این تغییر معماری نشان می‌دهد که صنعت در حال فاصله گرفتن از حافظه‌های KV متراکم و حرکت به سمت نمایش‌های پراکنده، مشترک و کوانتیده است. DeepSeek با جداسازی نیازهای KV رمزگذار و رمزگشا ثابت کرد که پنجره‌های ۱ میلیون توکنی را می‌توان بدون افزایش خطی هزینه حافظه مدیریت کرد.

توسعه‌دهندگان اکنون می‌توانند به وزن‌های باز این مدل تحت لایسنس MIT از طریق Hugging Face دسترسی داشته باشند که از vLLM، SGLang و Transformers پشتیبانی می‌کند. تیم تحقیق همچنین یک API عمومی را معرفی کرده است که دارای سه سطح استدلال پایین (Low)، بالا (High) و حداکثری (Max) است.

گام بعدی شما

  • اگر توسعه‌دهنده عامل‌های هوش مصنوعی هستید، وزن‌های باز این مدل را از Hugging Face دریافت کرده و با vLLM یا SGLang تست کنید.
  • برای کاهش هزینه استنتاج در پروژه‌های خود، معماری رمزگذار-رمزگشای علی را برای مدیریت پنجره‌های متنی بلند بررسی کنید.
  • عملکرد مدل را در وظایف اتوماسیون ترمینال با استفاده از محک Terminal-Bench 4.0 بسنجید.

اما تأثیر این بهینه‌سازی‌ها بر سخت‌افزارهای لبه حتی جذاب‌تر است — به تحلیل ما درباره‌ی تراشه‌های NPU نسل جدید مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در معماری‌های MoE، هزینه عملیاتی عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد. اکنون استقرار مدل‌هایی با حافظه بلندمدت در محیط‌های تولیدی بدون فشار به زیرساخت‌های HBM امکان‌پذیر است.

تأثیر برای ایران

به‌دلیل وزن‌های باز (Open Weights) تحت لایسنس MIT، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌صورت محلی میزبانی کنند و محدودیت‌های API را دور بزنند.

·نگاه ما
تحریریه دات‌هوش

جداسازی نیازهای KV بین رمزگذار و رمزگشا، فرضیه خطی بودن هزینه حافظه نسبت به طول زمینه را می‌شکند. DeepSeek با این مدل ثابت کرد که می‌توان پنجره‌های متنی میلیونی را بدون نیاز به سخت‌افزارهای نجومی مدیریت کرد. این رویکرد احتمالاً استاندارد جدیدی برای مدل‌های «فلش» یا سبک ایجاد می‌کند که در آن‌ها کارایی حافظه بر قدرت مطلق استدلال اولویت دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.