پرش به محتوای اصلی
پرش به محتوای مقاله

مدل DeepSeek-V4.1-Flash حجم حافظهٔ KV Cache را به ۸۹۰ بایت کاهش داد

·۲۳ شهریور ۱۴۰۵۳ دقیقه مطالعه
چرا KV cache در سال ۲۰۲۶ به ستون فقرات اقتصاد عامل‌های هوش مصنوعی تبدیل شد
چرا KV cache در سال ۲۰۲۶ به ستون فقرات اقتصاد عامل‌های هوش مصنوعی تبدیل شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش حجم KV Cache به ۸۹۰ بایت به‌ازای هر توکن از طریق معماری CED؛ این اولین بار است که یک مدل با پارامترهای بالا، هزینه حافظه را در مقیاس عامل‌های صنعتی تا این حد پایین می‌آورد.

اگر برای اجرای عامل‌های هوش مصنوعی با هزینه‌های سرسام‌آور حافظه دست‌وپنجه نرم می‌کنید، باید بدانید که گلوگاه اصلی دیگر نیست. شرکت DeepSeek در ۱۰ سپتامبر ۲۰۲۶ مدل DeepSeek-V4.1-Flash را معرفی کرد تا هزینهٔ اجرای عامل‌های خودمختار را از «خواندن زمینه» به «تولید توکن» منتقل کند.

بسیاری از کاربران تنها به قیمت هر توکن توجه می‌کنند، اما برای عامل‌ها، هزینهٔ پنهان در KV Cache (حافظهٔ کلید-مقدار) نهفته است. این حافظه برای ذخیره توکن‌های قبلی استفاده می‌شود تا مدل مجبور نباشد هر بار محاسبات را از ابتدا انجام دهد. در چت‌های معمولی، توکن‌های خروجی غالب هستند، اما در گردش‌های کاری عامل‌محور، سیستم بیشتر منابع خود را صرف بازخوانی زمینه‌های حجیم می‌کند.

به نقل از مستندات فنی این شرکت، مدل DeepSeek-V4.1-Flash از معماری Causal Encoder-Decoder (CED) استفاده می‌کند. برخلاف مدل‌های سنتی که برای هر لایه جفت‌های KV را ذخیره می‌کنند، CED لایه‌های خود را به یک رمزگذار و یک رمزگشای ۴۰ لایه‌ای تقسیم می‌کند. در این ساختار، رمزگشا به‌جای محاسبه جفت‌های KV برای هر لایه، تنها از یک حالت پنهان (Hidden State) در لایه نهایی رمزگذار استفاده می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی استنتاج در مدل‌های بازمتن اشاره کردیم، کاهش فشار روی VRAM کلید مقیاس‌پذیری است. مشخصات فنی V4.1-Flash عبارتند از:

  • حجم KV Cache: کاهش به ۸۹۰ بایت به‌ازای هر توکن (تقریباً یک‌چهارم V4-Flash و ۴۳۷ برابر کوچک‌تر از V1).
  • کارایی پارامترها: با وجود بدنه ۵۵۲ میلیارد پارامتری، تنها ۸ میلیارد پارامتر در مرحله پیش‌پُرکردن (Prefill) و ۱۶ میلیارد پارامتر در مرحله رمزگشایی (Decoding) فعال می‌شوند.
  • CSA2 (توجه پراکنده فشرده ۲): امکان اشتراک‌گذاری KV و شاخص‌ها بین لایه‌ها در حالت‌های Full، Reindex یا Reuse.
  • کوانتایزاسیون FP4: استفاده از فرمت E2M1 با یک مقیاس برای هر ۱۶ کانال جهت فشرده‌سازی بیشتر حافظه.

طبق گزارش این شرکت، آن‌ها همچنین قابلیت SWA Bounded Replay را پیاده کرده‌اند. در این روش، به‌جای ذخیره حالت‌های توجه پنجره‌ای لغزان (SWA) روی SSD، مدل توکن‌های اخیر را در صورت نیاز دوباره محاسبه می‌کند. این موازنه بین زمان محاسبات و فضای حافظه، ذخیره‌سازی دائمی KV Cache را به یک‌هشتم نسخه قبلی رسانده است.

این تغییرات معماری منجر به جهش عملکردی در عامل‌ها شده است. بر اساس گزارش فنی منتشر شده در Hugging Face، این مدل در محک DeepSWE v1.1 امتیاز ۷۴.۲ را کسب کرد که ۲۰ واحد بالاتر از امتیاز ۵۴.۴ در V4-Flash است. این پیشرفت در کنار ابزارهای کاربردی Hugging Face برای ساخت عامل‌های گواهی‌شده، مسیر توسعه سیستم‌های خودمختار را هموارتر می‌کند. همچنین امتیازات ۹۰.۶ در Terminal-Bench و ۸۸.۱ در CyberGym به دست آمده است.

نکته جالب این است که DeepSeek اشاره می‌کند این پیشرفت‌ها نه از طریق تغییر در دستورالعمل‌های SFT یا RL، بلکه به‌واسطه تولید داده‌های مصنوعی (Synthetic Data) در حجم انبوه برای محیط‌های عامل‌محور به‌دست آمده است.

این چرخش نشان می‌دهد که صنعت در حال تعریف استاندارد جدیدی برای بهره‌وری حافظه است. اگر عدد ۸۹۰ بایت به‌ازای هر توکن به استاندارد تبدیل شود، موانع اقتصادی برای استقرار عامل‌های با زمینه طولانی به‌شدت کاهش می‌یابد و عامل‌های پیچیده کدنویسی و پژوهشی در مقیاس تجاری توجیه‌پذیر می‌شوند.

گام بعدی شما

  • گردش‌های کاری عامل‌های خود را بررسی کنید تا متوجه شوید چه درصدی از هزینه‌ها مربوط به بازخوانی مکرر زمینه (Context Reading) است.
  • مدل‌های فشرده‌شده را در محیط‌های با حافظه محدود (Edge) تست کنید تا تأثیر کاهش KV Cache بر تأخیر (Latency) را بسنجید.
  • استراتژی‌های تولید داده مصنوعی را برای بهبود استدلال عامل‌های خود جایگزین تنظیم دقیق سنتی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در معماری‌های فشرده، هزینه استقرار عامل‌های خودمختار را به‌شدت کاهش می‌دهد. در نتیجه، ابزارهای AI که نیاز به خواندن هزاران خط کد یا سند دارند، از حالت آزمایشی به محصول تجاری سودآور تبدیل می‌شوند.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای DeepSeek، توسعه‌دهندگان ایرانی می‌توانند از نسخه‌های وزن‌باز این مدل روی سخت‌افزارهای داخلی برای کاهش هزینه‌های VRAM در پروژه‌های عامل‌محور استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز DeepSeek بر کاهش KV Cache نشان می‌دهد که رقابت در سال ۲۰۲۶ از «افزایش پنجره متنی» به «کاهش هزینه نگهداری زمینه» تغییر مسیر داده است. استفاده از داده‌های مصنوعی به‌جای تغییر در RL برای بهبود عملکرد عامل‌ها، ثابت می‌کند که کیفیت محیط‌های شبیه‌سازی‌شده اکنون از الگوریتم‌های بهینه‌سازی اهمیت بیشتری یافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.