اگر برای اجرای عاملهای هوش مصنوعی با هزینههای سرسامآور حافظه دستوپنجه نرم میکنید، باید بدانید که گلوگاه اصلی دیگر نیست. شرکت DeepSeek در ۱۰ سپتامبر ۲۰۲۶ مدل DeepSeek-V4.1-Flash را معرفی کرد تا هزینهٔ اجرای عاملهای خودمختار را از «خواندن زمینه» به «تولید توکن» منتقل کند.
بسیاری از کاربران تنها به قیمت هر توکن توجه میکنند، اما برای عاملها، هزینهٔ پنهان در KV Cache (حافظهٔ کلید-مقدار) نهفته است. این حافظه برای ذخیره توکنهای قبلی استفاده میشود تا مدل مجبور نباشد هر بار محاسبات را از ابتدا انجام دهد. در چتهای معمولی، توکنهای خروجی غالب هستند، اما در گردشهای کاری عاملمحور، سیستم بیشتر منابع خود را صرف بازخوانی زمینههای حجیم میکند.
به نقل از مستندات فنی این شرکت، مدل DeepSeek-V4.1-Flash از معماری Causal Encoder-Decoder (CED) استفاده میکند. برخلاف مدلهای سنتی که برای هر لایه جفتهای KV را ذخیره میکنند، CED لایههای خود را به یک رمزگذار و یک رمزگشای ۴۰ لایهای تقسیم میکند. در این ساختار، رمزگشا بهجای محاسبه جفتهای KV برای هر لایه، تنها از یک حالت پنهان (Hidden State) در لایه نهایی رمزگذار استفاده میکند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی استنتاج در مدلهای بازمتن اشاره کردیم، کاهش فشار روی VRAM کلید مقیاسپذیری است. مشخصات فنی V4.1-Flash عبارتند از:
- حجم KV Cache: کاهش به ۸۹۰ بایت بهازای هر توکن (تقریباً یکچهارم V4-Flash و ۴۳۷ برابر کوچکتر از V1).
- کارایی پارامترها: با وجود بدنه ۵۵۲ میلیارد پارامتری، تنها ۸ میلیارد پارامتر در مرحله پیشپُرکردن (Prefill) و ۱۶ میلیارد پارامتر در مرحله رمزگشایی (Decoding) فعال میشوند.
- CSA2 (توجه پراکنده فشرده ۲): امکان اشتراکگذاری KV و شاخصها بین لایهها در حالتهای Full، Reindex یا Reuse.
- کوانتایزاسیون FP4: استفاده از فرمت E2M1 با یک مقیاس برای هر ۱۶ کانال جهت فشردهسازی بیشتر حافظه.
طبق گزارش این شرکت، آنها همچنین قابلیت SWA Bounded Replay را پیاده کردهاند. در این روش، بهجای ذخیره حالتهای توجه پنجرهای لغزان (SWA) روی SSD، مدل توکنهای اخیر را در صورت نیاز دوباره محاسبه میکند. این موازنه بین زمان محاسبات و فضای حافظه، ذخیرهسازی دائمی KV Cache را به یکهشتم نسخه قبلی رسانده است.
این تغییرات معماری منجر به جهش عملکردی در عاملها شده است. بر اساس گزارش فنی منتشر شده در Hugging Face، این مدل در محک DeepSWE v1.1 امتیاز ۷۴.۲ را کسب کرد که ۲۰ واحد بالاتر از امتیاز ۵۴.۴ در V4-Flash است. این پیشرفت در کنار ابزارهای کاربردی Hugging Face برای ساخت عاملهای گواهیشده، مسیر توسعه سیستمهای خودمختار را هموارتر میکند. همچنین امتیازات ۹۰.۶ در Terminal-Bench و ۸۸.۱ در CyberGym به دست آمده است.
نکته جالب این است که DeepSeek اشاره میکند این پیشرفتها نه از طریق تغییر در دستورالعملهای SFT یا RL، بلکه بهواسطه تولید دادههای مصنوعی (Synthetic Data) در حجم انبوه برای محیطهای عاملمحور بهدست آمده است.
این چرخش نشان میدهد که صنعت در حال تعریف استاندارد جدیدی برای بهرهوری حافظه است. اگر عدد ۸۹۰ بایت بهازای هر توکن به استاندارد تبدیل شود، موانع اقتصادی برای استقرار عاملهای با زمینه طولانی بهشدت کاهش مییابد و عاملهای پیچیده کدنویسی و پژوهشی در مقیاس تجاری توجیهپذیر میشوند.
گام بعدی شما
- گردشهای کاری عاملهای خود را بررسی کنید تا متوجه شوید چه درصدی از هزینهها مربوط به بازخوانی مکرر زمینه (Context Reading) است.
- مدلهای فشردهشده را در محیطهای با حافظه محدود (Edge) تست کنید تا تأثیر کاهش KV Cache بر تأخیر (Latency) را بسنجید.
- استراتژیهای تولید داده مصنوعی را برای بهبود استدلال عاملهای خود جایگزین تنظیم دقیق سنتی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو