پرش به محتوای اصلی
پرش به محتوای مقاله

دیپ‌سیک-V4: هزینه استنتاج یک میلیون توکن به ۲۷ درصد نسخه V3.2 رسید

·۲۶ اردیبهشت ۱۴۰۵۲ دقیقه مطالعه۲ بازدید
دیپ‌سیک-V4: هزینه استنتاج یک میلیون توکن به ۲۷ درصد نسخه V3.2 رسید
اشتراک‌گذاری

اگر در حال حاضر عامل‌های خودکار (Autonomous Agents) را در مقیاس تجاری مستقر کرده‌اید، می‌دانید که «دیوار حافظه» بزرگ‌ترین مانع پیش روی شماست. حالا DeepSeek-V4 این معادله را تغییر داده و هزینه محاسباتی (FLOPs) مورد نیاز برای استنتاج (Inference) یک میلیون توکن را به تنها ۲۷ درصدِ خط‌مبنای نسخه V3.2 کاهش داده است.

این جهش فنی، پنجره‌های متنی بلند را از یک «ویترین بنچمارک» به ابزاری کاربردی برای تولید تبدیل می‌کند. طبق مستندات فنی این شرکت، هدف اصلی این معماری، رفع گلوگاه‌های موجود در گردش‌های کاری چندمرحله‌ایِ عامل‌محور (Agentic) است.

این انتشار شامل دو چک‌پوینت MoE (مخفف Mixture of Experts) است:

  • V4-Pro: با ۱.۶ تریلیون پارامتر کل و ۴۹ میلیارد پارامتر فعال.
  • V4-Flash: با ۲۸۴ میلیارد پارامتر کل و ۱۳ میلیارد پارامتر فعال.

به نقل از تحلیل فنی وب‌سایت dev.to، این بهره‌وری از طریق معماری Hybrid Attention حاصل شده است که بین دو سازوکار جابه‌جا می‌شود:

  • Compressed Sparse Attention (CSA): فشرده‌سازی ۴ برابری KV با استفاده از softmax-gated pooling و ایندکس‌گذاری FP4.
  • Heavily Compressed Attention (HCA): فشرده‌سازی ۱۲۸ برابری برای توجه متراکم روی جریان‌های فشرده.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی قوانین مقیاس‌پذیری (Scaling Laws) و بهینه‌سازی مدل‌های MoE اشاره کردیم، کاهش هزینه بدون افت شدید کیفیت، کلید پذیرش گسترده است. در V4، ذخیره‌سازی برای اکثر ورودی‌های KV از فرمت FP8 استفاده می‌کند و BF16 تنها برای ابعاد RoPE رزرو شده است.

علاوه بر این، دیپ‌سیک فرمت DSML (یک ساختار مبتنی بر XML برای فراخوانی ابزارها) و DSec (یک محیط sandbox برای اجرای RL) را معرفی کرده است که از فراخوانی‌های ساده تابع تا ماشین‌های مجازی کامل QEMU را پشتیبانی می‌کند.

در حالی که GPT-5.5 (منتشر شده در ۲۳ آوریل ۲۰۲۶) همچنان در بنچمارک‌های کدنویسی پیشتاز است (۸۲.۷٪ در Terminal-Bench 2.0 در مقابل ۶۷.۹٪ برای V4)، اما مزیت قیمتی ۵ تا ۱۰ برابری V4 Pro، آن را به انتخابی عمل‌گرایانه برای استقرارهای حجیم تبدیل می‌کند.

گام بعدی شما

  • بررسی سازگاری ابزارهای فعلی خود با اسکیمای جدید DSML برای بهره‌برداری از بهبودهای زنجیره تفکر (Chain-of-Thought).
  • ارزیابی مدل V4-Flash برای وظایفی که نیاز به تأخیر بسیار پایین و پنجره متنی بلند دارند.
  • مطالعه مستندات معماری در Hugging Face Hub برای پیاده‌سازی بهینه KV Cache.

اما این بهینه‌سازی‌های نرم‌افزاری تنها نیمی از داستان است؛ برای درک اینکه سخت‌افزارهای نسل بعد چگونه این هزینه‌ها را باز هم پایین می‌آورند، تحلیل ما درباره‌ی تراشه‌های Blackwell را بخوانید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر تخصص در فشرده‌سازی حافظه، اقتصاد استقرار عامل‌های هوش مصنوعی را تغییر می‌دهد. کاهش ۷۳ درصدی هزینه استنتاج یعنی سازمان‌ها می‌توانند بدون نیاز به سخت‌افزارهای نجومی، حافظه‌های بلندمدت را در محیط تولید فعال کنند.

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.