پرش به محتوای اصلی
پرش به محتوای مقاله

مدل V4-Flash دیپ‌سیک در بنچمارک‌های عامل‌محور از نسخه Pro پیشی گرفت

·۹ مرداد ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
تغییرات API دیپ‌سیک | مستندات فنی
تغییرات API دیپ‌سیک | مستندات فنی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شکست دادن نسخه Pro-Preview توسط نسخه Flash در بنچمارک‌های عامل‌محور، بدون هیچ تغییری در معماری مدل و تنها با تکیه بر پس‌آموزش (Post-training).

تصور کنید مدل ارزان‌قیمت و سریع یک شرکت، در سخت‌ترین آزمون‌های مهندسی نرم‌افزار، مدل «حرفه‌ای» همان شرکت را شکست دهد. این اتفاق اکنون در دنیای دیپ‌سیک رخ داده و تعریف ما از نسبت قدرت به هزینه را تغییر می‌دهد. آیا یک مدل Flash می‌تواند از پیش‌نیازنده‌ی خود در نسخه‌ی Pro-Preview در عملکرد عامل‌های هوشمند پیشی بگیرد؟ DeepSeek-V4-Flash این دستاورد را به دست آورده و نشان‌دهنده تغییری در نسبت کارایی به قدرت در این شرکت است.

طبق اعلام رسمی در مستندات API دیپ‌سیک (DeepSeek) که در ۳۱ جولای ۲۰۲۶ به‌روزرسانی شد، مدل DeepSeek-V4-Flash اکنون از طریق پارامتر deepseek-v4-flash در دسترس کاربران در حالت بتای عمومی است. این تحول در حالی رخ می‌دهد که صنعت هوش مصنوعی از رابط‌های چت ساده به سمت عامل‌های هوشمند (AI Agents) — شبیه به کارمندانی دیجیتال که می‌توانند به‌جای پیشنهاد دادن، واقعاً وظایف پیچیده مهندسی نرم‌افزار را اجرا کنند — حرکت می‌کند. این رقابت برای تسلط بر وظایف کدنویسی پیشرفته، یادآور بررسی‌های اخیر در مورد عملکرد GPT-5.5 در مقایسه با رقبای خود است که استانداردهای جدیدی را برای بنچمارک‌های مهندسی تعریف کرد. برای کاربران تجاری و مدیران کسب‌وکار، این یعنی شکاف بین مدل‌های «سبک» (Lightweight) و «حرفه‌ای» (Pro) در حال بسته شدن است و اتوماسیون سریع‌تر و ارزان‌تر، دیگر به معنای پذیرش افت شدید در قابلیت اطمینان نیست.

همان‌طور که در تحلیل قبلی ما درباره‌ی استراتژی‌های کاهش هزینه استنتاج اشاره کردیم، بهینه‌سازی لایه‌های خروجی می‌تواند نتایجی فراتر از افزایش اندازه مدل داشته باشد. در مدل V4-Flash، این موضوع به شکل ملموسی دیده می‌شود و نشان می‌دهد که مدل‌های کوچک‌تر می‌توانند با آموزش‌های هدفمند، رفتارهای پیچیده مدل‌های بزرگ را تقلید کنند.

پیشرفت‌های چشمگیر در عملکرد عامل‌ها (Agents)

به گزارش یادداشت‌های انتشار ۳۱ جولای، مدل جدید در عملیات‌های خودگردان بهبودهای شدیدی نشان داده است. نتایج بنچمارک‌های این مدل در چندین معیار کلیدی، به‌طور قابل‌توجهی از V4-Pro-Preview فراتر رفته است:

  • Terminal Bench 2.1: ۸۲.۷
  • NL2Repo: ۵۴.۲
  • Cybergym: ۷۶.۷
  • DeepSWE: ۵۴.۴
  • Toolathlon Verified: ۷۰.۳
  • Agent Last Exam: ۲۵.۲
  • Automation Bench (Public): ۲۵.۱
  • DSBench-FullStack (داخلی): ۶۸.۷
  • DSBench-Hard (داخلی): ۵۹.۶

پیاده‌سازی فنی و جزئیات ادغام

در بخش پیاده‌سازی فنی، دیپ‌سیک تأیید کرد که مدل DeepSeek-V4-Flash-0731 دقیقاً همان معماری و اندازه نسخه پیش‌نمایش قبلی را دارد. این جهش در عملکرد نتیجه‌ی یک فرآیند هدفمند پس‌آموزش (Post-training) است و نه تغییر در مقیاس یا اندازه مدل؛ یعنی مدل با داده‌های باکیفیت‌تر و روش‌های بهینه‌تر بازآموزی شده است تا در وظایف Agentic دقیق‌تر عمل کند.

توسعه‌دهندگان می‌توانند با مشخصات دقیق زیر این مدل را در سیستم‌های خود ادغام کنند:

  • فرمت API: دارای پشتیبانی بومی از Responses API و انطباق خاص برای Codex است.
  • چارچوب تست: نتایج بنچمارک‌های عمومی برای وظایف «عامل کدنویسی» با استفاده از حالت minimal در DeepSeek Harness (که به‌زودی منتشر می‌شود) به دست آمده‌اند.
  • ابرپارامترها (Hyperparameters): بنچمارک‌های ذکر شده با تنظیمات «حداکثر سطح تلاش» (max effort level)، مقدار topp=۰.۹۵ و temperature=۱.۰ اجرا شده‌اند. در این زمینه، تغییر رویکرد به پارامترهای کنترلی در مدل‌های سریع، مشابه تغییر متد کنترل در مدل Gemini 3.6 Flash است که در آن متدهای سنتی کنترل خروجی جای خود را به دستورات سیستمی دادند.

استراتژی محصول و خط زمانی

این عرضه به‌طور خاص API مدل Flash را هدف قرار داده است. مدل‌های DeepSeek-V4-Pro و نسخه‌های فعلی وب و اپلیکیشن بدون تغییر باقی مانده‌اند، هرچند شرکت صراحتاً اعلام کرده است که نسخه رسمی و نهایی V4-Pro به‌زودی منتشر خواهد شد.

نگاه به نقشه راه دیپ‌سیک نشان می‌دهد این شرکت با سرعت خیره‌کننده‌ای در چرخه V4 حرکت می‌کند. در ۲۴ آوریل ۲۰۲۶، شرکت هر دو مدل Pro و Flash را معرفی کرد که از طریق رابط‌های OpenAI ChatCompletions و Anthropic در دسترس بودند. برای دسترسی به این مدل‌ها، base_url بدون تغییر باقی می‌ماند و تنها پارامتر مدل باید روی deepseek-v4-pro یا deepseek-v4-flash تنظیم شود.

دیپ‌سیک همچنین اعلام کرد که نام‌های قدیمی و میراثی مانند deepseek-chat و deepseek-reasoner را تا ۲۴ جولای ۲۰۲۶ بازنشسته می‌کند. در طول دوره انتقال سه ماهه‌ای که در این تاریخ به پایان رسید، این نام‌های قدیمی به‌ترتیب به حالت‌های «غیرفک‌رکننده» (non-thinking) و «فکر‌کننده» (thinking) مدل v4-flash اشاره می‌کردند.

این روند تکرار الگویی از تکرار سریع (Rapid Iteration) است که در سال ۲۰۲۵ تثبیت شد. در سپتامبر ۲۰۲۵، این شرکت در ۲۲ سپتامبر نسخه V3.1-Terminus و در ۲۹ سپتامبر نسخه V3.2-Exp را منتشر کرد. آپدیت Terminus به‌طور خاص برای رفع مشکلات سازگاری زبان طراحی شده بود تا ترکیب غیرطبیعی زبان‌های چینی و انگلیسی و کاراکترهای غیرعادی را کاهش دهد و هم‌زمان عملکرد «عامل کدنویس» (Code Agent) و «عامل جستجو» (Search Agent) را بهینه کند.

پیش از آن در سال ۲۰۲۵، دیپ‌سیک در ماه اوت از معماری استدلالی ترکیبی V3.1 استفاده کرد و در ماه می ارتقای R1-0528 را ارائه داد. آپدیت اوت V3.1 یک مدل واحد را معرفی کرد که هر دو حالت فکر‌کننده و غیرفک‌رکننده را پشتیبانی می‌کرد و کارایی استدلال را نسبت به R1-0528 بهبود بخشید. این نسخه همچنین به نقاط عطف مهمی در عملکرد عامل‌ها رسید: نمره ۶۶.۰ در SWE-bench Verified، نمره ۵۴.۵ در SWE-bench Multilingual و نمره ۳۱.۳ در Terminal-bench.

زمینه تاریخی و تکامل خانواده دیپ‌سیک

برای درک مسیر رسیدن به V4-Flash، باید تکامل این خانواده را در بازه ۲۰۲۴-۲۰۲۵ بررسی کرد:

  • عصر R1 (ژانویه تا می ۲۰۲۵): مدل deepseek-reasoner در ژانویه ۲۰۲۵ به عنوان DeepSeek-R1 معرفی شد. تا ۲۸ می ۲۰۲۵، این مدل به نسخه R1-0528 ارتقا یافت. این نسخه امتیاز AIME ۲۰۲۵ را از ۷۰.۰ به ۸۷.۵ (+۱۷.۵)، GPQA را از ۷۱.۵ به ۸۱.۰ (+۹.۵) و LCB_v6 را از ۶۳.۵ به ۷۳.۳ (+۹.۸) رساند. همچنین امتیاز Aider را از ۵۷.۰ به ۷۱.۶ (+۱۴.۶) افزایش داد. این ورژن توهمات را سرکوب کرد و زیبایی‌شناسی صفحات وب و بازی‌ها را بهبود بخشید. عملکرد فراخوانی توابع (Function calling) در Tau-bench برای بخش هواپیمایی به ۵۳.۵ و برای خرده‌فروشی به ۶۳.۹ رسید.
  • تکامل V3 (مارس ۲۰۲۵): مدل deepseek-chat در ۲۴ مارس به DeepSeek-V3-0324 ارتقا یافت. در این نسخه MMLU-Pro از ۷۵.۹ به ۸۱.۲ (+۵.۳)، GPQA از ۵۹.۱ به ۶۸.۴ (+۹.۳) و AIME از ۳۹.۶ به ۵۹.۴ (+۱۹.۸) جهش کرد. امتیاز LiveCodeBench نیز از ۳۹.۲ به ۴۹.۲ (+۱۰.۰) رسید. تمرکز این نسخه بر مهارت‌های نوشتاری چینی، همسویی با سبک R1 برای محتواهای متوسط تا بلند و بهینه‌سازی بازنویسی تعاملی چند-مرحله‌ای و کیفیت ترجمه بود.
  • تثبیت V2.5 (سپتامبر ۲۰۲۴): دیپ‌سیک در ۵ سپتامبر ۲۰۲۴ مدل‌های V2 Chat و Coder V2 را در DeepSeek V2.5 ادغام کرد. این نسخه نرخ پیروزی در ArenaHard را از ۶۸.۳٪ به ۷۶.۳٪ رساند. سایر معیارها شامل افزایش نرخ پیروزی AlpacaEval 2.0 LC از ۴۶.۶۱٪ به ۵۰.۵۲٪، افزایش امتیاز MT-Bench از ۸.۸۴ به ۹.۰۲ و افزایش امتیاز AlignBench از ۷.۸۸ به ۸.۰۴ بود. این مدل ۸۹٪ در HumanEval و ۴۱٪ در LiveCodeBench (ژانویه-سپتامبر) کسب کرد.
  • نوآوری‌های زیرساختی (اوت ۲۰۲۴): دیپ‌سیک در ۲ اوت ۲۰۲۴ فناوری «کش زمینه روی دیسک» (Context Caching on Disk) را معرفی کرد. این نوآوری با استفاده از حافظه دیسک سخت برای کش، قیمت API را یک مرتبه بزرگی (Order of Magnitude) دیگر کاهش داد.

جزئیات نقاط عطف توسعه

سیر پیشرفت دیپ‌سیک با جهش‌های مستمر در قابلیت‌های خاص همراه بوده است:

۱. کدنویسی و منطق:

  • نسخه V2-0628 (۲۸ ژوئن ۲۰۲۴) به دقت ۸۴.۷۶٪ در HumanEval Pass@1 رسید (نسبت به ۷۹.۸۸٪ قبلی).
  • مدل تخصصی Coder-V2-0614 (۱۴ ژوئن ۲۰۲۴) در زمینه‌های تولید، درک، عیب‌یابی و تکمیل کد به برابری با GPT-4-Turbo-0409 رسید.
  • آپدیت V2.5-1210 (۱۰ دسامبر ۲۰۲۴) دقت LiveCodebench را از ۲۹.۲٪ به ۳۴.۳۸٪ افزایش داد.

۲. استدلال ریاضی:

  • مدل V2-0628 مقدار MATH ACC@1 را از ۵۵.۰۲٪ به ۷۱.۰۲٪ رساند.
  • همین نسخه (V2-0628) امتیاز BBH را از ۷۸.۵۶٪ به ۸۳.۴۰٪ بهبود داد.
  • آپدیت V2.5-1210 عملکرد MATH-500 را از ۷۴.۸٪ به ۸۲.۸٪ ارتقا داد.

۳. پیروی از دستورات و کاربرد API:

  • در نسخه V2-0517 (۱۷ می ۲۰۲۴)، دقت IFEval در سطح Prompt از ۶۳.۹٪ به ۷۷.۶٪ جهش کرد.
  • نرخ تجزیه (Parsing) JSON از ۷۸٪ به ۸۵٪ و سپس با استفاده از عبارات منظم (Regular Expressions) به ۹۷٪ رسید.
  • در ۲۵ جولای ۲۰۲۴، دیپ‌سیک قابلیت‌های JSON Mode، فراخوانی توابع (Function Calling)، تکمیل پیشوند چت (بتا) و حداکثر ۸ هزار توکن خروجی (بتا) را اضافه کرد.

۴. آزمایش‌های کوتاه‌مدت:

  • در ۱ دسامبر ۲۰۲۵، دیپ‌سیک نسخه V3.2-Speciale را از طریق یک نقطه پایانی (Endpoint) موقت ارائه کرد. این نسخه آزمایشی تا ۱۵ دسامبر ۲۰۲۵ ساعت ۱۵:۵۹ UTC در دسترس بود. قیمت‌گذاری آن مشابه V3.2 بود اما از فراخوانی ابزارها (Tool Calls) پشتیبانی نمی‌کرد.

تحلیل: کالایی شدن توانمندی‌های عاملی (Commoditization of Agency)

با سوق دادن V4-Flash برای شکست دادن V4-Pro-Preview، دیپ‌سیک سیگنالی ارسال می‌کند مبنی بر اینکه رفتارهای تخصصی عاملی (Agentic) دیگر تنها در انحصار مدل‌های عظیم و گران‌قیمت نیست. این امر به‌طور مؤثر «کف هوشمندی» (Intelligence Floor) را برای اتوماسیون سازمانی پایین می‌آورد.

برای توسعه‌دهندگان، انطباق بومی برای Codex و Responses API نشان می‌دهد که دیپ‌سیک در حال بهینه‌سازی برای گردش کار «IDE به عنوان یک عامل» (IDE-as-an-Agent) است. این یعنی مدل از یک دستیار کدنویسی که فقط به سوالات پاسخ می‌دهد، به ابزاری تبدیل می‌شود که کل چرخه حیات توسعه نرم‌افزار را مدیریت می‌کند. استفاده خاص از حالت minimal در DeepSeek Harness نشان‌دهنده حرکت به سمت محیط‌های اجرای استاندارد و سبک برای عامل‌هاست.

از منظر هزینه، این استراتژی سودمندی معماری‌های کوچک‌تر را به حداکثر می‌رساند. اگر یک مدل Flash پس‌آموزشی بتواند تست‌های داخلی توسعه Full-stack (DSBench-FullStack) و مسائل سخت کدنویسی (DSBench-Hard) را مدیریت کند، انگیزه اقتصادی برای استفاده از مدل Pro در وظایف روتین عاملی از بین می‌رود. این دقیقاً مشابه گذاری است که در چرخه V3.1 دیده شد، جایی که کارایی به اندازه قدرت خام اهمیت یافت.

منتظر عرضه رسمی V4-Pro باشید تا ببینیم آیا این مدل برتری قابل‌توجهی در استدلال خام حفظ می‌کند یا اینکه کارایی مدل Flash، آن را به انتخاب اصلی برای گردش‌های کاری عاملی در محیط‌های عملیاتی (Production) تبدیل می‌کند.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای اتوماسیون کدنویسی استفاده می‌کنید، مدل deepseek-v4-flash را جایگزین کنید تا کاهش هزینه و حفظ کیفیت را بسنجید.
  • توسعه‌دهندگان باید سازگاری بومی Responses API را برای کاهش تأخیر (Latency) در عامل‌های خود تست کنند.
  • متن باز بودن وزن‌های این مدل را با خروجی‌های نسخه Pro مقایسه کنید تا نقاط شکست استدلالی آن را بیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار بنچمارک‌های سخت‌گیرانه، ثابت می‌کند که کارایی استنتاج می‌تواند جایگزین افزایش اندازه مدل شود. این تغییر منجر به کاهش شدید هزینه‌های عملیاتی برای شرکت‌هایی می‌شود که در مقیاس انبوه از عامل‌های هوشمند استفاده می‌کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل‌ها دشوار است، اما استفاده از نسخه‌های وزن‌باز (Open Weights) آن در سرورهای شخصی، فرصتی برای اتوماسیون ارزان‌قیمت کدنویسی در شرکت‌های داخلی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های حجیم با نسخه‌های Flash در وظایف پیچیده عامل‌محور، نشان می‌دهد که «سقف هوش» برای اتوماسیون سازمانی در حال پایین آمدن است. دیپ‌سیک با این حرکت، مدل‌های Pro را برای استدلال‌های عمیق نگه می‌دارد و عملیات اجرایی را به مدل‌های بهینه شده می‌سپارد. این استراتژی باعث می‌شود ابزارهای برنامه‌نویسی از حالت «دستیار» به «مدیر چرخه حیات توسعه» تبدیل شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.