تصور کنید مدل ارزانقیمت و سریع یک شرکت، در سختترین آزمونهای مهندسی نرمافزار، مدل «حرفهای» همان شرکت را شکست دهد. این اتفاق اکنون در دنیای دیپسیک رخ داده و تعریف ما از نسبت قدرت به هزینه را تغییر میدهد. آیا یک مدل Flash میتواند از پیشنیازندهی خود در نسخهی Pro-Preview در عملکرد عاملهای هوشمند پیشی بگیرد؟ DeepSeek-V4-Flash این دستاورد را به دست آورده و نشاندهنده تغییری در نسبت کارایی به قدرت در این شرکت است.
طبق اعلام رسمی در مستندات API دیپسیک (DeepSeek) که در ۳۱ جولای ۲۰۲۶ بهروزرسانی شد، مدل DeepSeek-V4-Flash اکنون از طریق پارامتر deepseek-v4-flash در دسترس کاربران در حالت بتای عمومی است. این تحول در حالی رخ میدهد که صنعت هوش مصنوعی از رابطهای چت ساده به سمت عاملهای هوشمند (AI Agents) — شبیه به کارمندانی دیجیتال که میتوانند بهجای پیشنهاد دادن، واقعاً وظایف پیچیده مهندسی نرمافزار را اجرا کنند — حرکت میکند. این رقابت برای تسلط بر وظایف کدنویسی پیشرفته، یادآور بررسیهای اخیر در مورد عملکرد GPT-5.5 در مقایسه با رقبای خود است که استانداردهای جدیدی را برای بنچمارکهای مهندسی تعریف کرد. برای کاربران تجاری و مدیران کسبوکار، این یعنی شکاف بین مدلهای «سبک» (Lightweight) و «حرفهای» (Pro) در حال بسته شدن است و اتوماسیون سریعتر و ارزانتر، دیگر به معنای پذیرش افت شدید در قابلیت اطمینان نیست.
همانطور که در تحلیل قبلی ما دربارهی استراتژیهای کاهش هزینه استنتاج اشاره کردیم، بهینهسازی لایههای خروجی میتواند نتایجی فراتر از افزایش اندازه مدل داشته باشد. در مدل V4-Flash، این موضوع به شکل ملموسی دیده میشود و نشان میدهد که مدلهای کوچکتر میتوانند با آموزشهای هدفمند، رفتارهای پیچیده مدلهای بزرگ را تقلید کنند.
پیشرفتهای چشمگیر در عملکرد عاملها (Agents)
به گزارش یادداشتهای انتشار ۳۱ جولای، مدل جدید در عملیاتهای خودگردان بهبودهای شدیدی نشان داده است. نتایج بنچمارکهای این مدل در چندین معیار کلیدی، بهطور قابلتوجهی از V4-Pro-Preview فراتر رفته است:
- Terminal Bench 2.1: ۸۲.۷
- NL2Repo: ۵۴.۲
- Cybergym: ۷۶.۷
- DeepSWE: ۵۴.۴
- Toolathlon Verified: ۷۰.۳
- Agent Last Exam: ۲۵.۲
- Automation Bench (Public): ۲۵.۱
- DSBench-FullStack (داخلی): ۶۸.۷
- DSBench-Hard (داخلی): ۵۹.۶
پیادهسازی فنی و جزئیات ادغام
در بخش پیادهسازی فنی، دیپسیک تأیید کرد که مدل DeepSeek-V4-Flash-0731 دقیقاً همان معماری و اندازه نسخه پیشنمایش قبلی را دارد. این جهش در عملکرد نتیجهی یک فرآیند هدفمند پسآموزش (Post-training) است و نه تغییر در مقیاس یا اندازه مدل؛ یعنی مدل با دادههای باکیفیتتر و روشهای بهینهتر بازآموزی شده است تا در وظایف Agentic دقیقتر عمل کند.
توسعهدهندگان میتوانند با مشخصات دقیق زیر این مدل را در سیستمهای خود ادغام کنند:
- فرمت API: دارای پشتیبانی بومی از Responses API و انطباق خاص برای Codex است.
- چارچوب تست: نتایج بنچمارکهای عمومی برای وظایف «عامل کدنویسی» با استفاده از حالت minimal در DeepSeek Harness (که بهزودی منتشر میشود) به دست آمدهاند.
- ابرپارامترها (Hyperparameters): بنچمارکهای ذکر شده با تنظیمات «حداکثر سطح تلاش» (max effort level)، مقدار topp=۰.۹۵ و temperature=۱.۰ اجرا شدهاند. در این زمینه، تغییر رویکرد به پارامترهای کنترلی در مدلهای سریع، مشابه تغییر متد کنترل در مدل Gemini 3.6 Flash است که در آن متدهای سنتی کنترل خروجی جای خود را به دستورات سیستمی دادند.
استراتژی محصول و خط زمانی
این عرضه بهطور خاص API مدل Flash را هدف قرار داده است. مدلهای DeepSeek-V4-Pro و نسخههای فعلی وب و اپلیکیشن بدون تغییر باقی ماندهاند، هرچند شرکت صراحتاً اعلام کرده است که نسخه رسمی و نهایی V4-Pro بهزودی منتشر خواهد شد.
نگاه به نقشه راه دیپسیک نشان میدهد این شرکت با سرعت خیرهکنندهای در چرخه V4 حرکت میکند. در ۲۴ آوریل ۲۰۲۶، شرکت هر دو مدل Pro و Flash را معرفی کرد که از طریق رابطهای OpenAI ChatCompletions و Anthropic در دسترس بودند. برای دسترسی به این مدلها، base_url بدون تغییر باقی میماند و تنها پارامتر مدل باید روی deepseek-v4-pro یا deepseek-v4-flash تنظیم شود.
دیپسیک همچنین اعلام کرد که نامهای قدیمی و میراثی مانند deepseek-chat و deepseek-reasoner را تا ۲۴ جولای ۲۰۲۶ بازنشسته میکند. در طول دوره انتقال سه ماههای که در این تاریخ به پایان رسید، این نامهای قدیمی بهترتیب به حالتهای «غیرفکرکننده» (non-thinking) و «فکرکننده» (thinking) مدل v4-flash اشاره میکردند.
این روند تکرار الگویی از تکرار سریع (Rapid Iteration) است که در سال ۲۰۲۵ تثبیت شد. در سپتامبر ۲۰۲۵، این شرکت در ۲۲ سپتامبر نسخه V3.1-Terminus و در ۲۹ سپتامبر نسخه V3.2-Exp را منتشر کرد. آپدیت Terminus بهطور خاص برای رفع مشکلات سازگاری زبان طراحی شده بود تا ترکیب غیرطبیعی زبانهای چینی و انگلیسی و کاراکترهای غیرعادی را کاهش دهد و همزمان عملکرد «عامل کدنویس» (Code Agent) و «عامل جستجو» (Search Agent) را بهینه کند.
پیش از آن در سال ۲۰۲۵، دیپسیک در ماه اوت از معماری استدلالی ترکیبی V3.1 استفاده کرد و در ماه می ارتقای R1-0528 را ارائه داد. آپدیت اوت V3.1 یک مدل واحد را معرفی کرد که هر دو حالت فکرکننده و غیرفکرکننده را پشتیبانی میکرد و کارایی استدلال را نسبت به R1-0528 بهبود بخشید. این نسخه همچنین به نقاط عطف مهمی در عملکرد عاملها رسید: نمره ۶۶.۰ در SWE-bench Verified، نمره ۵۴.۵ در SWE-bench Multilingual و نمره ۳۱.۳ در Terminal-bench.
زمینه تاریخی و تکامل خانواده دیپسیک
برای درک مسیر رسیدن به V4-Flash، باید تکامل این خانواده را در بازه ۲۰۲۴-۲۰۲۵ بررسی کرد:
- عصر R1 (ژانویه تا می ۲۰۲۵): مدل
deepseek-reasonerدر ژانویه ۲۰۲۵ به عنوان DeepSeek-R1 معرفی شد. تا ۲۸ می ۲۰۲۵، این مدل به نسخه R1-0528 ارتقا یافت. این نسخه امتیاز AIME ۲۰۲۵ را از ۷۰.۰ به ۸۷.۵ (+۱۷.۵)، GPQA را از ۷۱.۵ به ۸۱.۰ (+۹.۵) و LCB_v6 را از ۶۳.۵ به ۷۳.۳ (+۹.۸) رساند. همچنین امتیاز Aider را از ۵۷.۰ به ۷۱.۶ (+۱۴.۶) افزایش داد. این ورژن توهمات را سرکوب کرد و زیباییشناسی صفحات وب و بازیها را بهبود بخشید. عملکرد فراخوانی توابع (Function calling) در Tau-bench برای بخش هواپیمایی به ۵۳.۵ و برای خردهفروشی به ۶۳.۹ رسید. - تکامل V3 (مارس ۲۰۲۵): مدل
deepseek-chatدر ۲۴ مارس به DeepSeek-V3-0324 ارتقا یافت. در این نسخه MMLU-Pro از ۷۵.۹ به ۸۱.۲ (+۵.۳)، GPQA از ۵۹.۱ به ۶۸.۴ (+۹.۳) و AIME از ۳۹.۶ به ۵۹.۴ (+۱۹.۸) جهش کرد. امتیاز LiveCodeBench نیز از ۳۹.۲ به ۴۹.۲ (+۱۰.۰) رسید. تمرکز این نسخه بر مهارتهای نوشتاری چینی، همسویی با سبک R1 برای محتواهای متوسط تا بلند و بهینهسازی بازنویسی تعاملی چند-مرحلهای و کیفیت ترجمه بود. - تثبیت V2.5 (سپتامبر ۲۰۲۴): دیپسیک در ۵ سپتامبر ۲۰۲۴ مدلهای V2 Chat و Coder V2 را در DeepSeek V2.5 ادغام کرد. این نسخه نرخ پیروزی در ArenaHard را از ۶۸.۳٪ به ۷۶.۳٪ رساند. سایر معیارها شامل افزایش نرخ پیروزی AlpacaEval 2.0 LC از ۴۶.۶۱٪ به ۵۰.۵۲٪، افزایش امتیاز MT-Bench از ۸.۸۴ به ۹.۰۲ و افزایش امتیاز AlignBench از ۷.۸۸ به ۸.۰۴ بود. این مدل ۸۹٪ در HumanEval و ۴۱٪ در LiveCodeBench (ژانویه-سپتامبر) کسب کرد.
- نوآوریهای زیرساختی (اوت ۲۰۲۴): دیپسیک در ۲ اوت ۲۰۲۴ فناوری «کش زمینه روی دیسک» (Context Caching on Disk) را معرفی کرد. این نوآوری با استفاده از حافظه دیسک سخت برای کش، قیمت API را یک مرتبه بزرگی (Order of Magnitude) دیگر کاهش داد.
جزئیات نقاط عطف توسعه
سیر پیشرفت دیپسیک با جهشهای مستمر در قابلیتهای خاص همراه بوده است:
۱. کدنویسی و منطق:
- نسخه V2-0628 (۲۸ ژوئن ۲۰۲۴) به دقت ۸۴.۷۶٪ در HumanEval Pass@1 رسید (نسبت به ۷۹.۸۸٪ قبلی).
- مدل تخصصی Coder-V2-0614 (۱۴ ژوئن ۲۰۲۴) در زمینههای تولید، درک، عیبیابی و تکمیل کد به برابری با GPT-4-Turbo-0409 رسید.
- آپدیت V2.5-1210 (۱۰ دسامبر ۲۰۲۴) دقت LiveCodebench را از ۲۹.۲٪ به ۳۴.۳۸٪ افزایش داد.
۲. استدلال ریاضی:
- مدل V2-0628 مقدار MATH ACC@1 را از ۵۵.۰۲٪ به ۷۱.۰۲٪ رساند.
- همین نسخه (V2-0628) امتیاز BBH را از ۷۸.۵۶٪ به ۸۳.۴۰٪ بهبود داد.
- آپدیت V2.5-1210 عملکرد MATH-500 را از ۷۴.۸٪ به ۸۲.۸٪ ارتقا داد.
۳. پیروی از دستورات و کاربرد API:
- در نسخه V2-0517 (۱۷ می ۲۰۲۴)، دقت IFEval در سطح Prompt از ۶۳.۹٪ به ۷۷.۶٪ جهش کرد.
- نرخ تجزیه (Parsing) JSON از ۷۸٪ به ۸۵٪ و سپس با استفاده از عبارات منظم (Regular Expressions) به ۹۷٪ رسید.
- در ۲۵ جولای ۲۰۲۴، دیپسیک قابلیتهای JSON Mode، فراخوانی توابع (Function Calling)، تکمیل پیشوند چت (بتا) و حداکثر ۸ هزار توکن خروجی (بتا) را اضافه کرد.
۴. آزمایشهای کوتاهمدت:
- در ۱ دسامبر ۲۰۲۵، دیپسیک نسخه V3.2-Speciale را از طریق یک نقطه پایانی (Endpoint) موقت ارائه کرد. این نسخه آزمایشی تا ۱۵ دسامبر ۲۰۲۵ ساعت ۱۵:۵۹ UTC در دسترس بود. قیمتگذاری آن مشابه V3.2 بود اما از فراخوانی ابزارها (Tool Calls) پشتیبانی نمیکرد.
تحلیل: کالایی شدن توانمندیهای عاملی (Commoditization of Agency)
با سوق دادن V4-Flash برای شکست دادن V4-Pro-Preview، دیپسیک سیگنالی ارسال میکند مبنی بر اینکه رفتارهای تخصصی عاملی (Agentic) دیگر تنها در انحصار مدلهای عظیم و گرانقیمت نیست. این امر بهطور مؤثر «کف هوشمندی» (Intelligence Floor) را برای اتوماسیون سازمانی پایین میآورد.
برای توسعهدهندگان، انطباق بومی برای Codex و Responses API نشان میدهد که دیپسیک در حال بهینهسازی برای گردش کار «IDE به عنوان یک عامل» (IDE-as-an-Agent) است. این یعنی مدل از یک دستیار کدنویسی که فقط به سوالات پاسخ میدهد، به ابزاری تبدیل میشود که کل چرخه حیات توسعه نرمافزار را مدیریت میکند. استفاده خاص از حالت minimal در DeepSeek Harness نشاندهنده حرکت به سمت محیطهای اجرای استاندارد و سبک برای عاملهاست.
از منظر هزینه، این استراتژی سودمندی معماریهای کوچکتر را به حداکثر میرساند. اگر یک مدل Flash پسآموزشی بتواند تستهای داخلی توسعه Full-stack (DSBench-FullStack) و مسائل سخت کدنویسی (DSBench-Hard) را مدیریت کند، انگیزه اقتصادی برای استفاده از مدل Pro در وظایف روتین عاملی از بین میرود. این دقیقاً مشابه گذاری است که در چرخه V3.1 دیده شد، جایی که کارایی به اندازه قدرت خام اهمیت یافت.
منتظر عرضه رسمی V4-Pro باشید تا ببینیم آیا این مدل برتری قابلتوجهی در استدلال خام حفظ میکند یا اینکه کارایی مدل Flash، آن را به انتخاب اصلی برای گردشهای کاری عاملی در محیطهای عملیاتی (Production) تبدیل میکند.
گام بعدی شما
- اگر از مدلهای گرانقیمت برای اتوماسیون کدنویسی استفاده میکنید، مدل
deepseek-v4-flashرا جایگزین کنید تا کاهش هزینه و حفظ کیفیت را بسنجید. - توسعهدهندگان باید سازگاری بومی Responses API را برای کاهش تأخیر (Latency) در عاملهای خود تست کنند.
- متن باز بودن وزنهای این مدل را با خروجیهای نسخه Pro مقایسه کنید تا نقاط شکست استدلالی آن را بیابید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو