اگر امروز از مدلهای هوش مصنوعی برای اتوماسیون کدنویسی استفاده میکنید، باید بدانید که فاصله میان «پیشنهاد کد» و «اجرای مستقل کد» در حال بسته شدن است. مدل جدید DeepSeek حالا میتواند فراتر از یک چتبات ساده، مانند یک مهندس نرمافزار عمل کند که کد را مینویسد، اجرا میکند و خطاهای آن را در محیط ایزوله میبندد.
این تحول در حالی رخ میدهد که صنعت به سمت عاملهای هوشمند (AI Agents) — شبیه به کارمندانی دیجیتال که میتوانند وظایف پیچیده و چندمرحلهای را بدون نظارت لحظهای انجام دهند — حرکت میکند. در حالی که نسخههای قبلی بر روی هوش خام تمرکز داشتند، این انتشار جدید «مایل آخر» از قابلیت اطمینان عاملها را هدف قرار داده است. تصور کنید توسعهدهندهای را داشته باشید که دیگر فقط کد پیشنهاد نمیدهد، بلکه میتواند آن را در یک محیط سندباکس اجرا و تأیید کند.
طبق اعلام DeepSeek، نسخه V4-Pro-0813 که در ۱۳ اوت ۲۰۲۶ به تولید انبوه رسید، عملکرد کدنویسی عاملمحور را از امتیاز ۱۲.۸ در بنچمارک DeepSWE به ۶۲.۷ رسانده است. این جهش یعنی مدل از مرحلهی «تلاش برای پاسخ» به مرحلهی «تضمین نتیجه» رسیده است.
زمینه و ادغام
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، دسترسی به ابزارهای کنترلی در مدلهای قدرتمند حیاتی است. DeepSeek این مدل را در حالت «Expert Mode» در وبسایت و اپلیکیشن خود فعال کرده است. به گزارش وبسایت the-decoder.com، این بهروزرسانی تا حدی پاسخ به موفقیت مدل V4 Flash بود. در اواخر جولای، بهروزرسانی 0731 برای V4 Flash توانسته بود در شاخص هوش مصنوعی Artificial Analysis عملکردی تقریباً برابر با نسخه Pro Preview داشته باشد، در حالی که هزینه بسیار کمتری داشت؛ موضوعی که در گزارش قبلی ما درباره پیشی گرفتن V4-Flash از نسخه Pro در بنچمارکهای عاملمحور به تفصیل بررسی شده بود.
جزئیات فنی این نسخه نشان میدهد که پنجرهٔ زمینه (Context Window) — یعنی میزان متنی که مدل همزمان در ذهن نگه میدارد، شبیه به میز کاری که جا برای چند ورق دارد — همچنان یک میلیون توکن است. همچنین پشتیبانی بومی از API پاسخهای OpenAI به همراه ادغام با Codex اضافه شده است. کاربران اکنون میتوانند میزان تلاش برای استدلال (Reasoning Effort) را بین سه حالت «کم» (low)، «زیاد» (high) و «حداکثر» (max) تغییر دهند؛ هرچند شرکت حالت «زیاد» را به عنوان گزینه میانی برای استفادههای روزمره از عاملها توصیه میکند.
عملکرد و بنچمارکها
بر اساس دادههای داخلی DeepSeek، پیشرفتهای فنی مدل در محکهای زیر مشهود است:
- امتیاز Terminal Bench 2.1 از ۷۲.۱ به ۸۷.۹ رسید.
- امتیاز DeepSWE از ۱۲.۸ به ۶۲.۷ جهش کرد.
- مدل در چندین بنچمارک تخصصی عاملها، از Claude Opus 4.8 پیشی گرفت.

با این حال، دادههای شخص ثالث از Artificial Analysis تصویر جامعتری ارائه میدهد. مدل V4-Pro در شاخص هوش از ۴۵ به ۵۳ رسید و با GLM-5.2 برابر شد، اما همچنان از مدلهایی مثل Muse Spark (۵۷)، Qwen 3.8 Max (۵۸) و Kimi K3 (۶۰) عقبتر است. در صدر این جدول، Claude Opus 5 با ۶۳ امتیاز قرار دارد. اگرچه نسخه جدید نسبت به پیشنمایش پیشرفت کرده است، اما تنها در دستهبندیهای فردی توانسته است Kimi K3 و Fable 5 را شکست دهد.
چارچوب متنباز عاملها (Agent Harness)
در کنار مدل، DeepSeek ابزار DeepSeek Harness v0.1 را تحت لایسنس MIT منتشر کرد. این نرمافزار که توسط «کوی تیانی» (Cui Tianyi)، معاملهگر سابق Jane Street که در مارس ۲۰۲۶ به شرکت پیوست، رهبری میشود، جایگزینی متنباز برای Codex و Claude است. در بازه زمانی کوتاهی از اوایل اوت، ۷۱۲ پروژه تنها ظرف سه روز برای تست بتای این ابزار ثبتنام کردند.
ویژگیهای کلیدی این ابزار عبارتند از:
- سیستم Cordis: یک سیستم پلاگین که در آن ابزارها، محیطهای ایزوله (Sandbox)، نشستها و رابط کاربری همگی بهراحتی قابل تعویض هستند.
- مدیریت نشست: یک لاگ مستمر که هر پرامپت، فراخوانی ابزار و نتیجه را ثبت میکند. اجراها را میتوان شاخه کرد (Branch)، بازپخش کرد یا از ادامه مسیر resumed کرد.
- حالت مینیمال: رابطی که محیط را به یک شل (Shell) و ویرایشگر فایل ساده کاهش میدهد؛ روشی که خود DeepSeek برای بنچمارکهایش از آن استفاده میکند.
این نرمافزار از طریق npx و با یک رابط وب محلی اجرا میشود، هرچند شرکت درباره احتمال بروز مشکلات سازگاری هشدار داده است.
هزینه هوشمندی
اما این افزایش قدرت، هزینهای هم دارد. از ۱۶ اوت ۲۰۲۶، ساعت ۴ بعدازظهر به وقت UTC، قیمتهای API بر اساس ساعات کاری چین تغییر میکند. نرخهای مبتنی بر زمان از فوریه ۲۰۲۵ برای مدلهای V3 و R1 وجود داشت. ساعات اوج (Peak) از ساعت ۱ تا ۴ صبح و ۶ تا ۱۰ صبح به وقت UTC است. برای کاربران اروپایی، بیشتر ساعات بعدازظهر در نرخ «غیراوج» قرار میگیرد.
نرخ ورودی غیراوج برای V4-Pro از ۰.۴۳۵ به ۰.۶۶ دلار و خروجی از ۰.۸۷ به ۱.۹۸ دلار به ازای هر میلیون توکن — تکههای کوچکی از متن که مدل تکهتکه میخورد — افزایش مییابد. در ساعات اوج، این قیمتها دو برابر شده و به ترتیب به ۱.۳۲ و ۳.۹۶ دلار میرسند.

سختترین ضربه به سیستم کش (Cache) وارد شده است؛ جایی که قیمتها در حالت غیراوج از ۰.۰۰۳۶۲۵ به ۰.۰۲۲ دلار و در حالت اوج به ۰.۰۴۴ دلار رسید. این یعنی تخفیف حافظه از تقریباً ۱/۱۲۰ به ۱/۳۰ قیمت ورودی عادی کاهش یافت. برای عاملهایی که مدام فایلهای حجیم یکسانی را میخوانند، این تغییر عملاً تخفیفهای ماه مه را از بین میبرد و هزینههای عملیاتی را بهشدت افزایش میدهد.
این چرخش قیمتی نشاندهنده تغییر استراتژی تجاری DeepSeek است. شرکت با افزایش نرخها در حالی که در حال جذب سرمایههای جدید و آمادهسازی برای عرضه اولیه سهام (IPO) است، از جنگ قیمتی «رشد به هر قیمت» فاصله گرفته و به دنبال مدل درآمدی پایدار است. برای کاربر نهایی، معامله روشن است: شما عاملی بسیار توانمندتر دریافت میکنید، اما حافظه ارزانقیمت دیگر یک کالای لوکس و رایگان نیست.
گام بعدی شما
- اگر توسعهدهنده هستید، DeepSeek Harness v0.1 را از طریق npx نصب کنید تا محیط اجرای عاملهای خود را متنباز کنید.
- تنظیمات Reasoning Effort را روی High قرار دهید تا تعادل میان هزینه و دقت در کارهای پیچیده کدنویسی را بسنجید.
- ساختار هزینههای API خود را با توجه به ساعات اوج (Peak) بازبینی کنید تا غافلگیر نشوید.
اما انتظار برای انتشار وزنهای V4-Pro در Hugging Face ادامه دارد، زیرا شرکت فعلاً تنها دسترسی API و نسخه پیشنمایش آپریل را فراهم کرده است؛ تحلیلی بر این موضوع و اثر آن بر مدلهای محلی را در گزارش بعدی خواهیم خواند.




گفتگو