پرش به محتوای اصلی
پرش به محتوای مقاله

DeepSeek V4 با مدل قیمت‌گذاری ساعتی، هزینه استنتاج را ۶ برابر ارزان‌تر از

·۲۳ تیر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
رونمایی رسمی DeepSeek V4: قیمت‌های اوج در راه است — اما چرا توسعه‌دهندگان غربی همچنان برنده‌اند
رونمایی رسمی DeepSeek V4: قیمت‌های اوج در راه است — اما چرا توسعه‌دهندگان غربی همچنان برنده‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین مدل قیمت‌گذاری پویا (بر اساس ساعات اوج مصرف) در صنعت AI که به جای رقابت صرف بر روی کیفیت، بر بهینه‌سازی توزیع جهانی تقاضای محاسباتی تمرکز دارد.

اگر امروز برای استفاده از GPT-4o هزینه پرداخت می‌کنید، باید بدانید که جایگزینی آن با DeepSeek V4 می‌تواند صورت‌حساب ماهانه شما را تا ۶ برابر کاهش دهد. این کاهش هزینه، یک تخفیف ساده نیست؛ بلکه باز تعریف اقتصاد استنتاج در مقیاس جهانی است. حتی در ساعات اوج مصرف که هزینه خروجی به ۱.۶۴ دلار برای هر میلیون توکن می‌رسد، این مدل همچنان ۶ برابر ارزان‌تر از GPT-4o باقی می‌ماند.

به گزارش وب‌سایت dev.to، انتقال رسمی از نسخه پیش‌نمایش به انتشار کامل در ۱۵ ژوئیه ۲۰۲۶ اتفاق می‌افتد. این رویکرد در واقع تکامل همان استراتژی است که در خبر عرضه DeepSeek V4 با قیمت‌گذاری پویا در جولای ۲۰۲۶ به آن اشاره کرده بودیم. این مدل زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — اکنون از سیستمی استفاده می‌کند که هزینه بر اساس ساعات شلوغ و خلوت تغییر می‌کند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های مدل‌های باز-وزن اشاره کردیم، رقابت اکنون از «کیفیت پاسخ» به «بهینه‌ترین قیمت برای هر توکن» منتقل شده است. این تغییر رویکرد به سمت پرداخت بر اساس میزان مصرف، مشابه تحولاتی است که اخیراً در مدل‌های صورت‌حسابی Copilot Cowork مایکروسافت مشاهده شد. این استراتژی جدید DeepSeek برای مدیریت ترافیک داخلی چین طراحی شده است. اما برای توسعه‌دهندگان خارج از این کشور، این ساختار یک فرصت منحصر‌به‌فرد «آربیتراژ زمانی» ایجاد می‌کند. در حالی که کاربران در پکن با هزینه‌های بالاتر مواجه هستند، توسعه‌دهندگانی که در آمریکای شمالی و اروپا هستند، متوجه می‌شوند که ساعات کاری استاندارد آن‌ها تقریباً به‌طور کامل با نرخ‌های خلوت (Off-Peak) مدل هم‌راستا است.

مکانیسم قیمت‌گذاری ساعات اوج

طبق مستندات رسمی، ساعات اوج مصرف (Peak) به‌طور دقیق بر اساس ساعت پکن (UTC+8) تعریف شده است. نرخ پایه ۲ برابر در دو بازه زمانی خاص اعمال می‌شود: از ساعت ۹:۰۰ تا ۱۲:۰۰ و از ساعت ۱۴:۰۰ تا ۱۸:۰۰.

برای توسعه‌دهندگان غربی، این محاسبات بسیار سودمند است. اگر شما در منطقه زمانی ساحل شرقی ایالات متحده (EDT) باشید، ساعات اوج مصرف بین ساعت ۹ شب تا ۱۲ شب و ۲ تا ۶ صبح رخ می‌دهد. برای کسانی که در ساحل غربی (PDT) هستند، این بازه‌ها بین ۶ عصر تا ۹ شب و ۱۱ شب تا ۳ صبح است. در واقع، ۸۰ تا ۱۰۰ درصد از ساعات کاری در قاره آمریکا در وضعیت «خارج از اوج» قرار دارد و این یک «تخفیف زمانی» طبیعی ایجاد می‌کند.

سطوح مدل و جزئیات قیمت‌گذاری

مدل DeepSeek V4-Pro به عنوان سطح با عملکرد بالا عمل می‌کند، در حالی که DeepSeek V4-Flash وظایف سبک‌تر را بر عهده دارد. تجزیه و تحلیل هزینه‌ها برای هر ۱ میلیون توکن (با نرخ تبدیل ۷.۳ یوان = ۱ دلار) به شرح زیر است:

  • V4-Pro (خارج از اوج): خروجی ۰.۸۲ دلار / ورودی ۰.۴۱ دلار
  • V4-Pro (اوج مصرف): خروجی ۱.۶۴ دلار / ورودی ۰.۸۲ دلار
  • V4-Flash (خارج از اوج): خروجی ۰.۲۷ دلار / ورودی ۰.۱۴ دلار
  • V4-Flash (اوج مصرف): خروجی ۰.۵۵ دلار / ورودی ۰.۲۷ دلار

یک نکته خیره‌کننده، قیمت «اصابت حافظه» (Cache Hit) است که به‌طور تهاجمی پایین نگه داشته شده است. برای مدل V4-Pro، این هزینه ۰.۰۰۳ دلار برای هر میلیون توکن در ساعات خلوت و ۰.۰۰۷ دلار در ساعات اوج است. برای V4-Flash، این بازه بین ۰.۰۰۳ تا ۰.۰۰۵ دلار است. این یعنی استفاده از حافظه موقت (Prompt Caching) در مدل Pro، ۱۳۶ برابر ارزان‌تر از زمانی است که حافظه اصابت نکند و مدل مجبور به پردازش مجدد شود.

مقایسه بازار

برای درک بهتر نرخ اوج مصرف V4-Pro (۱.۶۴ دلار)، باید آن را در کنار رقبای اصلی‌اش قرار دهیم. این قیمت به‌طور قابل‌توجهی ارزان‌تر از جایگزین‌های زیر است:

  • Claude Fable 5: ۵۰.۰۰ دلار برای هر میلیون توکن (۳۰ برابر گران‌تر)
  • Claude Opus 4.8: ۲۵.۰۰ دلار (۱۵ برابر گران‌تر)
  • GPT-4o و Claude Sonnet 5: ۱۰.۰۰ دلار (۶ برابر گران‌تر)
  • Gemini 3.1 Pro: حدود ۷.۰۰ دلار (۴ برابر گران‌تر)

عملکرد و زیرساخت

فراتر از قیمت‌گذاری، عرضه رسمی این مدل ویژگی‌های سطح سازمانی را به همراه دارد؛ از جمله ایزولاسیون امنیتی چند-مستأجری (multi-tenant security isolation)، ماسک‌گذاری داده‌ها (data masking) و پشتیبانی از درگاه‌های API میان‌افزاری (middleware API gateway).

این مدل تحت مجوز MIT کاملاً متن‌باز است و دارای یک پنجره متنی (Context Window) استاندارد یک میلیون توکنی است. نکته حیاتی این است که DeepSeek V4 نخستین مدلی است که در مقیاس بزرگ روی سخت‌افزارهای داخلی چین، یعنی تراشه‌های Huawei Ascend 950 آموزش دیده است. شرکت انتظار دارد با ورود این تراشه‌ها به تولید انبوه، قیمت‌ها باز هم کاهش یابد.

توسعه‌دهندگان باید تا تاریخ ۲۴ ژوئیه ادغام‌های نرم‌افزاری خود را به‌روزرسانی کنند. نام‌های قدیمی مدل‌ها شامل deepseek-chat و deepseek-reasoner منسوخ شده‌اند و جای خود را به شناسه‌های deepseek-v4-flash و deepseek-v4-pro داده‌اند.

دسترسی و پیاده‌سازی

برای کسانی که خارج از چین هستند، دسترسی مستقیم به API همچنان یک چالش است. این کار مستلزم داشتن شماره تلفن چینی، روش پرداخت چینی (مانند Alipay یا WeChat Pay) و عبور از مسیریابی‌های غیرقابل‌اعتماد «دیواره آتش بزرگ چین» است.

در این شرایط، دروازه‌های شخص ثالث مانند TunanAPI ظهور کرده‌اند تا نقاط اتصال (endpoints) سازگار با OpenAI ارائه دهند. توسعه‌دهندگان با تغییر تنها یک خط کد — یعنی تنظیم base_url روی https://api.tunanapi.com/v1 — می‌توانند بدون محدودیت‌های منطقه‌ای یا غافلگیری‌های قیمت‌گذاری ساعات اوج، به DeepSeek V4، Qwen 3.7، GLM-4 و MiniMax M3 دسترسی داشته باشند.

استراتژی‌های بهینه‌سازی

برای به حداکثر رساندن صرفه‌جویی، توسعه‌دهندگان باید سه استراتژی اصلی را اتخاذ کنند:

  • بهره‌برداری از مناطق زمانی: پردازش‌های دسته‌ای (batch processing) را در ساعات کاری آمریکا زمان‌بندی کنید تا نرخ Off-Peak تضمین شود.
  • پرامپت‌نویسی پایدار: پرامپت‌های سیستمی خود را ثابت نگه دارید تا نرخ اصابت حافظه ۰.۰۰۳ دلاری به حداکثر برسد.
  • مسیریابی هوشمند: از V4-Flash برای استخراج داده و خلاصه‌سازی استفاده کنید و V4-Pro را برای استدلال‌های پیچیده رزرو کنید؛ ایده‌آل است که ۷۰ درصد درخواست‌ها روی Flash اجرا شوند.

این استراتژی قیمت‌گذاری نشان‌دهنده تغییری در اقتصاد هوش مصنوعی است. DeepSeek دیگر تنها بر سر توانایی خام رقابت نمی‌کند، بلکه در حال بهینه‌سازی برای توزیع جهانی محاسبات و تقاضاست. برای توسعه‌دهنده غربی، «جریمه» ساعات اوج مصرف تنها یک شبح ریاضی است؛ در واقع کف قیمتی برای مدل‌های با استدلال بالا، باز هم پایین‌تر آمده است.

گام بعدی شما

  • اگر از APIهای گران‌قیمت استفاده می‌کنید، هزینه استنتاج خود را با نرخ‌های V4-Pro مقایسه کنید.
  • برای کاهش شدید هزینه‌ها، پرامپت‌های سیستمی خود را ثابت نگه دارید تا نرخ Cache Hit فعال شود.
  • توابع استخراج داده در اپلیکیشن خود را به مدل V4-Flash منتقل کنید.

اما اثر این ارزان‌سازی بر مدل‌های کسب‌وکار شرکت‌های آمریکایی حتی تکان‌دهنده‌تر است؛ در گزارش بعدی بررسی می‌کنیم که چگونه OpenAI ممکن است برای پاسخ به این فشار، قیمت‌های خود را بازنگری کند.

چرا این موضوع مهم است؟

این مدل با تکیه بر سخت‌افزار Huawei Ascend، استقلال سخت‌افزاری چین را اثبات کرده و کف قیمت مدل‌های استدلالی سطح بالا را به‌شدت پایین آورده است. این موضوع باعث می‌شود دسترسی به هوش مصنوعی پیشرفته برای استارتاپ‌های کوچک با بودجه محدود، بسیار تسهیل شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت و شماره تلفن چینی، دسترسی مستقیم به API دشوار است؛ اما توسعه‌دهندگان ایرانی می‌توانند از طریق Gatewayهای واسط مانند TunanAPI با هزینه‌ای بسیار کمتر از GPT-4o از این مدل استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

استراتژی DeepSeek نشان می‌دهد که رقابت در لایه‌ی مدل‌های بنیادی از «جنگ پارامترها» به «جنگ توزیع محاسباتی» تغییر یافته است. آن‌ها با گره زدن قیمت به ساعت محلی، عملاً تقاضای جهانی را به عنوان یک ابزار متعادل‌کننده برای فشار روی سخت‌افزار استفاده می‌کنند. این رویکرد، استنتاج را از یک هزینه‌ی ثابت به یک متغیر پویا تبدیل می‌کند که در آن موقعیت جغرافیایی توسعه‌دهنده، یک مزیت مالی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.