پرش به محتوای اصلی
پرش به محتوای مقاله

استراتژی قیمت‌گذاری Nemotron 3 Ultra در برابر افزایش نرخ Z.ai

·۵ مرداد ۱۴۰۵۱ دقیقه مطالعه۱ بازدید
خلاصه دفتر کل توکن – ۲۷ ژوئیه ۲۰۲۶
خلاصه دفتر کل توکن – ۲۷ ژوئیه ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۳۹ درصدی هزینه استنتاج در یک مدل سطح Ultra؛ این یک تغییر قیمتی تهاجمی است که برخلاف روند افزایش قیمت در برخی مدل‌های رقیب (مانند Z.ai) رخ داده است.

اگر امروز برای پردازش‌های متنی حجیم بودجه تخصیص می‌دهید، هزینه‌های شما در مدل‌های انویدیا به‌طور چشم‌گیری کاهش یافته است. این تغییر قیمت، بازی رقابتی در بازار APIها را به سمتی می‌برد که در آن حجمِ داده، اولویت بیشتری نسبت به حاشیه سود دارد.

طبق گزارش Token Ledger، در ۲۷ ژوئیه ۲۰۲۶، هزینه استنتاج (Inference) — همان لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — در مدل Nemotron 3 Ultra حدود ۳۹٪ ارزان شد. این کاهش قیمت در حالی رخ می‌دهد که تنها دو هفته پیش، هزینه‌های استنتاج این مدل با جهشی ۶۴ درصدی روبرو شده بود و بازار را غافلگیر کرد. به نقل از این گزارش، قیمت تولید متن (Completion) از ۳.۶۰ دلار به ۲.۲۰ دلار و قیمت ورودی (Prompt) از ۰.۶۰ دلار به ۰.۵۰ دلار به‌ازای هر یک میلیون توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — کاهش یافت.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اقتصاد مدل‌های زبانی اشاره کردیم، نوسانات قیمتی در این صنعت اکنون به یک الگوی ثابت تبدیل شده است. در حالی که انویدیا قیمت‌ها را پایین می‌آورد، برخی ارائه‌دهندگان دیگر برای حفظ سود خود، کف قیمتی را بالا برده‌اند.

جزئیات تغییرات قیمتی به شرح زیر است:

  • NVIDIA Nemotron 3 Ultra: قیمت تولید متن به ۲.۲۰ دلار رسید.
  • Z.ai GLM 5.2: هزینه ورودی به ۰.۸۰ دلار و تولید متن به ۲.۵۳ دلار افزایش یافت.
  • MoonshotAI Kimi K2.7 Code: کاهش جزئی هزینه ورودی به ۰.۷۳ دلار.
  • Qwen Qwen3.5-35B-A3B: افزایش اندک هزینه ورودی به ۰.۱۵ دلار.

در کنار این تغییرات، برخی مدل‌ها به‌طور کامل بازنشسته شدند. بر اساس مستندات منتشر شده، مدل GPT-4o-mini Search Preview از شرکت OpenAI و هر دو نسخه Pi و Productivity از مدل Inflection 3 دیگر برای درخواست‌های جدید در دسترس نیستند. کاربرانی که از این نقاط اتصال (Endpoints) استفاده می‌کردند، باید سریعاً به مدل‌های جایگزین مهاجرت کنند تا سرویس آن‌ها مختل نشود.

برای مالکان کسب‌وکار، این یعنی «ارزان‌ترین مدل» برای یک پروژه خاص ممکن است هر هفته تغییر کند. کاهش ۳۹ درصدی قیمت Nemotron 3 Ultra، این مدل را به گزینه‌ای بسیار جذاب‌تر نسبت به GLM 5.2 تبدیل می‌کند.

گام بعدی شما

  • بودجه فعلی APIهای خود را بازبینی کنید تا متوجه شوید کجا می‌توانید هزینه‌ها را کاهش دهید.
  • اگر از مدل‌های بازنشسته Inflection یا OpenAI استفاده می‌کنید، فوراً مسیر انتقال داده‌ها را بررسی کنید.
  • نسبت هزینه به عملکرد Nemotron 3 Ultra را با مدل‌های فعلی خود مقایسه کنید.

اما داستان سخت‌افزاری این کاهش هزینه‌ها حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره‌ی بهینه‌سازی‌های جدید در تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

کاهش شدید قیمت توسط انویدیا، استانداردهای مالی صنعت را تغییر می‌دهد و توسعه‌دهندگان را مجبور به بازبینی مداوم زیرساخت‌های هزینه خود می‌کند. این اقدام بر اساس اعتبار بازار انویدیا، احتمالاً منجر به مهاجرت جمعی کاربران از مدل‌های گران‌تر به Nemotron می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به این مدل‌ها برای توسعه‌دهندگان ایرانی دشوار است و این کاهش قیمت تنها در صورت استفاده از واسطه‌ها اثر می‌کند.

·نگاه ما
تحریریه دات‌هوش

جنگ قیمت‌ها در لایه API نشان می‌دهد که مدل‌های قدرتمند در حال تبدیل شدن به یک کالا (Commodity) هستند. وقتی انویدیا قیمت را ۳۹٪ کاهش می‌دهد، در واقع فشار را بر شرکت‌هایی می‌آورد که مدل‌های متوسط دارند و نمی‌توانند با این مقیاس رقابت کنند. این روند احتمالاً منجر به ادغام یا خروج ارائه‌دهندگان کوچک‌تر از بازار می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.