پرش به محتوای اصلی
پرش به محتوای مقاله

هزینه استنتاج مدل Nemotron 3 Ultra انویدیا ۶۴٪ افزایش یافت

·۲۴ تیر ۱۴۰۵۲ دقیقه مطالعه
خلاصه دفتر کل توکن – ۱۵ ژوئیه ۲۰۲۶
خلاصه دفتر کل توکن – ۱۵ ژوئیه ۲۰۲۶
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شکل‌گیری صریح استراتژی لایه‌بندی قیمتی؛ جایی که قیمت مدل‌های Ultra برای تأمین بودجه جنگ قیمتی مدل‌های SLM بالا می‌رود.

اگر همین حالا بودجه‌ای برای استقرار مدل‌های زبانی در مقیاس سازمانی دارید، باید برای یک شوک قیمتی آماده شوید. طبق گزارش Token Ledger در ۱۵ ژوئیه ۲۰۲۶، هزینه استنتاج (Inference) — که همان لحظه‌ی تولید جواب توسط مدل و شبیه به هزینه هر وعده در یک آشپزخانه صنعتی است — برای مدل NVIDIA Nemotron 3 Ultra ۶۴٪ افزایش یافت.

این جهش قیمتی در حالی رخ می‌دهد که این مدل پیش از این به دلیل توانمندی‌های استدلالی برابری با مدل‌های بسته مورد توجه قرار گرفته بود.

به نقل از این گزارش، قیمت توکن‌های خروجی در این مدل از ۲.۲۰ دلار به ۳.۶۰ دلار برای هر میلیون توکن رسید. همچنین هزینه پرامپت‌ها (Prompt) با ۱۰ سنت افزایش، به ۰.۶۰ دلار در هر میلیون توکن رسید.

همان‌طور که در تحلیل قبلی ما درباره‌ی نوسانات هزینه در مدل‌های لبه اشاره کردیم، این تغییرات زمانی رخ می‌دهد که شرکت‌ها در حال گسترش حجم تولید متون طولانی هستند. بازار اکنون به شدت قطبی شده است؛ از یک سو مدل‌های سطح بالا گران می‌شوند و از سوی دیگر، نسخه‌های «فلش» یا «میکرو» قیمت‌ها را به کف می‌رسانند.

طبق داده‌های منتشر شده، چندین ارائه‌دهنده دیگر نیز در همان تاریخ قیمت‌ها را بالا بردند:

  • Z.ai GLM 5: نرخ خروجی از ۱.۹۲ به ۳.۱۵ دلار رسید.
  • MoonshotAI Kimi K2.5: هزینه خروجی از ۲.۰۳ به ۲.۸۵ دلار افزایش یافت.
  • Qwen Qwen3.5 397B A17B: قیمت پرامپت به ۰.۴۵ و خروجی به ۳.۰۰ دلار رسید.

در مقابل، برخی مدل‌ها روند کاهشی داشتند. Google Gemma 4 26B A4B قیمت خروجی خود را از ۰.۳۳ به ۰.۳۰ دلار کاهش داد. همچنین Z.ai GLM 5.2 هر دو هزینه ورودی و خروجی را کمی پایین آورد. در حال حاضر ارزان‌ترین گزینه‌ها inclusionAI Ling-2.6-flash و IBM Granite 4.0 Micro هستند که قیمت پرامپت آن‌ها از ۰.۰۱ دلار شروع می‌شود.

این شکاف قیمتی نشان‌دهنده یک استراتژی «لایه‌بندی» است. ارائه‌دهندگان احتمالاً حاشیه سود مدل‌های پرچمدار (Ultra) را بالا می‌برند تا جنگ قیمتی شدید در دسته‌بندی مدل زبانی کوچک (SLM) — که شبیه به آموزش یک متخصص در یک حوزه بسیار محدود است — را تأمین کنند. برای کاربر تجاری، این یعنی هزینه خروجی‌های استدلالی پیچیده دیگر با هزینه اتوماسیون‌های ساده یکی نیست.

کاربران نسخه Sao10K Llama 3.1 70B Hanami x1 باید فوراً مدل خود را جایگزین کنند، زیرا این مدل به‌طور کامل از فهرست حذف شده است.

گام بعدی شما

  • تمام نقاط اتصال (Endpoints) مدل‌های خود را بررسی کنید تا از هزینه‌های پیش‌بینی‌نشده در این فصل جلوگیری کنید.
  • برای وظایف ساده، مهاجرت از مدل‌های Ultra به مدل‌های Flash یا Micro را ارزیابی کنید.
  • بودجه استنتاج ماهانه خود را بر اساس نرخ‌های جدید ۱۵ ژوئیه به‌روزرسانی نمایید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این نوسانات قیمتی مستقیماً بر سودآوری استارتاپ‌های مبتنی بر AI اثر می‌گذارد. طبق استانداردهای Token Ledger، عدم پیش‌بینی این جهش‌ها می‌تواند هزینه‌های عملیاتی را در یک شب تا ۶۰٪ افزایش دهد.

تأثیر برای ایران

به‌دلیل تلاطم نرخ ارز، افزایش ۶۴ درصدی هزینه توکن‌ها برای توسعه‌دهندگان ایرانی که با بودجه‌های محدود کار می‌کنند، ضربه‌ای جدی است و مهاجرت به مدل‌های ارزان‌تر مانند Gemma 4 را ضروری می‌کند.

·نگاه ما
تحریریه دات‌هوش

جداسازی قیمت مدل‌های الاستیک از مدل‌های استدلالی نشان می‌دهد که عصر «یک مدل برای همه کارها» به پایان رسیده است. ارائه‌دهندگان در حال تبدیل مدل‌های Ultra به کالاهای لوکس (Premium) هستند تا زیرساخت‌های مدل‌های کوچک‌تر را رایگان یا بسیار ارزان کنند. این رویکرد باعث می‌شود شرکت‌ها مجبور شوند معماری‌های ترکیبی بسازند که در آن یک مدل کوچک روتینگ را انجام دهد و تنها در موارد ضروری از مدل گران‌قیمت استفاده شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.