اگر امروز برای پردازشهای متنی حجیم بودجه تخصیص میدهید، هزینههای شما در مدلهای انویدیا بهطور چشمگیری کاهش یافته است. این تغییر قیمت، بازی رقابتی در بازار APIها را به سمتی میبرد که در آن حجمِ داده، اولویت بیشتری نسبت به حاشیه سود دارد.
طبق گزارش Token Ledger، در ۲۷ ژوئیه ۲۰۲۶، هزینه استنتاج (Inference) — همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — در مدل Nemotron 3 Ultra حدود ۳۹٪ ارزان شد. این کاهش قیمت در حالی رخ میدهد که تنها دو هفته پیش، هزینههای استنتاج این مدل با جهشی ۶۴ درصدی روبرو شده بود و بازار را غافلگیر کرد. به نقل از این گزارش، قیمت تولید متن (Completion) از ۳.۶۰ دلار به ۲.۲۰ دلار و قیمت ورودی (Prompt) از ۰.۶۰ دلار به ۰.۵۰ دلار بهازای هر یک میلیون توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک طولانی که مدل تکهتکه میخورد — کاهش یافت.
همانطور که در تحلیلهای قبلی ما دربارهی اقتصاد مدلهای زبانی اشاره کردیم، نوسانات قیمتی در این صنعت اکنون به یک الگوی ثابت تبدیل شده است. در حالی که انویدیا قیمتها را پایین میآورد، برخی ارائهدهندگان دیگر برای حفظ سود خود، کف قیمتی را بالا بردهاند.
جزئیات تغییرات قیمتی به شرح زیر است:
- NVIDIA Nemotron 3 Ultra: قیمت تولید متن به ۲.۲۰ دلار رسید.
- Z.ai GLM 5.2: هزینه ورودی به ۰.۸۰ دلار و تولید متن به ۲.۵۳ دلار افزایش یافت.
- MoonshotAI Kimi K2.7 Code: کاهش جزئی هزینه ورودی به ۰.۷۳ دلار.
- Qwen Qwen3.5-35B-A3B: افزایش اندک هزینه ورودی به ۰.۱۵ دلار.
در کنار این تغییرات، برخی مدلها بهطور کامل بازنشسته شدند. بر اساس مستندات منتشر شده، مدل GPT-4o-mini Search Preview از شرکت OpenAI و هر دو نسخه Pi و Productivity از مدل Inflection 3 دیگر برای درخواستهای جدید در دسترس نیستند. کاربرانی که از این نقاط اتصال (Endpoints) استفاده میکردند، باید سریعاً به مدلهای جایگزین مهاجرت کنند تا سرویس آنها مختل نشود.
برای مالکان کسبوکار، این یعنی «ارزانترین مدل» برای یک پروژه خاص ممکن است هر هفته تغییر کند. کاهش ۳۹ درصدی قیمت Nemotron 3 Ultra، این مدل را به گزینهای بسیار جذابتر نسبت به GLM 5.2 تبدیل میکند.
گام بعدی شما
- بودجه فعلی APIهای خود را بازبینی کنید تا متوجه شوید کجا میتوانید هزینهها را کاهش دهید.
- اگر از مدلهای بازنشسته Inflection یا OpenAI استفاده میکنید، فوراً مسیر انتقال دادهها را بررسی کنید.
- نسبت هزینه به عملکرد Nemotron 3 Ultra را با مدلهای فعلی خود مقایسه کنید.
اما داستان سختافزاری این کاهش هزینهها حتی شگفتانگیزتر است؛ به تحلیل ما دربارهی بهینهسازیهای جدید در تراشههای Blackwell مراجعه کنید.




گفتگو