اگر امروز برای تولید متنهای طولانی هزینه میپردازید، صورتحساب ماهانه شما به دلیل رقابت جدید غولهای هوش مصنوعی در حال کاهش است. طبق گزارش Token Ledger، هزینه استنتاج (Inference) — که شبیه به هزینهٔ هر وعده غذا در یک آشپزخانه صنعتی است — برای مدل Qwen3.5-122B-A10B در ۱۰ سپتامبر ۲۰۲۶ به ۲.۰۸ دلار برای هر میلیون توکن (Token) — تکههای کوچکی از متن شبیه برشهای کیک — رسید. این روند کاهش قیمتها در خانواده مدلهای Qwen پیشین نیز مشاهده شده بود، جایی که هزینه استنتاج Qwen3.6 27B با کاهش ۴۴ درصدی به ۲ دلار رسید.
این کاهش قیمت در حالی رخ میدهد که شرکتها از مراحل آزمایشی عبور کرده و به سمت استقرار در مقیاس تولید میروند. برای کسبوکارهایی که محتوای حجیم تولید میکنند، حتی کاهش چند سانتی در هر توکن، تأثیر چشمگیری بر سودآوری ماهانه دارد. همانطور که در تحلیل قبلی ما دربارهی اقتصاد مدلهای بازمتن اشاره کردیم، این روند هوش مصنوعی را از یک هزینهٔ تجربیِ لوکس به یک هزینهٔ عملیاتی قابل مدیریت تبدیل میکند. این استراتژی کاهش هزینهها با رویکرد علیبابا در بهینهسازی شدید استنتاج برای معرفی Qwen3.8-Flash-Next کاملاً همسو است.
به گزارش منابع صنعتی، چندین گزینه جدید برای به چالش کشیدن وضعیت موجود وارد بازار شدهاند:
- DeepSeek V4.1 Flash: پرامپت ۰.۱۵ دلار / استنتاج ۰.۶۰ دلار
- Mistral Small 4 (batch): پرامپت ۰.۰۷۵ دلار / استنتاج ۰.۳۰ دلار
- Ministral 3 8B 2512 (batch): پرامپت ۰.۰۷۵ دلار / استنتاج ۰.۰۷۵ دلار
- Mistral Large 3 2512 (batch): پرامپت ۰.۲۵ دلار / استنتاج ۰.۷۵ دلار
در مقابل، برخی بازیگران قیمتها را افزایش دادهاند؛ برای مثال Z.ai هزینه مدل GLM 5.3 Flash را به ۰.۵۰ دلار رساند و MiniMax نیز قیمتهای M2.5 را بالا برد. در این میان، IBM Granite 4.0 Micro با هزینه پرامپت ۰.۰۱۷ دلار، همچنان یکی از ارزانترین گزینههاست.
این نوسانات ثابت میکند که «کف قیمتی» برای هوش مصنوعی همچنان در حال سقوط است. توسعهدهندگان اکنون میتوانند به جای قراردادهای بلندمدت، مدل خود را بر اساس تغییرات روزانه قیمت عوض کنند. عرضه نسخههای Batch توسط Mistral نشاندهنده چرخش به سمت پردازشهای غیرهمزمان برای بهینهسازی بیشتر هزینههاست.
گام بعدی شما
- هزینههای فعلی استنتاج خود را بررسی کنید تا ببینید آیا مهاجرت به مدلهای Batch میتواند هزینههای شما را نصف کند یا خیر.
- مدلهای Flash جدید DeepSeek را برای وظایفی که سرعت و قیمت اولویت دارند، تست کنید.
- استراتژی انتخاب مدل خود را از قراردادهای ثابت به مدلهای پویا و بر اساس قیمت روز تغییر دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو