اگر امروز برای پردازش حجم زیادی از دادهها هزینه میپردازید، صورتحساب ماهانه شما بهشدت ارزانتر میشود. طبق گزارش Token Ledger، هزینه استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — برای مدل Qwen3.6 27B در ۵ سپتامبر ۲۰۲۶ از ۳.۶۰ دلار به ۲.۰۰ دلار بهازای هر میلیون توکن سقوط کرد.
این جنگ قیمتها در حالی رخ میدهد که صنعت به سمت مدلهایی با پنجره زمینه (Context Window) — میزان متنی که مدل همزمان در ذهن نگه میدارد، مثل میز کاری که جا برای چند ورق دارد — وسیعتر و کارآمدتر حرکت میکند. برای یک کسبوکار، این اتفاق شبیه به کاهش ناگهانی هزینه برق یک کارخانه است؛ موضوعی که محاسبات سودآوری قابلیتهای جدید را بهطور کلی تغییر میدهد. همانطور که در تحلیلهای قبلی ما دربارهی اقتصاد مدلهای بازمتن اشاره کردیم، کاهش هزینه، محرک اصلی پذیرش انبوه است. این استراتژی کاهش هزینهها در راستای بهینهسازی شدید استنتاجی است که علیبابا پیشتر در مدل Qwen3.8-Flash-Next دنبال میکرد.
بر اساس مستندات منتشر شده، تغییرات قیمتی کلیدی به شرح زیر است:
- Qwen3.6 27B: قیمت پرامپت از ۰.۶۰ به ۰.۳۰ دلار و قیمت استنتاج به ۲.۰۰ دلار رسید.
- MoonshotAI Kimi Latest: هزینه استنتاج به ۱۲.۷۵ دلار کاهش یافت، هرچند قیمت پرامپت به ۲.۵۵ دلار افزایش یافت.
- DeepSeek V4 Pro 0423: کاهش اندکی در هر دو نرخ پرامپت (۰.۱۵ دلار) و استنتاج (۰.۳۰ دلار) داشت.
در همین حال، OpenAI با معرفی GPT-6 Astra سبد محصولات خود را گسترش داد. این مدل دارای پنجره زمینه عظیم ۱.۰۵ میلیون توکن است. قیمت نسخه استاندارد ۱۰ دلار برای پرامپت و ۵۰ دلار برای استنتاج است، اما نسخه Batch این هزینهها را نصف میکند. همچنین شرکت inclusionAI مدل Ling 3.0 Flash Sante را بهصورت کاملاً رایگان عرضه کرد.
به نظر ما، این روند تایید میکند که «رقابت برای رسیدن به کف قیمتی» اکنون به اصلیترین اهرم رقابتی تبدیل شده است. وقتی مدلهای سطح بالایی مثل Qwen قیمتها را تقریباً نصف میکنند، توسعهدهندگان بهجای استفاده از منطقهای پیچیده برای مسیریابی درخواستها، به سمت مدلهای بزرگتر و ارزانتر میروند. این تغییر رویکرد بهویژه در حوزههای تخصصی اثرگذار است، چرا که عملکرد مدلهای سری Qwen در کدنویسی حتی در برابر رقبای قدرتمندی چون Claude Opus 4.6 برتری یافته است.
باید منتظر ماند و دید این کاهش قیمتها چه تاثیری بر پذیرش عاملهای (Agent) خودمختار دارد؛ سیستمهایی که بهدلیل حلقههای تکرار شونده، حجم عظیمی از توکنها را مصرف میکنند.
گام بعدی شما
- هزینههای فعلی API خود را بررسی کنید تا ببینید آیا مهاجرت به Qwen یا نرخهای Batch مدل Astra هزینههای ماهانه شما را کاهش میدهد یا خیر.
- اگر از مدلهای کوچک برای کاهش هزینه استفاده میکردید، کیفیت خروجی مدلهای بزرگتر و ارزانشده را تست کنید.
- استراتژیهای معماری سیستم خود را از Routing پیچیده به سمت مدلهای تکسویه و ارزان تغییر دهید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو