پرش به محتوای اصلی
پرش به محتوای مقاله

هزینه استنتاج Qwen3.6 27B با کاهش ۴۴ درصدی به ۲ دلار رسید

·۱۴ شهریور ۱۴۰۵۲ دقیقه مطالعه
خلاصه دفتر کل توکن – ۲۰۲۶/۰۹/۰۵
خلاصه دفتر کل توکن – ۲۰۲۶/۰۹/۰۵
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

سقوط ۴۴ درصدی قیمت استنتاج در یک مدل سطح بالا (Tier-1)؛ این اولین بار است که کاهش قیمت در این مقیاس، هم‌زمان با معرفی مدل‌هایی با پنجره زمینه میلیونی رخ می‌دهد.

اگر امروز برای پردازش حجم زیادی از داده‌ها هزینه می‌پردازید، صورت‌حساب ماهانه شما به‌شدت ارزان‌تر می‌شود. طبق گزارش Token Ledger، هزینه استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره‌ی آموزش آشپز — برای مدل Qwen3.6 27B در ۵ سپتامبر ۲۰۲۶ از ۳.۶۰ دلار به ۲.۰۰ دلار به‌ازای هر میلیون توکن سقوط کرد.

این جنگ قیمت‌ها در حالی رخ می‌دهد که صنعت به سمت مدل‌هایی با پنجره زمینه (Context Window) — میزان متنی که مدل هم‌زمان در ذهن نگه می‌دارد، مثل میز کاری که جا برای چند ورق دارد — وسیع‌تر و کارآمدتر حرکت می‌کند. برای یک کسب‌وکار، این اتفاق شبیه به کاهش ناگهانی هزینه برق یک کارخانه است؛ موضوعی که محاسبات سودآوری قابلیت‌های جدید را به‌طور کلی تغییر می‌دهد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اقتصاد مدل‌های بازمتن اشاره کردیم، کاهش هزینه، محرک اصلی پذیرش انبوه است. این استراتژی کاهش هزینه‌ها در راستای بهینه‌سازی شدید استنتاجی است که علی‌بابا پیش‌تر در مدل Qwen3.8-Flash-Next دنبال می‌کرد.

بر اساس مستندات منتشر شده، تغییرات قیمتی کلیدی به شرح زیر است:

  • Qwen3.6 27B: قیمت پرامپت از ۰.۶۰ به ۰.۳۰ دلار و قیمت استنتاج به ۲.۰۰ دلار رسید.
  • MoonshotAI Kimi Latest: هزینه استنتاج به ۱۲.۷۵ دلار کاهش یافت، هرچند قیمت پرامپت به ۲.۵۵ دلار افزایش یافت.
  • DeepSeek V4 Pro 0423: کاهش اندکی در هر دو نرخ پرامپت (۰.۱۵ دلار) و استنتاج (۰.۳۰ دلار) داشت.

در همین حال، OpenAI با معرفی GPT-6 Astra سبد محصولات خود را گسترش داد. این مدل دارای پنجره زمینه عظیم ۱.۰۵ میلیون توکن است. قیمت نسخه استاندارد ۱۰ دلار برای پرامپت و ۵۰ دلار برای استنتاج است، اما نسخه Batch این هزینه‌ها را نصف می‌کند. همچنین شرکت inclusionAI مدل Ling 3.0 Flash Sante را به‌صورت کاملاً رایگان عرضه کرد.

به نظر ما، این روند تایید می‌کند که «رقابت برای رسیدن به کف قیمتی» اکنون به اصلی‌ترین اهرم رقابتی تبدیل شده است. وقتی مدل‌های سطح بالایی مثل Qwen قیمت‌ها را تقریباً نصف می‌کنند، توسعه‌دهندگان به‌جای استفاده از منطق‌های پیچیده برای مسیریابی درخواست‌ها، به سمت مدل‌های بزرگ‌تر و ارزان‌تر می‌روند. این تغییر رویکرد به‌ویژه در حوزه‌های تخصصی اثرگذار است، چرا که عملکرد مدل‌های سری Qwen در کدنویسی حتی در برابر رقبای قدرتمندی چون Claude Opus 4.6 برتری یافته است.

باید منتظر ماند و دید این کاهش قیمت‌ها چه تاثیری بر پذیرش عامل‌های (Agent) خودمختار دارد؛ سیستم‌هایی که به‌دلیل حلقه‌های تکرار شونده، حجم عظیمی از توکن‌ها را مصرف می‌کنند.

گام بعدی شما

  • هزینه‌های فعلی API خود را بررسی کنید تا ببینید آیا مهاجرت به Qwen یا نرخ‌های Batch مدل Astra هزینه‌های ماهانه شما را کاهش می‌دهد یا خیر.
  • اگر از مدل‌های کوچک برای کاهش هزینه استفاده می‌کردید، کیفیت خروجی مدل‌های بزرگ‌تر و ارزان‌شده را تست کنید.
  • استراتژی‌های معماری سیستم خود را از Routing پیچیده به سمت مدل‌های تک‌سویه و ارزان تغییر دهید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر قیمت‌ها بر اساس اعتبار گزارش‌های Token Ledger، دسترسی به مدل‌های قدرتمند را برای استارتاپ‌های کوچک تسهیل می‌کند. در نتیجه، موانع مالی برای پیاده‌سازی سیستم‌های عامل‌محور پیچیده به‌شدت کاهش می‌یابد.

تأثیر برای ایران

کاهش هزینه‌های API برای توسعه‌دهندگان ایرانی که از طریق واسط‌ها به این مدل‌ها دسترسی دارند، جذاب است؛ اما نوسانات ارزی ممکن است اثر این کاهش قیمت‌های دلاری را در بازار داخلی خنثی کند.

·نگاه ما
تحریریه دات‌هوش

کاهش قیمت در این سطح نشان می‌دهد که بهینه‌سازی‌های نرم‌افزاری در لایه استنتاج به نقطه‌ای رسیده که سخت‌افزار دیگر گلوگاه قیمت نیست. این اتفاق باعث می‌شود مدل‌های «متوسط» مثل 27B به استانداردی برای اکثر کاربردهای تجاری تبدیل شوند و نیاز به مدل‌های بسیار کوچک (SLM) برای صرفه‌جویی در هزینه را از بین ببرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.