اگر امروز برای استفاده از مدلهای برتر هزینه پرداخت میکنید، احتمالاً بهزودی شاهد کاهش چشمگیر صورتحسابهای خود خواهید بود. رقابت در دنیای هوش مصنوعی دیگر بر سر «باهوشترین مدل» نیست، بلکه بر سر «ارزانترین اجرای مدل» میچرخد. این بازنشانی گسترده در هزینههای تولید هوش مصنوعی در ۲۸ جولای ۲۰۲۶ تحریک شد، زمانی که سه اقدام مجزا توسط مایکروسافت و آنتروپیک، مبنای رقابتی بازار را جابهجا کرد.
این تغییر مسیر درست زمانی اتفاق افتاد که سازمانها با هزینههای سرسامآور فراخوانی APIهای پیشرو دستوپنجه نرم میکردند. در حالی که ما پیشتر ردیابی میکردیم چگونه تغییرات شخصیتی در مدلهایی مانند Claude Opus 5 بر مهاجرت کاربران تأثیر میگذارد، اکنون گفتگو از «حس و حال» (Vibes) مدلها فراتر رفته و مستقیماً به سود و زیان و کفِ خط سود شرکتها رسیده است.
تصور کنید قدرتمندترین ابزارها دیگر گرانترین نباشند. مرکز ثقل صنعت به سمت استقرار بهصرفه و «عملکرد به ازای هر دلار» در طیف متنوعی از گردشهای کاری حرکت میکند. در همین راستا، شرکت Moonshot AI با انتشار مدل Kimi K3 به عنوان یک مدل وزنهای باز (Open Weights) در پلتفرم HuggingFace، حصار مدلهای بسته را شکست. این اقدام در واقع انتشار «دستور پخت» مدل به جای ارائه غذای آماده است و در ادامه تغییر استراتژی رقابتی چین برای به دست آوردن قدرت خالص در برابر مدلهای آمریکایی قرار دارد.
این اولین مدل کلاس 3T است که در دسترس عموم قرار گرفته و از معماری ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبکهای از سلولهای کوچک، شبیه نقشهٔ مترو، که تنها بخشهای مورد نیاز برای هر پاسخ فعال میشوند — با ۲.۸ تریلیون پارامتر بهره میبرد که در هر لحظه ۱۰۴ میلیارد پارامتر آن فعال است.
جزئیات فنی Kimi K3 به شرح زیر است:
- معماری: استفاده از Kimi Delta Attention (KDA) و Attention Residuals (AttnRes)، همراه با ۸۹۶ خبره (که از آنها ۱۶ خبره برای هر توکن فعال میشوند).
- قابلیت چندوجهی (Multimodal) — مدلی که مثل انسان همزمان متن، عکس و ویدیو را میفهمد — که توسط رمزگذار بینایی MoonViT-V2 پشتیبانی میشود.
- پنجره زمینه (Context Window) عظیم: ظرفیت ۱,۰۴۸,۵۷۶ توکن (Token) — تکههای کوچکی از متن که مدل تکهتکه میخورد — معادل تقریباً یک میلیون توکن.
- بنچمارکهای سطح بالا: کسب امتیاز ۸۸.۳ در Terminal-Bench 2.1، امتیاز ۹۱.۲ در BrowseComp و امتیاز ۹۴.۵ در MCPMark-Verified.
این اعداد K3 را با مدلهای بستهای سطح اول مثل Claude Fable 5 و GPT-5.6 رقابتی میکند. برای توسعهدهندگان، این یعنی توانایی میزبانی شخصی (Self-hosting) مدلی که در برابر آزمایشگاههای پیشرو قد راست میکند؛ امری که معادلات حریم خصوصی دادهها و وابستگی به فروشنده (Vendor Lock-in) را یکشبه تغییر میدهد.
به طور همزمان، Anthropic با معرفی Claude Opus 5 استراتژی «مدل کاربردی روزمره» (Daily Driver) را پیش گرفت. این مدل میانرده با هدف پوشش ۹۰٪ کارهای دانشی طراحی شده و در حالی که عملکردی مشابه مدلهای پرچمدار دارد، نیمی از هزینه Fable 5 را میطلبد.
بررسی استراتژی لایهبندیشده آنتروپیک نشان میدهد:
- عملکرد: کسب امتیاز ۴۳.۳٪ در Frontier-Bench v0.1 (کدنویسی ترمینال)، که بیش از دو برابر امتیاز ۱۸.۷٪ مدل Opus 4.8 است و حتی امتیاز ۳۳.۷٪ مدل Fable 5 را شکست میدهد.
- قیمتگذاری: تعیین قیمت ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای خروجی، که در واقع برابری قیمت با مدل Opus 4.8 را حفظ کرده است.
- اکوسیستم: ایجاد یک خانواده لایهبندیشده شامل Fable 5 (باهوشترین/گرانترین)، Opus 5 (بهترین برای ۹۰٪ کارها)، Sonnet 5 (برای استقرار در مقیاس وسیع) و Haiku 4.5 (برای عاملهای فرعی یا Sub-agents).
مایکروسافت تهاجمیترین گام زیرساختی را برداشت و سرویسهای Bing، OneDrive و PowerPoint را بهطور کامل به خانواده مدلهای داخلی خود یعنی MAI منتقل کرد. این اقدام دیگر یک آزمایش نیست، بلکه یک تصمیم زیرساختی در مقیاس کامل برای ایجاد یک حصار از بهرهوری هزینهای است.
میزان کاهش هزینه GPU در سرویسهای مایکروسافت به شرح زیر است:
- بینگ (Bing): ۸۷٪ کاهش هزینه
- واندرایو (OneDrive): ۸۴٪ کاهش هزینه
- پاورپوینت (PowerPoint): ۸۹٪ کاهش هزینه
این تغییرات نشاندهنده بلوغ بازار است. برنده نهایی دیگر کسی نیست که صرفاً رکورد یک بنچمارک را بزند، بلکه کسی است که بیشترین کارایی را به ازای هر دلار ارائه دهد. برای خواننده، این بدان معناست که دوران وابستگی گرانقیمت به فروشندگان در حال پایان است.
داریو آمودی، مدیرعامل Anthropic، با استدلال علیه ممنوعیت مدلهای باز-وزن، از این روند حمایت کرد. او ادعا میکند این مدلها برای تحقیقات ایمنی، ایجاد فشار رقابتی و انعطافپذیری در استقرار ضروری هستند؛ قابلیتهایی که جهانهای مبتنی بر «فقط مدلهای بسته» نمیتوانند بازسازی کنند.
گام بعدی شما
- هنگام بررسی پشته مدلهای (Model Stack) خود در این فصل، بهجای تمرکز صرف بر امتیازات، روی «هزینه کل مالکیت» (TCO) تمرکز کنید.
- بررسی کنید آیا مدلهای مورد نیاز شما قابلیت اجرا روی دستگاه (On-device)، میزبانی شخصی یا دسترسی از طریق API را دارند یا خیر.
- واکنش سایر غولهای ابری (Hyperscalers) به کاهش ۸۹ درصدی هزینه مایکروسافت را زیر نظر بگیرید، زیرا آنها برای ساخت خانوادههای مدل داخلی خود در حال تکاپو هستند.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو