اگر برای مدیریت خوشههای GPU بودجه یا نیروی متخصص ندارید، حالا میتوانید مدلهای عظیم را بدون درگیری با سختافزار به مرحله تولید برسانید. در ۴ اوت ۲۰۲۶، مایکروسافت (Microsoft) یک نقشه استقرار منتشر کرد که Fireworks AI را در Microsoft Foundry ادغام میکند تا شرکتهای هوش مصنوعی بتوانند ۲۶ مدل وزنباز (Open Weights) — یعنی مدلهایی که «دستور پخت» یا همان پارامترهایشان علناً منتشر شده است — را با اعتبارات Azure اجرا کنند.
این اقدام در حالی صورت میگیرد که استارتاپها برای توازن میان هزینههای استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دوره آموزش آشپز — و مقیاسپذیری در تکاپو هستند. همانطور که در تحلیلهای قبلی ما درباره چالشهای زیرساختی مدلهای محلی اشاره کردیم، تمرکز اکنون از لایه نرمافزاری به لایه سختافزاری منتقل شده است. مایکروسافت با برونسپاری لایه استنتاج به متخصصی مثل Fireworks AI، سعی دارد Azure را به جای یک تأمینکننده سختافزار ساده، به یک مرکز کنترل منعطف تبدیل کند.
استراتژی و زمینه
به گزارش منابع صنعتی، این ادغام بخشی از یک رویکرد چند-تأمینکنندهای است. مایکروسافت در ژوئیه ۲۰۲۶ همکاری خود با Mistral را گسترش داد تا خریداران بخشهای نظارتی را جذب کند و برخی بارهای کاری Office AI را برای مدیریت هزینه بین ارائهدهندگان مختلف تقسیم کرده است. این تغییر رویکرد در راستای استراتژی گستردهتر مایکروسافت برای تغییر مدل درآمدی از فروش لایسنس به ارائه خدمات تخصصی است تا نفوذ خود را در لایههای عملیاتی مشتریان افزایش دهد.
مایکروسافت با قرار دادن Fireworks در مقابل میزبانی شخصی vLLM یا APIهای بسته، شرکتهایی را هدف قرار داده که هوش مصنوعی هسته اصلی محصول آنهاست. هدف نهایی این است که این ترکیب، به زیرساخت پیشفرض استارتاپهای AI-native تبدیل شود.
طبق مستندات منتشر شده، این معماری کاملاً درون اشتراک Azure استارتاپ اجرا میشود. این پشته از Azure Container Apps برای فراخوانی نقاط اتصال مدل، Azure Key Vault برای مدیریت اعتبارنامهها و Azure Container Registry برای ذخیره تصاویر استفاده میکند.
جزئیات فنی
برای مدیریت رشد، این نقشه استقرار یک رویکرد مقیاسپذیری مرحلهای را پیشنهاد میدهد. از آنجا که استنتاج یکی از بزرگترین هزینههای قابل کنترل است، تیمها با یک نقطه اتصال بدون سرور (Serverless) شروع میکنند و تنها در صورت نیاز اجزای زیر را میافزایند:
- Azure API Management: برای مسیریابی ترافیک و اعمال محدودیتهای نرخ درخواست.
- Azure Cache for Redis: برای کاهش فراخوانیهای تکراری و هزینهبر استنتاج.
- Azure Monitor: برای ردیابی تأخیر، نرخ خطا و مصرف توکن (Token) — تکههای کوچکی از متن، شبیه برشهای یک کیک که مدل تکهتکه میخورد.
کاتالوگ مدلها و صورتحساب
این فهرست شامل ۲۶ مدل از ارائهدهندگانی چون DeepSeek، Moonshot AI، Z.ai، MiniMax، Qwen، گوگل و خط تولید gpt-oss شرکت OpenAI است. نمونههای برجسته عبارتند از:
- DeepSeek V4 Pro: پرچمداری با ۱.۶ تریلیون پارامتر.
- Kimi K2.5 از Moonshot AI و M2.5 از MiniMax.
- gpt-oss-120b از OpenAI.
شش مدل از جمله GLM-5.1 و Kimi K2.6 از سیستم پرداخت به ازای هر توکن استفاده میکنند. سایر مدلها بر اساس واحدهای توان عملیاتی رزرو شده قیمتگذاری میشوند. همچنین امکان وارد کردن وزنهای شخصی یا تنظیم دقیق (Fine-tuning) — شبیه وقتی به یک پزشک عمومی تخصص پوست میدهیم تا روی یک حوزه دقیق شود — از طریق لایههای سازگارساز لورا (LoRA) در پیشنمایش عمومی در دسترس است.
با این حال، مزایای مالی محدودیتهای شدیدی دارد. اعضای برنامه Microsoft for Startups میتوانند تا ۱۵۰ هزار دلار اعتبار دریافت کنند، اما این مبلغ فقط برای استفاده از Data Zone Standard (پرداخت به ازای توکن) معتبر است و شامل واحدهای توان عملیاتی رزرو شده نمیشود.
محدودیتها و انطباق
استقرار بدون سرور تنها به ۶ منطقه در آمریکا محدود است و خارج از مجوزهای FedRAMP و مرز دادههای اتحادیه اروپا قرار دارد. همچنین این سرویس اجازه دسترسی به دادههای کارتهای پرداخت را ندارد.
مایکروسافت در یادداشت شفافیت خود صراحتاً اعلام کرد که ایمنی یا رفتار مدلهای ارائه شده توسط Fireworks را ارزیابی نمیکند و این مسئولیت بر عهده مشتری است. همچنین باید توجه داشت که پرداخت به ازای توکن برای GLM-5.1 و MiniMax M2.5 از ۷ اوت ۲۰۲۶ منسوخ شده است.
برای شما به عنوان توسعهدهنده، این یعنی سد ورود به دنیای مدلهای عظیم وزنباز فرو ریخته است. دیگر نیازی نیست برای رسیدن به تأخیر در سطح تجاری، یک تیم DevOps اختصاصی برای راهاندازی vLLM روی خوشههای خام GPU داشته باشید.
مایکروسافت در واقع شرطبندی کرده است که استارتاپها در مراحل اولیه به اکوسیستم Azure وابسته شوند تا با سختتر شدن معماری آنها، همهچیز طبق قوانین مایکروسافت پیش برود.
گام بعدی شما
- اگر استارتاپ شما بر پایه مدلهای باز است، بررسی کنید که آیا مدلهای gpt-oss یا DeepSeek V4 Pro هزینههای استنتاج شما را نسبت به APIهای بسته کاهش میدهند یا خیر.
- برای بهینهسازی هزینه، لایه Azure Cache for Redis را در معماری خود بگنجانید تا از پرداخت هزینه برای پاسخهای تکراری جلوگیری کنید.
- محدودیتهای منطقهای (فقط ۶ منطقه آمریکا) را پیش از مهاجرت دادهها بررسی کنید تا با مشکل تأخیر (Latency) مواجه نشوید.
اما نبرد واقعی بر سر هزینه هر توکن تازه آغاز شده است؛ اثر این رقابت بر پذیرش مدلهای بسته را در گزارش بعدی بررسی خواهیم کرد.




گفتگو