پرش به محتوای اصلی
پرش به محتوای مقاله

۲۶ مدل زبانی جدید در دسترس استارتاپ‌ها از طریق Fireworks AI

·۱۶ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
استارتاپ‌ها می‌توانند ۲۶ مدل باز مایکروسافت را از طریق Fireworks AI روی Foundry دریافت کنند.
استارتاپ‌ها می‌توانند ۲۶ مدل باز مایکروسافت را از طریق Fireworks AI روی Foundry دریافت کنند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل Azure به یک Control Plane برای مدل‌های متفرقه؛ حالا استارتاپ‌ها می‌توانند مدل‌های رقیب (مثل DeepSeek یا Google) را با اعتبارات مایکروسافت و بدون مدیریت سرور اجرا کنند.

اگر برای مدیریت خوشه‌های GPU بودجه یا نیروی متخصص ندارید، حالا می‌توانید مدل‌های عظیم را بدون درگیری با سخت‌افزار به مرحله تولید برسانید. در ۴ اوت ۲۰۲۶، مایکروسافت (Microsoft) یک نقشه استقرار منتشر کرد که Fireworks AI را در Microsoft Foundry ادغام می‌کند تا شرکت‌های هوش مصنوعی بتوانند ۲۶ مدل وزن‌باز (Open Weights) — یعنی مدل‌هایی که «دستور پخت» یا همان پارامترهایشان علناً منتشر شده است — را با اعتبارات Azure اجرا کنند.

این اقدام در حالی صورت می‌گیرد که استارتاپ‌ها برای توازن میان هزینه‌های استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه به خودِ آشپزی و نه دوره آموزش آشپز — و مقیاس‌پذیری در تکاپو هستند. همان‌طور که در تحلیل‌های قبلی ما درباره چالش‌های زیرساختی مدل‌های محلی اشاره کردیم، تمرکز اکنون از لایه نرم‌افزاری به لایه سخت‌افزاری منتقل شده است. مایکروسافت با برون‌سپاری لایه استنتاج به متخصصی مثل Fireworks AI، سعی دارد Azure را به جای یک تأمین‌کننده سخت‌افزار ساده، به یک مرکز کنترل منعطف تبدیل کند.

استراتژی و زمینه

به گزارش منابع صنعتی، این ادغام بخشی از یک رویکرد چند-تأمین‌کننده‌ای است. مایکروسافت در ژوئیه ۲۰۲۶ همکاری خود با Mistral را گسترش داد تا خریداران بخش‌های نظارتی را جذب کند و برخی بارهای کاری Office AI را برای مدیریت هزینه بین ارائه‌دهندگان مختلف تقسیم کرده است. این تغییر رویکرد در راستای استراتژی گسترده‌تر مایکروسافت برای تغییر مدل درآمدی از فروش لایسنس به ارائه خدمات تخصصی است تا نفوذ خود را در لایه‌های عملیاتی مشتریان افزایش دهد.

مایکروسافت با قرار دادن Fireworks در مقابل میزبانی شخصی vLLM یا APIهای بسته، شرکت‌هایی را هدف قرار داده که هوش مصنوعی هسته اصلی محصول آن‌هاست. هدف نهایی این است که این ترکیب، به زیرساخت پیش‌فرض استارتاپ‌های AI-native تبدیل شود.

طبق مستندات منتشر شده، این معماری کاملاً درون اشتراک Azure استارتاپ اجرا می‌شود. این پشته از Azure Container Apps برای فراخوانی نقاط اتصال مدل، Azure Key Vault برای مدیریت اعتبارنامه‌ها و Azure Container Registry برای ذخیره تصاویر استفاده می‌کند.

جزئیات فنی

برای مدیریت رشد، این نقشه استقرار یک رویکرد مقیاس‌پذیری مرحله‌ای را پیشنهاد می‌دهد. از آنجا که استنتاج یکی از بزرگ‌ترین هزینه‌های قابل کنترل است، تیم‌ها با یک نقطه اتصال بدون سرور (Serverless) شروع می‌کنند و تنها در صورت نیاز اجزای زیر را می‌افزایند:

  • Azure API Management: برای مسیریابی ترافیک و اعمال محدودیت‌های نرخ درخواست.
  • Azure Cache for Redis: برای کاهش فراخوانی‌های تکراری و هزینه‌بر استنتاج.
  • Azure Monitor: برای ردیابی تأخیر، نرخ خطا و مصرف توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک که مدل تکه‌تکه می‌خورد.

کاتالوگ مدل‌ها و صورت‌حساب

این فهرست شامل ۲۶ مدل از ارائه‌دهندگانی چون DeepSeek، Moonshot AI، Z.ai، MiniMax، Qwen، گوگل و خط تولید gpt-oss شرکت OpenAI است. نمونه‌های برجسته عبارتند از:

  • DeepSeek V4 Pro: پرچمداری با ۱.۶ تریلیون پارامتر.
  • Kimi K2.5 از Moonshot AI و M2.5 از MiniMax.
  • gpt-oss-120b از OpenAI.

شش مدل از جمله GLM-5.1 و Kimi K2.6 از سیستم پرداخت به ازای هر توکن استفاده می‌کنند. سایر مدل‌ها بر اساس واحدهای توان عملیاتی رزرو شده قیمت‌گذاری می‌شوند. همچنین امکان وارد کردن وزن‌های شخصی یا تنظیم دقیق (Fine-tuning) — شبیه وقتی به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — از طریق لایه‌های سازگارساز لورا (LoRA) در پیش‌نمایش عمومی در دسترس است.

با این حال، مزایای مالی محدودیت‌های شدیدی دارد. اعضای برنامه Microsoft for Startups می‌توانند تا ۱۵۰ هزار دلار اعتبار دریافت کنند، اما این مبلغ فقط برای استفاده از Data Zone Standard (پرداخت به ازای توکن) معتبر است و شامل واحدهای توان عملیاتی رزرو شده نمی‌شود.

محدودیت‌ها و انطباق

استقرار بدون سرور تنها به ۶ منطقه در آمریکا محدود است و خارج از مجوزهای FedRAMP و مرز داده‌های اتحادیه اروپا قرار دارد. همچنین این سرویس اجازه دسترسی به داده‌های کارت‌های پرداخت را ندارد.

مایکروسافت در یادداشت شفافیت خود صراحتاً اعلام کرد که ایمنی یا رفتار مدل‌های ارائه شده توسط Fireworks را ارزیابی نمی‌کند و این مسئولیت بر عهده مشتری است. همچنین باید توجه داشت که پرداخت به ازای توکن برای GLM-5.1 و MiniMax M2.5 از ۷ اوت ۲۰۲۶ منسوخ شده است.

برای شما به عنوان توسعه‌دهنده، این یعنی سد ورود به دنیای مدل‌های عظیم وزن‌باز فرو ریخته است. دیگر نیازی نیست برای رسیدن به تأخیر در سطح تجاری، یک تیم DevOps اختصاصی برای راه‌اندازی vLLM روی خوشه‌های خام GPU داشته باشید.

مایکروسافت در واقع شرط‌بندی کرده است که استارتاپ‌ها در مراحل اولیه به اکوسیستم Azure وابسته شوند تا با سخت‌تر شدن معماری آن‌ها، همه‌چیز طبق قوانین مایکروسافت پیش برود.

گام بعدی شما

  • اگر استارتاپ شما بر پایه مدل‌های باز است، بررسی کنید که آیا مدل‌های gpt-oss یا DeepSeek V4 Pro هزینه‌های استنتاج شما را نسبت به APIهای بسته کاهش می‌دهند یا خیر.
  • برای بهینه‌سازی هزینه، لایه Azure Cache for Redis را در معماری خود بگنجانید تا از پرداخت هزینه برای پاسخ‌های تکراری جلوگیری کنید.
  • محدودیت‌های منطقه‌ای (فقط ۶ منطقه آمریکا) را پیش از مهاجرت داده‌ها بررسی کنید تا با مشکل تأخیر (Latency) مواجه نشوید.

اما نبرد واقعی بر سر هزینه هر توکن تازه آغاز شده است؛ اثر این رقابت بر پذیرش مدل‌های بسته را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار زیرساختی Azure، هزینه ورود به دنیای مدل‌های عظیم را برای شرکت‌های کوچک حذف می‌کند. در نتیجه، رقابت بین مدل‌های وزن‌باز و بسته دیگر بر سر قدرت مدل نیست، بلکه بر سر سهولت استقرار و هزینه استنتاج است.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های API، دسترسی مستقیم استارتاپ‌های ایرانی به این پشته زیرساختی دشوار است، اما مدل‌های وزن‌باز معرفی شده در این لیست (مانند DeepSeek) بهترین گزینه‌ها برای میزبانی شخصی در سرورهای داخلی هستند.

·نگاه ما
تحریریه دات‌هوش

مایکروسافت با این حرکت، نقش خود را از یک فروشنده سخت‌افزار (GPU) به یک ارکستراتور مدل‌ها تغییر می‌دهد. این استراتژی باعث می‌شود استارتاپ‌ها به جای وابستگی به یک مدل خاص، به «لایه توزیع» مایکروسافت وابسته شوند که ریسک جابجایی بین مدل‌های مختلف را برای کاربر به شدت کاهش می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.