پرش به محتوای اصلی
پرش به محتوای مقاله

قرارداد Crusoe Cloud: ۶۵ میلیون دلار برای استقرار مدل‌های Thinking Machines

·۱ مهر ۱۴۰۵۴ دقیقه مطالعه۳ بازدید
لوگوی شرکت Thinking Machines Lab در کنار نام تجاری Crusoe Cloud، نمادی از قرارداد ۶۵ میلیون دلاری استنتاج ابری.
لوگوی شرکت Thinking Machines Lab در کنار نام تجاری Crusoe Cloud، نمادی از قرارداد ۶۵ میلیون دلاری استنتاج ابری.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال یک مدل تریلیونی بازمتن به زیرساخت مدیریت‌شده با تضمین SLA و استفاده از موتور MemoryAlloy برای حذف محاسبات تکراری پیش‌پُرکردن، که منجر به افزایش ۵ برابری توان عملیاتی شده است.

تصور کنید مدل‌هایی با یک تریلیون پارامتر دارید، اما مدیریت سخت‌افزار آن‌ها تمام وقت تیم پژوهشی شما را می‌بلعد. برای Thinking Machines Lab، این کابوس با یک قرارداد ۶۵ میلیون دلاری به پایان رسید.

طبق اعلام رسمی در ۲۳ سپتامبر ۲۰۲۶، این آزمایشگاه تمام بارهای کاری تولیدی خود را به سیستم‌های اختصاصی NVIDIA HGX B200 در زیرساخت Crusoe Cloud منتقل می‌کند. این تصمیم در حالی اتخاذ شده که بسیاری از آزمایشگاه‌های هوش مصنوعی در تلاشی سخت برای موازنه میان هزینه‌های سرسام‌آور استنتاج (Inference) — که مثل لحظهٔ نهایی آشپزی پس از ماه‌ها آموزش است — و نیاز به پاسخ‌های سریع و کم‌تأخیر هستند. این رویکرد یادآور همکاری‌های مشابه در صنعت است، مانند قرارداد چندساله Perplexity با Crusoe که بر افزایش سرعت استنتاج مدل‌ها متمرکز بود. برای آزمایشگاهی که مدل‌هایی با نزدیک به یک تریلیون پارامتر تولید می‌کند، مدیریت یک پشته سخت‌افزاری خصوصی اغلب باعث حواس‌پرتی از پژوهش‌های هسته‌ای می‌شود. با برون‌سپاری زیرساخت، Thinking Machines Lab در واقع سرمایه را با سرعت و مقیاس‌پذیری معاوضه کرده است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی هزینه‌های محاسباتی اشاره کردیم، برون‌سپاری زیرساخت برای مدل‌های عظیم، در واقع معاوضه‌ی سرمایه با سرعت و مقیاس‌پذیری است. این استراتژی در مقیاس‌های بزرگتر نیز دیده می‌شود، همان‌طور که در قرارداد ۴۵ میلیارد دلاری Anthropic و Nscale برای دسترسی به تراشه‌های پیشرفته مشاهده کردیم.

Crusoe خود را نخستین ارائه‌دهنده زیرساخت هوش مصنوعی با یکپارچگی عمودی معرفی می‌کند. بر اساس مستندات این قرارداد، آن‌ها از مدل «استقرار سفارشی» (Tailored Deployment) استفاده می‌کنند؛ یعنی یک نقطه اتصال اختصاصی، محک‌زده و با تضمین سطح خدمات (SLA) که برای توان عملیاتی بالا و هزینه کم در مقیاس وسیع طراحی شده است. این ساختار به آزمایشگاه اجازه می‌دهد بدون درگیر شدن در مدیریت پشته استنتاج، مدل‌های خود را گسترش دهد.

به نقل از این شرکت، برای تضمین سرعت انتقال داده‌ها و توان عملیاتی بالا در سرویس‌دهی، از شبکه NVIDIA Quantum-2 InfiniBand استفاده شده است. بارهای کاری اصلی که روی این زیرساخت میزبان می‌شوند عبارت‌اند از:

  • Inkling: یک مدل ترنسفورمر (Transformer) با معماری ترکیب خبره‌ها (Mixture-of-Experts یا MoE) — شبیه تیمی از متخصصان که هر سوال را به فرد مناسب می‌سپارند — با ۹۷۵ میلیارد پارامتر کل (۴۱ میلیارد پارامتر فعال) و پنجرهٔ زمینه ۱ میلیون توکنی. این مدل در ۱۵ ژوئیه ۲۰۲۶ منتشر شد و روی ۴۵ تریلیون توکن از متون، تصاویر، صدا و ویدیو پیش‌آموزش دیده است.
  • Inkling-Small: نسخه‌ای سبک‌تر با ۲۷۶ میلیارد پارامتر (۱۲ میلیارد فعال) که برای تعادل‌های متفاوتی میان عملکرد و تأخیر طراحی شده است.
  • GLM 5.2 و 5.3: شامل مدل GLM 5.3 با ۷۵۳ میلیارد پارامتر (با پنجره زمینه ۱ میلیون توکنی) و نسخه سریع‌تر (Flash) با ۳۲۰ میلیارد پارامتر.

پلتفرم Intelligence Foundry در Crusoe سه سطح سرویس ارائه می‌دهد تا نیازهای مختلف توسعه‌دهندگان را پوشش دهد:

۱. استقرار سفارشی (Tailored Deployments): بالاترین سطح بهینه‌سازی که در آن مشتری مدل را ارائه کرده و الزامات را تعریف می‌کند و Crusoe بقیه امور فنی را مدیریت می‌کند.
۲. استنتاج بدون سرور (Serverless Inference): مصرف مدل‌های متن‌باز بر اساس میزان استفاده از طریق یک API کاملاً مدیریت‌شده.
۳. استقرارهای خودسرویس (Self-Serve Deployments): این سرویس اکنون به صورت عمومی در دسترس است و مدل‌هایی را اجرا می‌کند که یا برای توان عملیاتی (Throughput) و یا برای پاسخ‌دهی سریع (Responsiveness) بهینه شده‌اند؛ از جمله مدل‌هایی که از طریق «تنظیم دقیق بدون سرور» شخصی‌سازی شده‌اند.

قلب تپنده این سیستم، موتور MemoryAlloy است که یک ساختار حافظه بومی برای کلاسترهاست. این فناوری با ذخیره داده‌ها در گره‌های مختلف، از محاسبات تکراری در مرحله پیش‌پُرکردن (Prefill) جلوگیری می‌کند. این رویکرد با سرمایه‌گذاری‌های اخیر انویدیا و آمازون بر سخت‌افزارهای حافظه‌محور برای رفع گلوگاه‌های استنتاج هم‌سو است. طبق گزارش Crusoe، در بنچمارک‌های انجام شده در مقابل vLLM برای اجرای مدل Llama-3.3-70B در یک استقرار چهار گره‌ای، استفاده از MemoryAlloy به همراه دسته‌بندی پویا (Dynamic Batching) و رمزگشایی گمانه‌زن (Speculative Decoding)، زمان رسیدن به نخستین توکن را ۹.۹ برابر سریع‌تر و توان عملیاتی را ۵ برابر افزایش داده است.

مدل Inkling پیش‌تر روی سیستم‌های NVIDIA GB300 NVL72 پیش‌آموزش دیده بود و اکنون وزن‌های آن در Hugging Face در دسترس است. این مدل شامل یک چک‌پوینت NVFP4 است که به‌طور خاص برای معماری Blackwell (که در این قرارداد جدید استفاده شده) بهینه شده است. همچنین کاربران می‌توانند از طریق پلتفرم Tinker، این مدل را با پنجره‌های زمینه ۶۴ هزار و ۲۵۶ هزار توکنی شخصی‌سازی کنند.

این همکاری نشان‌دهنده چرخش صنعت به سمت زیرساخت‌های «یکپارچه عمودی» است. دیگر بحث اجاره GPU خام نیست؛ بلکه آزمایشگاه‌ها نقاط اتصال محک‌زده‌ای می‌خرند که در آن تمام لایه‌های نرم‌افزاری استنتاج توسط ارائه‌دهنده مدیریت می‌شود. این رویکرد به تیم‌های پژوهشی اجازه می‌دهد با محاسبات به جای یک پروژه DevOps، به عنوان یک «سرویس رفاهی» (Utility) برخورد کنند. به قول مایل ات، مدیر زیرساخت ML در Thinking Machines، این سرویس آن‌ها را سریعاً از مرحله ارزیابی به تولید رساند و استانداردهای سخت‌گیرانه سیستم‌های داخلی آن‌ها را برآورده کرد. اروان منارد، معاون ارشد مدیریت محصول Crusoe Cloud، افزود که این سرویس زیرساختی مقرون‌به‌صرفه و ابزارهای چرخه حیات مدل را فراهم می‌کند تا شرکت‌ها بتوانند مدل‌ها را در مقیاس وسیع در محیط تولید اجرا کنند.

این قرارداد ثابت می‌کند تقاضا برای مدل‌های عظیم MoE همچنان بالاست و صنعت هنوز روی تعداد پارامترها برای رسیدن به قابلیت‌های پیشرو شرط‌بندی کرده است، حتی با وجود ظهور مدل‌های کوچک‌تر و تقطیر شده (Distilled). Crusoe اشاره کرد که با پیوستن این آزمایشگاه، درآمد سالانه قراردادی (ARR) بخش استنتاج مدیریت‌شده، کمتر از یک سال پس از عرضه، به بیش از ۱۰۰ میلیون دلار رسیده است.

در گام‌های بعدی، دو شرکت قصد دارند فراتر از سرویس‌دهی استاندارد، وارد حوزه استنتاج دسته‌ای (Batch Inference) شوند. هدف آن‌ها استفاده از این قابلیت برای تولید داده‌های مصنوعی (Synthetic Data) در مقیاس بزرگ است تا یک «چرخ لنگر» (Flywheel) ایجاد کنند که در آن خروجی‌های استنتاج مستقیماً به پژوهش‌های نسل بعدی مدل‌ها بازگردد.

باید رصد کرد که این تغییر به سمت استنتاج مدیریت‌شده چگونه بر قیمت‌گذاری مدل‌های بازمتن اثر می‌گذارد. اگر ارائه‌دهندگان زیرساخت بتوانند به‌طور مستمر افزایش ۵ برابری توان عملیاتی را ارائه دهند، هزینه دسترسی به مدل‌های تریلیون-پارامتری برای کاربر نهایی ممکن است به شدت کاهش یابد.

گام بعدی شما

  • اگر از مدل‌های بازمتن در مقیاس صنعتی استفاده می‌کنید، بررسی کنید آیا مدل‌های MoE با استقرار سفارشی هزینه‌های شما را نسبت به GPUهای خام کاهش می‌دهد یا خیر.
  • روی بهینه‌سازی‌های لایه حافظه مانند MemoryAlloy برای کاهش تأخیر در مدل‌های تریلیونی نظارت کنید.
  • اثر افزایش توان عملیاتی ۵ برابری را روی قیمت نهایی دسترسی به مدل‌های عظیم در ماه‌های آینده رصد کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این قرارداد اعتبار مدل‌های بازمتن را در مقیاس صنعتی تثبیت می‌کند و نشان می‌دهد زیرساخت‌های تخصصی می‌توانند هزینه استنتاج مدل‌های عظیم را به شدت کاهش دهند. تخصص Crusoe در یکپارچگی عمودی، مدل توزیع محاسبات را از اجاره سخت‌افزار به خرید «توان عملیاتی» تغییر می‌دهد.

تأثیر برای ایران

به‌دلیل تحریم‌ها و محدودیت‌های API، دسترسی مستقیم به زیرساخت‌های Crusoe برای توسعه‌دهندگان ایرانی دشوار است، اما کاهش هزینه استنتاج مدل‌های باز در سطح جهانی، در نهایت دسترسی به مدل‌های تریلیونی را برای کاربران ایرانی ارزان‌تر می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر مدل‌های تریلیونی در حالی که موج مدل‌های کوچک و تقطیرشده (Distilled) بازار را گرفته، نشان می‌دهد که برای رسیدن به «استدلال پیشرو»، هنوز راه میان‌بری جز افزایش مقیاس پارامترها وجود ندارد. جالب اینجاست که مدل‌های بازمتن اکنون به جای میزبانی شخصی، به سمت «سرویس‌های مدیریت‌شده با تضمین SLA» می‌روند تا بتوانند با سرعت شرکت‌های بسته مثل OpenAI رقابت کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.