تصور کنید مدلهایی با یک تریلیون پارامتر دارید، اما مدیریت سختافزار آنها تمام وقت تیم پژوهشی شما را میبلعد. برای Thinking Machines Lab، این کابوس با یک قرارداد ۶۵ میلیون دلاری به پایان رسید.
طبق اعلام رسمی در ۲۳ سپتامبر ۲۰۲۶، این آزمایشگاه تمام بارهای کاری تولیدی خود را به سیستمهای اختصاصی NVIDIA HGX B200 در زیرساخت Crusoe Cloud منتقل میکند. این تصمیم در حالی اتخاذ شده که بسیاری از آزمایشگاههای هوش مصنوعی در تلاشی سخت برای موازنه میان هزینههای سرسامآور استنتاج (Inference) — که مثل لحظهٔ نهایی آشپزی پس از ماهها آموزش است — و نیاز به پاسخهای سریع و کمتأخیر هستند. این رویکرد یادآور همکاریهای مشابه در صنعت است، مانند قرارداد چندساله Perplexity با Crusoe که بر افزایش سرعت استنتاج مدلها متمرکز بود. برای آزمایشگاهی که مدلهایی با نزدیک به یک تریلیون پارامتر تولید میکند، مدیریت یک پشته سختافزاری خصوصی اغلب باعث حواسپرتی از پژوهشهای هستهای میشود. با برونسپاری زیرساخت، Thinking Machines Lab در واقع سرمایه را با سرعت و مقیاسپذیری معاوضه کرده است.
همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی هزینههای محاسباتی اشاره کردیم، برونسپاری زیرساخت برای مدلهای عظیم، در واقع معاوضهی سرمایه با سرعت و مقیاسپذیری است. این استراتژی در مقیاسهای بزرگتر نیز دیده میشود، همانطور که در قرارداد ۴۵ میلیارد دلاری Anthropic و Nscale برای دسترسی به تراشههای پیشرفته مشاهده کردیم.
Crusoe خود را نخستین ارائهدهنده زیرساخت هوش مصنوعی با یکپارچگی عمودی معرفی میکند. بر اساس مستندات این قرارداد، آنها از مدل «استقرار سفارشی» (Tailored Deployment) استفاده میکنند؛ یعنی یک نقطه اتصال اختصاصی، محکزده و با تضمین سطح خدمات (SLA) که برای توان عملیاتی بالا و هزینه کم در مقیاس وسیع طراحی شده است. این ساختار به آزمایشگاه اجازه میدهد بدون درگیر شدن در مدیریت پشته استنتاج، مدلهای خود را گسترش دهد.
به نقل از این شرکت، برای تضمین سرعت انتقال دادهها و توان عملیاتی بالا در سرویسدهی، از شبکه NVIDIA Quantum-2 InfiniBand استفاده شده است. بارهای کاری اصلی که روی این زیرساخت میزبان میشوند عبارتاند از:
- Inkling: یک مدل ترنسفورمر (Transformer) با معماری ترکیب خبرهها (Mixture-of-Experts یا MoE) — شبیه تیمی از متخصصان که هر سوال را به فرد مناسب میسپارند — با ۹۷۵ میلیارد پارامتر کل (۴۱ میلیارد پارامتر فعال) و پنجرهٔ زمینه ۱ میلیون توکنی. این مدل در ۱۵ ژوئیه ۲۰۲۶ منتشر شد و روی ۴۵ تریلیون توکن از متون، تصاویر، صدا و ویدیو پیشآموزش دیده است.
- Inkling-Small: نسخهای سبکتر با ۲۷۶ میلیارد پارامتر (۱۲ میلیارد فعال) که برای تعادلهای متفاوتی میان عملکرد و تأخیر طراحی شده است.
- GLM 5.2 و 5.3: شامل مدل GLM 5.3 با ۷۵۳ میلیارد پارامتر (با پنجره زمینه ۱ میلیون توکنی) و نسخه سریعتر (Flash) با ۳۲۰ میلیارد پارامتر.
پلتفرم Intelligence Foundry در Crusoe سه سطح سرویس ارائه میدهد تا نیازهای مختلف توسعهدهندگان را پوشش دهد:
۱. استقرار سفارشی (Tailored Deployments): بالاترین سطح بهینهسازی که در آن مشتری مدل را ارائه کرده و الزامات را تعریف میکند و Crusoe بقیه امور فنی را مدیریت میکند.
۲. استنتاج بدون سرور (Serverless Inference): مصرف مدلهای متنباز بر اساس میزان استفاده از طریق یک API کاملاً مدیریتشده.
۳. استقرارهای خودسرویس (Self-Serve Deployments): این سرویس اکنون به صورت عمومی در دسترس است و مدلهایی را اجرا میکند که یا برای توان عملیاتی (Throughput) و یا برای پاسخدهی سریع (Responsiveness) بهینه شدهاند؛ از جمله مدلهایی که از طریق «تنظیم دقیق بدون سرور» شخصیسازی شدهاند.
قلب تپنده این سیستم، موتور MemoryAlloy است که یک ساختار حافظه بومی برای کلاسترهاست. این فناوری با ذخیره دادهها در گرههای مختلف، از محاسبات تکراری در مرحله پیشپُرکردن (Prefill) جلوگیری میکند. این رویکرد با سرمایهگذاریهای اخیر انویدیا و آمازون بر سختافزارهای حافظهمحور برای رفع گلوگاههای استنتاج همسو است. طبق گزارش Crusoe، در بنچمارکهای انجام شده در مقابل vLLM برای اجرای مدل Llama-3.3-70B در یک استقرار چهار گرهای، استفاده از MemoryAlloy به همراه دستهبندی پویا (Dynamic Batching) و رمزگشایی گمانهزن (Speculative Decoding)، زمان رسیدن به نخستین توکن را ۹.۹ برابر سریعتر و توان عملیاتی را ۵ برابر افزایش داده است.
مدل Inkling پیشتر روی سیستمهای NVIDIA GB300 NVL72 پیشآموزش دیده بود و اکنون وزنهای آن در Hugging Face در دسترس است. این مدل شامل یک چکپوینت NVFP4 است که بهطور خاص برای معماری Blackwell (که در این قرارداد جدید استفاده شده) بهینه شده است. همچنین کاربران میتوانند از طریق پلتفرم Tinker، این مدل را با پنجرههای زمینه ۶۴ هزار و ۲۵۶ هزار توکنی شخصیسازی کنند.
این همکاری نشاندهنده چرخش صنعت به سمت زیرساختهای «یکپارچه عمودی» است. دیگر بحث اجاره GPU خام نیست؛ بلکه آزمایشگاهها نقاط اتصال محکزدهای میخرند که در آن تمام لایههای نرمافزاری استنتاج توسط ارائهدهنده مدیریت میشود. این رویکرد به تیمهای پژوهشی اجازه میدهد با محاسبات به جای یک پروژه DevOps، به عنوان یک «سرویس رفاهی» (Utility) برخورد کنند. به قول مایل ات، مدیر زیرساخت ML در Thinking Machines، این سرویس آنها را سریعاً از مرحله ارزیابی به تولید رساند و استانداردهای سختگیرانه سیستمهای داخلی آنها را برآورده کرد. اروان منارد، معاون ارشد مدیریت محصول Crusoe Cloud، افزود که این سرویس زیرساختی مقرونبهصرفه و ابزارهای چرخه حیات مدل را فراهم میکند تا شرکتها بتوانند مدلها را در مقیاس وسیع در محیط تولید اجرا کنند.
این قرارداد ثابت میکند تقاضا برای مدلهای عظیم MoE همچنان بالاست و صنعت هنوز روی تعداد پارامترها برای رسیدن به قابلیتهای پیشرو شرطبندی کرده است، حتی با وجود ظهور مدلهای کوچکتر و تقطیر شده (Distilled). Crusoe اشاره کرد که با پیوستن این آزمایشگاه، درآمد سالانه قراردادی (ARR) بخش استنتاج مدیریتشده، کمتر از یک سال پس از عرضه، به بیش از ۱۰۰ میلیون دلار رسیده است.
در گامهای بعدی، دو شرکت قصد دارند فراتر از سرویسدهی استاندارد، وارد حوزه استنتاج دستهای (Batch Inference) شوند. هدف آنها استفاده از این قابلیت برای تولید دادههای مصنوعی (Synthetic Data) در مقیاس بزرگ است تا یک «چرخ لنگر» (Flywheel) ایجاد کنند که در آن خروجیهای استنتاج مستقیماً به پژوهشهای نسل بعدی مدلها بازگردد.
باید رصد کرد که این تغییر به سمت استنتاج مدیریتشده چگونه بر قیمتگذاری مدلهای بازمتن اثر میگذارد. اگر ارائهدهندگان زیرساخت بتوانند بهطور مستمر افزایش ۵ برابری توان عملیاتی را ارائه دهند، هزینه دسترسی به مدلهای تریلیون-پارامتری برای کاربر نهایی ممکن است به شدت کاهش یابد.
گام بعدی شما
- اگر از مدلهای بازمتن در مقیاس صنعتی استفاده میکنید، بررسی کنید آیا مدلهای MoE با استقرار سفارشی هزینههای شما را نسبت به GPUهای خام کاهش میدهد یا خیر.
- روی بهینهسازیهای لایه حافظه مانند MemoryAlloy برای کاهش تأخیر در مدلهای تریلیونی نظارت کنید.
- اثر افزایش توان عملیاتی ۵ برابری را روی قیمت نهایی دسترسی به مدلهای عظیم در ماههای آینده رصد کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو