اگر امروز برای استنتاج مدلهای سنگین هزینه میپردازید، مدل توزیعشدهی جدید Runware میتواند صورتحساب شما را بهشدت کاهش دهد. این شرکت ادعا میکند که آیندهی محاسبات هوش مصنوعی نه در غولهای ثابت، بلکه در «پادهای» متحرک نهفته است. روز سهشنبه، این شرکت محصول جدید خود یعنی Sonic Inference Pod را معرفی کرد؛ یک واحد ماژولار که طراحی شده تا ظرفیت استنتاج را بهجای سالها، در عرض چند روز مستقر کند.
طبق اعلام شرکت، این پادها ظرفیت استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — را با سرعتی بیسابقه فراهم میکنند. همانطور که در تحلیلهای پیشین ما دربارهی زیرساختهای مدلهای زبانی اشاره کردیم، تقاضا برای پردازش مدلها بسیار سریعتر از سرعت ساخت مراکز داده رشد میکند. در حالی که غولهایی مثل OpenAI گزارش شده است که روی پروژههای عظیم ۵۰۰ میلیارد دلاری در اوهایو سرمایهگذاری میکنند، صنعت با یک گلوگاه حیاتی روبروست: زمان و منابع عظیمی که برای ساخت سایتهای دائمی متصل به شبکه برق لازم است.
فلویو رادولسکو (Flaviu Radulescu)، همبنیانگذار و مدیرعامل Runware، اشاره میکند که تقاضا برای استنتاج سریعتر از آن چیزی رشد میکند که مراکز داده بتوانند ساخته شوند. او هدف خود را «تأمین انرژی برای هوش جهان» و تبدیل شدن به ستون فقراتی میداند که هر مدل هوش مصنوعی روی آن اجرا شود؛ تا اطمینان حاصل شود که ظرفیت پردازشی بهجای محدود کردن تقاضا، همگام با آن رشد میکند.
تفاوت این دو رویکرد را میتوان به تفاوت ساخت یک آسمانخراش با استقرار ناوگانی از کانتینرهای حملونقل پیشرفته تشبیه کرد؛ دومی انعطافپذیریای دارد که سایتهای ثابت هرگز به آن نمیرسند. به نقل از رادولسکو، محاسبات توزیعشده که در موقعیت نزدیکتری به کاربران نهایی قرار میگیرند تا استنتاج سریعتری ارائه دهند، در بلندمدت برنده خواهند بود. این رویکرد یادآور تلاشهای شرکتهایی است که با تبدیل خانههای مشتریان به گرههای پردازشی، سعی در توزیع زیرساختهای محاسباتی دارند.
به گفتهی مدیرعامل، پادهای Sonic مزایای فنی و عملیاتی متعددی نسبت به ابرهای GPU استاندارد و پلتفرمهای استنتاج بدون سرور (Serverless) دارند:
- استقرار سریع: ساخت و نصب پادها در عرض چند روز امکانپذیر است، در حالی که مراکز داده سنتی به ماهها یا سالها زمان نیاز دارند.
- خنککننده بدون آب: این سیستم از یک مکانیزم خنککننده با چرخه بسته استفاده میکند که مصرف عظیم آب — که در خوشههای هوش مصنوعی معمول است — را بهطور کامل حذف میکند.
- شبکه توزیعشده: هر پاد به عنوان بخشی از یک شبکه واحد عمل میکند. درخواستها به هر جایی که ظرفیت خالی وجود داشته باشد و به کاربر نزدیکتر باشد، هدایت میشوند. اگر یک پاد آفلاین شود، ترافیک بهطور خودکار به واحد دیگر منتقل میشود.
- انعطاف سختافزاری: طراحی ماژولار اجازه میدهد Runware بهسرعت با عرضه سختافزارهای جدید سازگار شود و در هر نقطهای که منبع برق وجود داشته باشد، مستقر گردد.
- بهینه سازی هزینه و کیفیت: Runware ادعا میکند که این پادها میتوانند استنتاجی با کیفیت بالاتر اما با هزینه کمتر نسبت به سایر ابرهای GPU ارائه دهند.

در حال حاضر ۱۰ پاد در سراسر ایالات متحده، اروپا و منطقه آسیا-پاسیفیک مستقر شدهاند. طبق گزارش این شرکت، مشتریانی نظیر Wix و Higgsfield AI در حال حاضر از این خدمات استنتاج استفاده میکنند و ۱۶۰ سایت بالقوه برای استقرار فوری پادها در دسترس است. این توسعه پس از جذب ۵۰ میلیون دلار سرمایه در دور Series A در دسامبر ۲۰۲۴ رخ داد تا زیرساختهای تولید تصویر تقویت شوند. Runware حرکت به سمت پادها را بخشی از مأموریت اصلی خود میبیند: ارائه خدمات استنتاج به شرکتها بهجای ارائه یک محصول تکبعدی.
این چرخش به سمت محاسبات توزیعشده، پیشفرضهای اقتصادی مقیاسپذیری هوش مصنوعی را تغییر میدهد. Runware بهجای درخواست ظرفیت جدید از شبکه برق (که فرآیندی کند است)، از توان موجود استفاده میکند و اصطکاک توسعه را کم میکند. برای کاربر نهایی، این یعنی پاسخهای سریعتر و هزینههای کمتر، زیرا «هوش» بهصورت فیزیکی به محل درخواست نزدیکتر شده است.
از نظر مهندسی، این رویکرد ماژولار ریسکهای سیستمی را میکاهد. در یک مرکز داده سنتی، یک خرابی در سطح کل مرکز میتواند حجم عظیمی از محاسبات را از بین ببرد؛ اما در مدل پادها، یک خرابی تنها بر یک واحد اثر میگذارد. همچنین مشتریانی که به سختافزار اختصاصی نیاز دارند، میتوانند کل یک پاد را برای استفاده شخصی اجاره کنند.
رادولسکو نگران رقبا نیست که بخواهند سیستمهای مشابه بسازند، زیرا کمبود استعدادهای متخصص و ماهیت کند توسعه سختافزار مانع کپیبرداری سریع میشود. او اشاره میکند که یک اشتباه کوچک در طراحی برد مدار (Circuit Board) میتواند ماهها زمان بین بازطراحی، شبیهسازی، ساخت، تست و تحویل تلف کند. چنین کاری نیازمند متخصصانی است که دقیقاً بدانند هر قطعه چه عملکردی دارد و در صورت نبود آن، چه بخشی از سیستم میشکند.
البته ساخت مراکز داده بهدلیل مصرف منابع بحثبرانگیز است. جوامعی که مراکز داده در آنها مستقر شدهاند، پیش از این گزارشهایی از افزایش هزینههای خدمات شهری (Utility Costs) دادهاند. این چالشها در حوادثی نظیر سقوط ناگهانی بارهای عظیم برق در مراکز داده که منجر به هشدارهای جدی برای شبکههای برق شد، بهوضوح دیده شده است. اگرچه پادها مصرف آب و تلفات انتقال انرژی را حذف میکنند، اما همچنان برق زیادی میخورند.
مدیرعامل Runware میپذیرد که اگرچه هدف نهایی استفاده از انرژیهای کاملاً تجدیدپذیر است، اما اولویت فعلی پاسخ به تقاضای سرریز شده برای استنتاج است؛ تقاضایی که او میگوید صرفنظر از اینکه چه کسی تأمینکننده باشد، افزایش خواهد یافت. او استدلال میکند که ساخت استنتاج به این روش، به معنای نیاز کمتر به گسترش شبکههای برق و مصرف کمتر آب برای رسیدن به همان مقدار محاسبات است.
گام بعدی شما
- اگر توسعهدهنده مدلهای تولید تصویر هستید، مدلهای توزیعشده را برای کاهش تأخیر (Latency) بررسی کنید.
- هزینههای استنتاج خود را با ارائهدهندگان GPU Cloud مقایسه کنید تا نقاط بهینه را بیابید.
- روند انتقال دیتاسنترها از مدلهای متمرکز به ماژولار را در گزارشهای سختافزاری دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو