تصور کنید یک مدل زبانی بزرگ را اجرا میکنید و پاسخها بهجای جاری شدن، با سرعتی باورنکردنی در کسری از ثانیه ظاهر میشوند. هر کاربر اکنون میتواند ۴۴۰۰ توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — را در هر ثانیه از یک رک واحد Cerebras CS-4 دریافت کند.
به نقل از گزارش وبسایت the-decoder.com در ۲۴ اوت ۲۰۲۶، این جهش عملکردی، CS-4 را به سریعترین سیستم در کلاس خود تبدیل کرده است. در حالی که اکثر سختافزارهای هوش مصنوعی روی کوچکتر کردن ترانزیستورها تمرکز دارند، سروسراس روی گسترش ابعاد فیزیکی شرطبندی کرده است. این محصول یک سیستم در مقیاس رک است؛ یعنی بهصورت یک کابینت کامل سرور با محاسبات، برق و سیستم خنککننده یکپارچه عرضه میشود. این رویکرد در واقع تکامل همان معماری ویفری در برابر GPU است که برای حذف گلوگاههای ارتباطی AI طراحی شده است.
همانطور که در تحلیلهای قبلی ما دربارهی معماریهای غیرمتعارف سختافزاری اشاره کردیم، این رویکرد به سیستم اجازه میدهد سختافزار را بسیار شدیدتر از خوشههای سنتی GPU تحت فشار قرار دهد. طبق مستندات فنی، مشخصات CS-4 به شرح زیر است:
- چیپست: بهرهگیری از موتور مقیاس-ویفری WSE-3 با فناوری ۵ نانومتری.
- ظرفیت: سه ویفر در هر رک (در مقایسه با دو ویفر در CS-3).
- حافظه: ۴۴ گیگابایت برای هر ویفر.
- معماری: طراحی ماژولار جدید «Backpack» برای سرعت بخشیدن به مونتاژ.
بر اساس اعلام سروسراس، این شرکت برای رسیدن به دو برابر عملکرد نسل قبلی، سرعت کلاک را از طریق سیستمهای تغذیه قدرتمند و خنککنندگی پیشرفته افزایش داده است. همچنین استنتاج مجزا (Disaggregated Inference) از طریق شرکایی مانند AMD و AWS Trainium معرفی شده است.
این تغییر برای مدیران کسبوکار به معنای حرکت به سمت سختافزارهای تخصصی و عظیم برای استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دورهی آموزش آشپز — با توان عملیاتی بالا است. این تحول در سختافزار، بخشی از رکنهای تبدیل سریع ایدهها به محصول در معماریهای جدید هوش مصنوعی است که اجرای عملیات را از چتهای ساده به سمت کاربردهای پیچیدهتر میبرد. اگرچه تحلیلگران SemiAnalysis معتقدند دستاوردهای شبکهای این سیستم حداقلی است، اما سرعت خام آن برای شرکتهایی مثل OpenAI که از سختافزار سروسراس برای Codex Spark استفاده میکند، حیاتی است.
گام بعدی شما
- بررسی بنچمارکهای فنی در کنفرانس Hot Chips برای تایید ادعاهای سرعت.
- تحلیل هزینه-به-عملکرد CS-4 در مقایسه با H100 انویدیا برای استقرار مدلهای عظیم.
- رصد همکاریهای سروسراس با AWS برای دسترسی ابری به این سختافزار.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ اثر این معماری بر کاهش تأخیر در مدلهای استدلالی را در گزارش بعدی بررسی خواهیم کرد.




گفتگو