پرش به محتوای اصلی
پرش به محتوای مقاله

Cerebras: افزایش ۵ برابری توان عملیاتی استنتاج با معماری تفکیک‌شده

·۱۰ مهر ۱۴۰۵۵ دقیقه مطالعه
افزایش ۵ برابری توان عملیاتی استنتاج سربراس با جداسازی منابع
افزایش ۵ برابری توان عملیاتی استنتاج سربراس با جداسازی منابع
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم «جداسازی ناهمگن» که در آن مراحل پیش‌پُرکردن و رمزگشایی نه تنها از نظر منطقی، بلکه روی سخت‌افزارهای کاملاً متفاوت (مانند ترکیب Trainium و WSE) اجرا می‌شوند تا توان عملیاتی ۵ برابر شود.

۵ برابر. این عدد، میزان افزایش توان عملیاتی استنتاج است که اکنون با تفکیک دو مرحله اصلی تولید متن در مدل‌های زبانی بزرگ به مجموعه‌های سخت‌افزاری مجزا، امکان‌پذیر شده است. طبق اعلام Cerebras Systems در ۱ اکتبر ۲۰۲۶، این تکنیک «جداسازی» (Disaggregation) اجازه می‌دهد ظرفیت سیستم به‌شدت افزایش یابد، بدون آنکه سرعت تولید توکن‌ها کاهش یابد یا نیاز به استقرار سیستم‌های بیشتر باشد.

این جزئیات در پست وبلاگی با عنوان «استنتاج جداسازی‌شده از پایه» توسط آیزاک تای و ژن‌وی گائو منتشر شد. این نوشتار آغازگر یک سری مقالات برنامه‌ریزی‌شده است که برای خوانندگانی طراحی شده که شنیده‌اند مرحله پیش‌پُرکردن «محاسبات‌محور» و مرحله رمزگشایی «حافظه‌محور» است، اما می‌خواهند مکانیسم‌های زیربنایی نحوه تعادل میان محاسبات ریاضی و جابه‌جایی داده‌ها در شتاب‌دهنده‌ها را به‌طور دقیق درک کنند.

استنتاج در مدل‌های مدرن با یک تضاد سخت‌افزاری بنیادین دست‌وپنجه نرم می‌کند. فرآیند با پیش‌پُرکردن (Prefill) آغاز می‌شود؛ جایی که مدل تمام پرامپت ورودی را به‌صورت موازی پردازش می‌کند و این یک وظیفه محاسبات‌محور (Compute-bound) است. در دنیای واقعی، پرامپت‌ها می‌توانند هزاران یا حتی صدها هزار توکن (Token) داشته باشند. پس از آن، مرحله رمزگشایی (Decoding) آغاز می‌شود که در آن توکن‌ها یکی‌یکی تولید می‌شوند؛ وظیفه‌ای حافظه‌محور (Memory-bound) که برای جلوگیری از محاسبه مجدد توکن‌های قبلی، به KV Cache متکی است. این چالش ساختاری دقیقاً همان چیزی است که در تحلیل ما پیرامون علت ناکارآمدی سخت‌افزاری و اتلاف توان پردازشی در مدل‌های زبانی بررسی شده بود.

درک شدت محاسباتی

به نقل از این گزارش، برای تبیین این تضاد از مفهوم «شدت محاسباتی» (Arithmetic Intensity) استفاده شده است؛ یعنی تعداد عملیات اعشاری (FLOPs) تقسیم بر تعداد بایت‌های منتقل‌شده بین حافظه و واحدهای پردازشی. دو مثال متضاد در این زمینه ارائه شده است:

  • جمع ماتریسی: افزودن دو ماتریس برای هر ۶ بایت جابه‌جا شده، تنها ۱ عملیات اعشاری انجام می‌دهد (شدت ۰.۱۶۷). این نسبت فارغ از اندازه ماتریس ثابت است.
  • ضرب ماتریسی: هر مقدار خروجی از ترکیب یک سطر کامل از یک ورودی و یک ستون کامل از ورودی دیگر ساخته می‌شود. چون مقادیر بارگذاری‌شده در خروجی‌های متعددی اثر می‌گذارند، شدت محاسباتی با افزایش اندازه ورودی، رشد می‌کند.

استنتاج در واقع زنجیره‌ای از این ضرب‌های ماتریسی بین وزن‌های ثابت مدل و توکن‌های ورودی است. همان‌طور که در تحلیل قبلی ما درباره‌ی زیرساخت‌های سخت‌افزاری مدل‌های بنیادی اشاره کردیم، هر دو مرحله پیش‌پُرکردن و رمزگشایی باید تمام وزن‌های مدل — که احتمالاً صدها گیگابایت یا ترابایت هستند — را برای هر توکن تولیدشده به واحدهای پردازشی منتقل کنند. با این حال، در حالی که جابه‌جایی حافظه تقریباً ثابت می‌ماند، شدت محاسباتی پس از مرحله پیش‌پُرکردن به‌شدت افت می‌کند. به همین دلیل است که افزودن ظرفیت محاسباتی خام، لزوماً باعث سریع‌تر رسیدن توکن‌ها در مرحله رمزگشایی نمی‌شود.

وقتی این دو مرحله سخت‌افزار مشترکی داشته باشند، وظایف سنگین پیش‌پُرکردن اغلب باعث توقف درخواست‌های فعال رمزگشایی می‌شوند. این وضعیت زمان‌بندهای سیستم را مجبور می‌کند بین «زمان تا نخستین توکن» (Time-to-first-token) برای کاربران جدید و «جریان روان توکن‌ها» برای کاربران فعلی، یک موازنه سخت و مجموع-صفر انجام دهند. دسته‌بندی (Batching) می‌تواند توان عملیاتی کل را با به اشتراک گذاشتن بار خواندن وزن‌های مدل افزایش دهد، اما دسته‌های بزرگ‌تر می‌توانند باعث شوند هر گام رمزگشایی طولانی‌تر شود و در نتیجه تجربه کاربر فردی کند گردد.

مکانیسم جداسازی

شرکت Cerebras یک الگوی طراحی سیستمی پیشنهاد می‌دهد که پیش‌پُرکردن و رمزگشایی را در مجموعه‌های سخت‌افزاری مجزا اجرا می‌کند. این تفکیک به اپراتورها اجازه می‌دهد:

  • سخت‌افزار و سیاست‌های دسته‌بندی را برای هر مرحله به‌طور مستقل تخصیص دهند.
  • برای پیش‌پُرکردن، اولویت را بر کاهش تأخیر (Latency) بگذارند تا به اهداف سخت‌گیرانه «زمان تا نخستین توکن» برسند.
  • یک مجموعه بزرگ‌تر و با زمان‌بندی متراکم‌تر را به رمزگشایی اختصاص دهند تا جریان توکن‌ها روان باشد.
  • هر مجموعه را بر اساس تقاضای واقعی به‌طور جداگانه مقیاس‌دهی کنند.

این معماری یک نیاز جدید ایجاد می‌کند: KV Cache مربوط به هر درخواست باید پیش از ادامه تولید، از مجموعه پیش‌پُرکردن به مجموعه رمزگشایی منتقل شود. در حالی که وزن‌های مدل در هر دو مجموعه بارگذاری شده‌اند، این تحویلِ حافظه باعث ایجاد سربار شبکه و هماهنگی می‌شود.

Cerebras اشاره می‌کند که این تأخیر اضافی به این بستگی دارد که حافظه بین ماشین‌های هم‌جوار (Colocated) جابه‌جا شود یا بین مناطق مختلف. علاوه بر این، اگر ظرفیت‌ها با تقاضا همخوانی نداشته باشند، ممکن است هر یک از مجموعه‌ها بیکار بمانند. با این حال، شرکت استدلال می‌کند که جداسازی در مقیاس‌های بزرگ بسیار جذاب است، زیرا دستاوردهای حاصل از سایزبندی و زمان‌بندی مستقل، هزینه‌های انتقال و عملیاتی را می‌پوشاند.

سخت‌افزار ناهمگن و بنچمارک‌ها

شرکت Cerebras به‌طور خاص روی «جداسازی ناهمگن» تأکید دارد که در آن انواع مختلف تراشه‌ها برای پاسخ به نیازهای هر مرحله ترکیب می‌شوند. این شرکت از طراحی Wafer-scale خود استفاده می‌کند که حافظه SRAM را مستقیماً در کنار محاسبات در سراسر ویفر توزیع می‌کند. این رویکرد در تضاد با GPUها است که باید داده‌های مدل را از حافظه پهنای‌باند بالا (HBM) خارج از تراشه و از طریق حافظه‌های کش کوچک‌تر داخلی منتقل کنند. این رویکرد با استراتژی‌های اخیر انویدیا و آمازون برای توسعه سخت‌افزارهای حافظه‌محور جهت رفع گلوگاه‌های استنتاج هم‌سو است.

در نمودار پهنای‌باند حافظه مورخ ۱۰ سپتامبر ۲۰۲۶، Cerebras پهنای‌باند SRAM داخلی WSE-3 را ۲۱,۰۰۰ ترابایت بر ثانیه به ازای هر ویفر اعلام کرد. برای مقایسه، یک شتاب‌دهنده SRAM نامشخص ۱۵۰ ترابایت بر ثانیه و GPUهای مجهز به HBM4 بین ۲۲ تا ۲۳.۳ ترابایت بر ثانیه ثبت کرده‌اند. البته شرکت هشدار داد که ارقام SRAM مجموع پهنای‌باند حافظه محلی را در سراسر یک پردازنده نشان می‌دهند، در حالی که ارقام HBM ترافیک حافظه خارج از تراشه را می‌سنجند؛ بنابراین این‌ها لایه‌های مختلف حافظه را توصیف می‌کنند و نه لزوماً سرعت مستقیم توکن‌ها را.

داده‌های عملکردی از Artificial Analysis (۱۰ سپتامبر ۲۰۲۶) برای مدل GPT-oss-120B در حالت استدلال بالا با ۱۰,۰۰۰ توکن ورودی، Cerebras را در صدر قرار می‌دهد. نتایج توکن در ثانیه به شرح زیر است:

  • Cerebras: ۱,۶۶۹
  • SambaNova: ۷۰۸
  • Groq: ۴۷۵
  • Microsoft Azure: ۳۱۹
  • Nebius: ۲۹۴
  • Baseten: ۲۹۳

برای دستیابی به افزایش ۵ برابری ظرفیت، Cerebras از شتاب‌دهنده‌های شرکای تجاری برای پردازش پرامپت (پیش‌پُرکردن) استفاده کرد در حالی که اثر footprint مدل WSE را ثابت نگه داشت. نمودارهای طراحی شرکت نشان می‌دهد که سیستم‌های AWS Trainium و GPUهای AMD Helios Instinct می‌توانند به‌عنوان سخت‌افزار پیش‌پُرکننده برای تغذیه مجموعه رمزگشایی Cerebras عمل کنند.

پیامدهای راهبردی

این چرخش، مفروضات بنیادین مقیاس‌دهی استنتاج را تغییر می‌دهد. اکنون ارائه‌دهندگان به‌جای افزودن خوشه‌های یکسان، می‌توانند برای گلوگاه‌های خاص هر حجم کاری بهینه‌سازی کنند. این موضوع به‌ویژه برای برنامه‌های عامل‌محور (Agentic) حیاتی است، جایی که گردش‌های کاری طولانی و چندمرحله‌ای باعث رشد زمینه (Context) در هر فراخوانی مدل شده و تأخیرها در هر گام انباشته می‌شوند.

با تبدیل پیش‌پُرکردن و رمزگشایی به سرویس‌های مجزا، صنعت می‌تواند به سمت یک «بافت استنتاج» (Inference Fabric) ماژولار حرکت کند. این کار اتلاف محاسبات در مراحل حافظه‌محور را کاهش داده و بهینه‌سازی هزینه‌ها در ابر را تهاجمی‌تر می‌کند.

شرکت Cerebras قصد دارد در بخش‌های بعدی این سری فنی، جزئیات بیشتری درباره پشته‌های سخت‌افزاری و نرم‌افزاری و همچنین موازنه اقتصادی این نوع استقرار منتشر کند.

گام بعدی شما

  • اگر از مدل‌های استدلالی با پرامپت‌های طولانی استفاده می‌کنید، تفاوت تأخیر بین نخستین توکن و توکن‌های بعدی را تحلیل کنید تا گلوگاه سخت‌افزاری خود را بشناسید.
  • معماری‌های ناهمگن را در استقرار مدل‌های خود بررسی کنید؛ ترکیب GPU برای پیش‌پُرکردن و شتاب‌دهنده‌های تخصصی برای رمزگشایی می‌تواند هزینه شما را کاهش دهد.
  • تحولات مربوط به انتقال KV Cache را دنبال کنید، زیرا این نقطه حساس جدید در معماری‌های جداسازی‌شده است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این معماری با رفع تضاد بین نیازهای محاسباتی و حافظه‌ای، اجازه می‌دهد مدل‌های عظیم با سرعت بسیار بالاتر و هزینه کمتر سرویس‌دهی شوند. اعتبار این ادعا با داده‌های Artificial Analysis تأیید شده که Cerebras را با فاصله زیاد از رقبای ابری قرار می‌دهد.

تأثیر برای ایران

این تحول بیشتر برای ارائه‌دهندگان زیرساخت‌های ابری و پژوهشگران مدل‌های بنیادی اهمیت دارد. برای توسعه‌دهندگان ایرانی، این به معنای کاهش احتمالی هزینه و تأخیر در سرویس‌های API است که از این معماری استفاده می‌کنند.

·نگاه ما
تحریریه دات‌هوش

جداسازی مراحل استنتاج نشان می‌دهد که عصر «یک تراشه برای همه کارها» در مقیاس صنعتی به پایان رسیده است. با تبدیل استنتاج به یک خط تولید ماژولار، گلوگاه‌ها از سطح تراشه به سطح شبکه (انتقال KV Cache) منتقل می‌شوند. این رویکرد احتمالاً منجر به ظهور ارائه‌دهندگانی می‌شود که تخصصشان نه در ساخت مدل، بلکه در ارکستراسیون بهینه سخت‌افزارهای ناهمگن برای کاهش هزینه هر توکن است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.