۵ برابر. این عدد، میزان افزایش توان عملیاتی استنتاج است که اکنون با تفکیک دو مرحله اصلی تولید متن در مدلهای زبانی بزرگ به مجموعههای سختافزاری مجزا، امکانپذیر شده است. طبق اعلام Cerebras Systems در ۱ اکتبر ۲۰۲۶، این تکنیک «جداسازی» (Disaggregation) اجازه میدهد ظرفیت سیستم بهشدت افزایش یابد، بدون آنکه سرعت تولید توکنها کاهش یابد یا نیاز به استقرار سیستمهای بیشتر باشد.
این جزئیات در پست وبلاگی با عنوان «استنتاج جداسازیشده از پایه» توسط آیزاک تای و ژنوی گائو منتشر شد. این نوشتار آغازگر یک سری مقالات برنامهریزیشده است که برای خوانندگانی طراحی شده که شنیدهاند مرحله پیشپُرکردن «محاسباتمحور» و مرحله رمزگشایی «حافظهمحور» است، اما میخواهند مکانیسمهای زیربنایی نحوه تعادل میان محاسبات ریاضی و جابهجایی دادهها در شتابدهندهها را بهطور دقیق درک کنند.
استنتاج در مدلهای مدرن با یک تضاد سختافزاری بنیادین دستوپنجه نرم میکند. فرآیند با پیشپُرکردن (Prefill) آغاز میشود؛ جایی که مدل تمام پرامپت ورودی را بهصورت موازی پردازش میکند و این یک وظیفه محاسباتمحور (Compute-bound) است. در دنیای واقعی، پرامپتها میتوانند هزاران یا حتی صدها هزار توکن (Token) داشته باشند. پس از آن، مرحله رمزگشایی (Decoding) آغاز میشود که در آن توکنها یکییکی تولید میشوند؛ وظیفهای حافظهمحور (Memory-bound) که برای جلوگیری از محاسبه مجدد توکنهای قبلی، به KV Cache متکی است. این چالش ساختاری دقیقاً همان چیزی است که در تحلیل ما پیرامون علت ناکارآمدی سختافزاری و اتلاف توان پردازشی در مدلهای زبانی بررسی شده بود.
درک شدت محاسباتی
به نقل از این گزارش، برای تبیین این تضاد از مفهوم «شدت محاسباتی» (Arithmetic Intensity) استفاده شده است؛ یعنی تعداد عملیات اعشاری (FLOPs) تقسیم بر تعداد بایتهای منتقلشده بین حافظه و واحدهای پردازشی. دو مثال متضاد در این زمینه ارائه شده است:
- جمع ماتریسی: افزودن دو ماتریس برای هر ۶ بایت جابهجا شده، تنها ۱ عملیات اعشاری انجام میدهد (شدت ۰.۱۶۷). این نسبت فارغ از اندازه ماتریس ثابت است.
- ضرب ماتریسی: هر مقدار خروجی از ترکیب یک سطر کامل از یک ورودی و یک ستون کامل از ورودی دیگر ساخته میشود. چون مقادیر بارگذاریشده در خروجیهای متعددی اثر میگذارند، شدت محاسباتی با افزایش اندازه ورودی، رشد میکند.
استنتاج در واقع زنجیرهای از این ضربهای ماتریسی بین وزنهای ثابت مدل و توکنهای ورودی است. همانطور که در تحلیل قبلی ما دربارهی زیرساختهای سختافزاری مدلهای بنیادی اشاره کردیم، هر دو مرحله پیشپُرکردن و رمزگشایی باید تمام وزنهای مدل — که احتمالاً صدها گیگابایت یا ترابایت هستند — را برای هر توکن تولیدشده به واحدهای پردازشی منتقل کنند. با این حال، در حالی که جابهجایی حافظه تقریباً ثابت میماند، شدت محاسباتی پس از مرحله پیشپُرکردن بهشدت افت میکند. به همین دلیل است که افزودن ظرفیت محاسباتی خام، لزوماً باعث سریعتر رسیدن توکنها در مرحله رمزگشایی نمیشود.
وقتی این دو مرحله سختافزار مشترکی داشته باشند، وظایف سنگین پیشپُرکردن اغلب باعث توقف درخواستهای فعال رمزگشایی میشوند. این وضعیت زمانبندهای سیستم را مجبور میکند بین «زمان تا نخستین توکن» (Time-to-first-token) برای کاربران جدید و «جریان روان توکنها» برای کاربران فعلی، یک موازنه سخت و مجموع-صفر انجام دهند. دستهبندی (Batching) میتواند توان عملیاتی کل را با به اشتراک گذاشتن بار خواندن وزنهای مدل افزایش دهد، اما دستههای بزرگتر میتوانند باعث شوند هر گام رمزگشایی طولانیتر شود و در نتیجه تجربه کاربر فردی کند گردد.
مکانیسم جداسازی
شرکت Cerebras یک الگوی طراحی سیستمی پیشنهاد میدهد که پیشپُرکردن و رمزگشایی را در مجموعههای سختافزاری مجزا اجرا میکند. این تفکیک به اپراتورها اجازه میدهد:
- سختافزار و سیاستهای دستهبندی را برای هر مرحله بهطور مستقل تخصیص دهند.
- برای پیشپُرکردن، اولویت را بر کاهش تأخیر (Latency) بگذارند تا به اهداف سختگیرانه «زمان تا نخستین توکن» برسند.
- یک مجموعه بزرگتر و با زمانبندی متراکمتر را به رمزگشایی اختصاص دهند تا جریان توکنها روان باشد.
- هر مجموعه را بر اساس تقاضای واقعی بهطور جداگانه مقیاسدهی کنند.
این معماری یک نیاز جدید ایجاد میکند: KV Cache مربوط به هر درخواست باید پیش از ادامه تولید، از مجموعه پیشپُرکردن به مجموعه رمزگشایی منتقل شود. در حالی که وزنهای مدل در هر دو مجموعه بارگذاری شدهاند، این تحویلِ حافظه باعث ایجاد سربار شبکه و هماهنگی میشود.
Cerebras اشاره میکند که این تأخیر اضافی به این بستگی دارد که حافظه بین ماشینهای همجوار (Colocated) جابهجا شود یا بین مناطق مختلف. علاوه بر این، اگر ظرفیتها با تقاضا همخوانی نداشته باشند، ممکن است هر یک از مجموعهها بیکار بمانند. با این حال، شرکت استدلال میکند که جداسازی در مقیاسهای بزرگ بسیار جذاب است، زیرا دستاوردهای حاصل از سایزبندی و زمانبندی مستقل، هزینههای انتقال و عملیاتی را میپوشاند.
سختافزار ناهمگن و بنچمارکها
شرکت Cerebras بهطور خاص روی «جداسازی ناهمگن» تأکید دارد که در آن انواع مختلف تراشهها برای پاسخ به نیازهای هر مرحله ترکیب میشوند. این شرکت از طراحی Wafer-scale خود استفاده میکند که حافظه SRAM را مستقیماً در کنار محاسبات در سراسر ویفر توزیع میکند. این رویکرد در تضاد با GPUها است که باید دادههای مدل را از حافظه پهنایباند بالا (HBM) خارج از تراشه و از طریق حافظههای کش کوچکتر داخلی منتقل کنند. این رویکرد با استراتژیهای اخیر انویدیا و آمازون برای توسعه سختافزارهای حافظهمحور جهت رفع گلوگاههای استنتاج همسو است.
در نمودار پهنایباند حافظه مورخ ۱۰ سپتامبر ۲۰۲۶، Cerebras پهنایباند SRAM داخلی WSE-3 را ۲۱,۰۰۰ ترابایت بر ثانیه به ازای هر ویفر اعلام کرد. برای مقایسه، یک شتابدهنده SRAM نامشخص ۱۵۰ ترابایت بر ثانیه و GPUهای مجهز به HBM4 بین ۲۲ تا ۲۳.۳ ترابایت بر ثانیه ثبت کردهاند. البته شرکت هشدار داد که ارقام SRAM مجموع پهنایباند حافظه محلی را در سراسر یک پردازنده نشان میدهند، در حالی که ارقام HBM ترافیک حافظه خارج از تراشه را میسنجند؛ بنابراین اینها لایههای مختلف حافظه را توصیف میکنند و نه لزوماً سرعت مستقیم توکنها را.
دادههای عملکردی از Artificial Analysis (۱۰ سپتامبر ۲۰۲۶) برای مدل GPT-oss-120B در حالت استدلال بالا با ۱۰,۰۰۰ توکن ورودی، Cerebras را در صدر قرار میدهد. نتایج توکن در ثانیه به شرح زیر است:
- Cerebras: ۱,۶۶۹
- SambaNova: ۷۰۸
- Groq: ۴۷۵
- Microsoft Azure: ۳۱۹
- Nebius: ۲۹۴
- Baseten: ۲۹۳
برای دستیابی به افزایش ۵ برابری ظرفیت، Cerebras از شتابدهندههای شرکای تجاری برای پردازش پرامپت (پیشپُرکردن) استفاده کرد در حالی که اثر footprint مدل WSE را ثابت نگه داشت. نمودارهای طراحی شرکت نشان میدهد که سیستمهای AWS Trainium و GPUهای AMD Helios Instinct میتوانند بهعنوان سختافزار پیشپُرکننده برای تغذیه مجموعه رمزگشایی Cerebras عمل کنند.
پیامدهای راهبردی
این چرخش، مفروضات بنیادین مقیاسدهی استنتاج را تغییر میدهد. اکنون ارائهدهندگان بهجای افزودن خوشههای یکسان، میتوانند برای گلوگاههای خاص هر حجم کاری بهینهسازی کنند. این موضوع بهویژه برای برنامههای عاملمحور (Agentic) حیاتی است، جایی که گردشهای کاری طولانی و چندمرحلهای باعث رشد زمینه (Context) در هر فراخوانی مدل شده و تأخیرها در هر گام انباشته میشوند.
با تبدیل پیشپُرکردن و رمزگشایی به سرویسهای مجزا، صنعت میتواند به سمت یک «بافت استنتاج» (Inference Fabric) ماژولار حرکت کند. این کار اتلاف محاسبات در مراحل حافظهمحور را کاهش داده و بهینهسازی هزینهها در ابر را تهاجمیتر میکند.
شرکت Cerebras قصد دارد در بخشهای بعدی این سری فنی، جزئیات بیشتری درباره پشتههای سختافزاری و نرمافزاری و همچنین موازنه اقتصادی این نوع استقرار منتشر کند.
گام بعدی شما
- اگر از مدلهای استدلالی با پرامپتهای طولانی استفاده میکنید، تفاوت تأخیر بین نخستین توکن و توکنهای بعدی را تحلیل کنید تا گلوگاه سختافزاری خود را بشناسید.
- معماریهای ناهمگن را در استقرار مدلهای خود بررسی کنید؛ ترکیب GPU برای پیشپُرکردن و شتابدهندههای تخصصی برای رمزگشایی میتواند هزینه شما را کاهش دهد.
- تحولات مربوط به انتقال KV Cache را دنبال کنید، زیرا این نقطه حساس جدید در معماریهای جداسازیشده است.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو