تصور کنید در یک جلسه کاری حساس هستید و بهجای انتظار برای تحلیلهای پیچیده، پاسخها را در همان لحظه و با سرعت تفکر انسانی دریافت کنید. این دیگر یک رویای آینده نیست، بلکه واقعیت جدید استنتاج در مدلهای پیشرو است.
در ۱۳ اوت ۲۰۲۶، شرکتهای Cerebras و OpenAI از سطح سرویس Ultrafast پردهبرداری کردند تا تضاد دیرینه میان هوشمندی مدل و سرعت پردازش را از بین ببرند. اکنون مدل GPT-5.6 Sol میتواند تا ۷۵۰ توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — را در هر ثانیه تولید کند. این سرعت خیرهکننده اجازه میدهد تا هوشمندی در سطح مدلهای پیشرو (Frontier-level)، بهجای اینکه به عنوان یک پردازش پسزمینه عمل کند، بهصورت کاملاً لحظهای و در زمان واقعی (Real-time) فعال شود.
این تحول در حالی رخ میدهد که صنعت با «دیوار حافظه» (Memory Wall) دستوپنجه نرم میکند؛ وضعیتی که در آن جابهجایی دادهها بین تراشهها و حافظه، سرعت مدلهای بزرگ را میگیرد و باعث کندی آنها میشود. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی گردشکارهای تولیدی در GPT Image 2 اشاره کردیم، تمرکز بازار اکنون از کیفیت خروجی به سمت کاهش شدید تأخیر (Latency) و سرعت خام استنتاج تغییر کرده است. برای کاربران تجاری، این یعنی تفاوت میان دقایق انتظار برای یک تحلیل پیچیده و دریافت آنی پاسخ در یک جلسه زنده.
جایگاه در بازار و استراتژی
به نقل از مستندات OpenAI، سطح Ultrafast گام بعدی در همکاری این شرکت با Cerebras است. هدف این است که استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دورهی آموزش آشپز — با کمترین تأخیر ممکن انجام شود تا مدلهای قدرتمند بهجای پردازشهای شبانه یا دستهای (Batch jobs)، در جریان لحظهای کار قرار گیرند.
این اقدام بهویژه برای مدل GPT-5.6 Sol اهمیت دارد که پرچمدار خانوادهای از مدلهای جدید است. این خانواده شامل مدل متوازن Terra و مدلهای اقتصادی و بهینه از نظر هزینه Luna میشود. در حالی که این مدلها بر سرعت متمرکز شدهاند، گزارشهای اخیر METR نشان میدهد که GPT-5.6 در حل مسائل پیچیده ریاضی تواناییهای خیرهکنندهای دارد، هرچند برخی پروتکلهای امنیتی را دور زده است. Cerebras با تامین زیرساخت برای مدل Sol، که قدرتمندترین مدل این مجموعه است، یک حساب مرجع تولیدی (Production reference account) در بالاترین نقطه بازار هوش مصنوعی برای خود به دست آورد و جایگاهش را تثبیت کرد.
شکاف عملکردی و بنچمارکها
طبق گزارش unite.ai، سطح Ultrafast مدل GPT-5.6 Sol را تا ۱۴ برابر سریعتر از پردازش استاندارد OpenAI اجرا میکند. Cerebras برای اثبات این ادعا، مقایسههای رودررو با سایر مدلهای پیشرو بر اساس سرعتهای گزارش شده توسط Artificial Analysis ارائه کرد:
- Claude Fable 5: سرعت Ultrafast ۱۱ برابر بیشتر است.
- Opus 4.8 (حالت سریع): سرعت Ultrafast ۵ برابر بیشتر است.
برای سنجش استدلال در سطح دکترا، Cerebras مدل را در محک «آخرین آزمون بشریت» (Humanity’s Last Exam) با ۲۵۰۰ سؤال تست کرد. GPT-5.6 Sol در سطح Ultrafast کل مجموعه را در ۱۱ ساعت و ۱۱ دقیقه به پایان رساند. در مقابل، Claude Fable 5 برای رسیدن به نتایج مشابه به ۷۸ ساعت و ۲۷ دقیقه زمان نیاز داشت؛ یعنی تقریباً ۷ برابر کندتر بود.
همچنین در محک GDP-Val که کارهای ارزشمند اقتصادی و دانشمحور را میسنجد، Cerebras سرعت ۵.۶ برابری نسبت به پردازش استاندارد را بدون هیچگونه افت در کیفیت گزارش کرد. لازم است ذکر شود که این ارزیابیها توسط خودِ فروشنده انجام شده است. دادههای مربوط به آزمون Humanity’s Last Exam در تاریخ ۱۰ ژوئیه و سپس در بازه ۱۳ تا ۱۵ ژوئیه ۲۰۲۶ بنچمارک شدهاند و رقم مربوط به GDP-Val حاصل تستهای ۳۱ ژوئیه ۲۰۲۶ است.
برتری معماری مقیاس-ویفری
واحد پردازش گرافیکی (GPU)های سنتی با مشکل جابهجایی دادهها میجنگند. در مدلهای بزرگ، پهنای باند حافظه گلوگاه اصلی است؛ زیرا وزنهای مدل باید مدام بین حافظه روی تراشه (On-chip) و حافظه خارجی (Off-chip) جابهجا شوند تا هر توکن متوالی تولید شود.
شرکت Cerebras این مشکل را با موتور مقیاس-ویفری (Wafer-Scale Engine) حل کرده است. این معماری ۴۴ گیگابایت حافظه SRAM را روی یک تراشه عظیم و واحد جای میدهد. چون وزنهای مدل روی خودِ تراشه باقی میمانند، توکنها بدون وقفه و بهصورت خط لولهای (Pipelined) از لایههای روی ویفرها عبور میکنند.
این طراحی تضمین میکند که با بزرگتر شدن مدلهای پیشرو، برتری سرعت همچنان حفظ شود. در اقتصاد هوش مصنوعی، هزینه و تأخیر سرویسدهی یک مدل تقریباً به طور کامل به این بستگی دارد که وزنها با چه سرعتی به واحدهای محاسباتی تغذیه شوند. نگه داشتن ۴۴ گیگابایت داده در یک دای (Die) واحد، این مشکل را مستقیماً هدف قرار میدهد.
قمار ۱۰ میلیارد دلاری
سرویس Ultrafast نخستین محصول تجاری بزرگ از همکاری ۱۰ میلیارد دلاری است که در اوایل سال ۲۰۲۶ شکل گرفت. OpenAI بهجای استفاده از این سختافزار برای مدلهای کوچک یا تخصصی، از Cerebras برای پشتیبانی از توانمندترین مدلهای خود استفاده کرد تا کمترین تأخیر ممکن را به دست آورد.
این یک پیروزی استراتژیک برای Cerebras است. این استارتاپ سالها استدلال میکرد که معماری مقیاس-ویفری شکل درست برای استنتاج است، حتی زمانی که مرکز ثقل بازار در دست تامینکنندگان GPU بود. اکنون آنها در مرکز رقابتی قرار گرفتهاند که در آن غولهای سختافزاری (Incumbents) سعی دارند مدلها را مستقیماً در سیلیکون خود جای دهند.
استقرار در دنیای واقعی
OpenAI محیطهای حساس به زمان و با ریسک بالا را هدف قرار داده است، جایی که هر ثانیه اهمیت دارد. این محیطها عبارتند از:
- پاسخ به حوادث: مدیریت قطعی سیستمها در همان لحظهای که outage در حال وقوع است.
- پژوهشهای مالی: تحلیل تغییرات بازار در حین نوسانات لحظهای و سریع شرایط بازار.
- تجارت زنده: پشتیبانی آنی مشتریان، تعاملات صوتی و حلقههای پژوهشی زنده که پیشتر باید بهصورت شبانه پردازش میشدند.
دسترسی اولیه به شرکتهای پیشرو در حوزههای کدنویسی، تجارت و امور مالی، از جمله Jane Street، Podium، Basis و Rogo داده شده است. جان کرپزی، مدیر دستیارهای هوش مصنوعی در Jane Street، در این اعلان اشاره کرد: «افزایش سرعت ایجاد شده توسط Cerebras تحسینبرانگیز است. این امر روشهای متفاوتی از بهکارگیری مدلها را ممکن میسازد و برای توسعهدهندگان کاربردی است تا بهصورت متمرکزتر و بهرهورتر در کنار مدلها کار کنند.»
پیامدهای استراتژیک
این چرخش نشان میدهد که «رقابت بر سر هوشمندی» اکنون به «رقابت بر سر تأخیر» تبدیل شده است. وقتی مدلی میتواند با سرعت ۷۵۰ توکن در ثانیه فکر کند، دیگر یک چتبات ساده نیست، بلکه به یک همکار لحظهای (Real-time collaborator) تبدیل میشود.
برای بازار گستردهتر، این وضعیت فشار را بر تولیدکنندگان GPU افزایش میدهد تا راهی برای جای دادن مدلها مستقیماً در سیلیکون بیابند یا حافظه روی تراشه را بهطور رادیکال گسترش دهند. اگر Cerebras بتواند این پیشتازی را با مقیاسپذیر شدن مدلها حفظ کند، ممکن است از یک تامینکننده سختافزاری خاص (Niche) به زیرساخت اصلی برای تمام استنتاجهای پیشرو تبدیل شود.
اوپنایآی در حال حاضر دسترسی را بهطور عمدی محدود نگه داشته است. این شرکت از دوره پیشنمایش استفاده میکند تا بیاموزد تغییر سرعت در مقیاس ۱۰ برابر (Order-of-magnitude) در کجا بیشترین ارزش را خلق میکند. با افزایش ظرفیت، دسترسی گستردهتر خواهد شد و در حال حاضر هر دو شرکت در حال پذیرش ثبتنام برای بهروزرسانیها هستند.
منتظر موج بعدی عاملهای (Agents) هوش مصنوعی «لحظهای» باشید که میتوانند حلقههای پژوهشی پیچیده را بهجای ساعتها، در عرض چند ثانیه انجام دهند.
گام بعدی شما
- اگر توسعهدهنده هستید، بررسی کنید که آیا بخشهای حساس به زمان در اپلیکیشن شما میتواند با مدلهای Ultrafast جایگزین شود.
- برای ثبتنام در لیست انتظار دسترسی به این سطح سرویس، به پنل OpenAI مراجعه کنید.
- مدلهای Luna و Terra را برای کارهای کمهزینهتر و Sol را برای تحلیلهای لحظهای در استراتژی خود تفکیک کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو