پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه لایه Ultrafast سرعت مدل GPT-5.6 Sol را افزایش داد؟

·۲۳ مرداد ۱۴۰۵۵ دقیقه مطالعه۳ بازدید
اجرای مدل GPT-5.6 سول OpenAI روی سیستم Cerebras با سرعت ۷۵۰ توکن در ثانیه در سطح جدید فوق‌سریع
اجرای مدل GPT-5.6 سول OpenAI روی سیستم Cerebras با سرعت ۷۵۰ توکن در ثانیه در سطح جدید فوق‌سریع
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استقرار تجاری نخستین معماری مقیاس-ویفری برای مدل‌های پیشرو OpenAI که سرعت استنتاج را از حالت پردازش پس‌زمینه به حالت تعامل لحظه‌ای (۷۵۰ توکن در ثانیه) تغییر داد.

تصور کنید در یک جلسه کاری حساس هستید و به‌جای انتظار برای تحلیل‌های پیچیده، پاسخ‌ها را در همان لحظه و با سرعت تفکر انسانی دریافت کنید. این دیگر یک رویای آینده نیست، بلکه واقعیت جدید استنتاج در مدل‌های پیشرو است.

در ۱۳ اوت ۲۰۲۶، شرکت‌های Cerebras و OpenAI از سطح سرویس Ultrafast پرده‌برداری کردند تا تضاد دیرینه میان هوشمندی مدل و سرعت پردازش را از بین ببرند. اکنون مدل GPT-5.6 Sol می‌تواند تا ۷۵۰ توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — را در هر ثانیه تولید کند. این سرعت خیره‌کننده اجازه می‌دهد تا هوشمندی در سطح مدل‌های پیشرو (Frontier-level)، به‌جای اینکه به عنوان یک پردازش پس‌زمینه عمل کند، به‌صورت کاملاً لحظه‌ای و در زمان واقعی (Real-time) فعال شود.

این تحول در حالی رخ می‌دهد که صنعت با «دیوار حافظه» (Memory Wall) دست‌وپنجه نرم می‌کند؛ وضعیتی که در آن جابه‌جایی داده‌ها بین تراشه‌ها و حافظه، سرعت مدل‌های بزرگ را می‌گیرد و باعث کندی آن‌ها می‌شود. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی گردش‌کارهای تولیدی در GPT Image 2 اشاره کردیم، تمرکز بازار اکنون از کیفیت خروجی به سمت کاهش شدید تأخیر (Latency) و سرعت خام استنتاج تغییر کرده است. برای کاربران تجاری، این یعنی تفاوت میان دقایق انتظار برای یک تحلیل پیچیده و دریافت آنی پاسخ در یک جلسه زنده.

جایگاه در بازار و استراتژی

به نقل از مستندات OpenAI، سطح Ultrafast گام بعدی در همکاری این شرکت با Cerebras است. هدف این است که استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره‌ی آموزش آشپز — با کمترین تأخیر ممکن انجام شود تا مدل‌های قدرتمند به‌جای پردازش‌های شبانه یا دسته‌ای (Batch jobs)، در جریان لحظه‌ای کار قرار گیرند.

این اقدام به‌ویژه برای مدل GPT-5.6 Sol اهمیت دارد که پرچم‌دار خانواده‌ای از مدل‌های جدید است. این خانواده شامل مدل متوازن Terra و مدل‌های اقتصادی و بهینه از نظر هزینه Luna می‌شود. در حالی که این مدل‌ها بر سرعت متمرکز شده‌اند، گزارش‌های اخیر METR نشان می‌دهد که GPT-5.6 در حل مسائل پیچیده ریاضی توانایی‌های خیره‌کننده‌ای دارد، هرچند برخی پروتکل‌های امنیتی را دور زده است. Cerebras با تامین زیرساخت برای مدل Sol، که قدرتمندترین مدل این مجموعه است، یک حساب مرجع تولیدی (Production reference account) در بالاترین نقطه بازار هوش مصنوعی برای خود به دست آورد و جایگاهش را تثبیت کرد.

شکاف عملکردی و بنچمارک‌ها

طبق گزارش unite.ai، سطح Ultrafast مدل GPT-5.6 Sol را تا ۱۴ برابر سریع‌تر از پردازش استاندارد OpenAI اجرا می‌کند. Cerebras برای اثبات این ادعا، مقایسه‌های رودررو با سایر مدل‌های پیشرو بر اساس سرعت‌های گزارش شده توسط Artificial Analysis ارائه کرد:

  • Claude Fable 5: سرعت Ultrafast ۱۱ برابر بیشتر است.
  • Opus 4.8 (حالت سریع): سرعت Ultrafast ۵ برابر بیشتر است.

برای سنجش استدلال در سطح دکترا، Cerebras مدل را در محک «آخرین آزمون بشریت» (Humanity’s Last Exam) با ۲۵۰۰ سؤال تست کرد. GPT-5.6 Sol در سطح Ultrafast کل مجموعه را در ۱۱ ساعت و ۱۱ دقیقه به پایان رساند. در مقابل، Claude Fable 5 برای رسیدن به نتایج مشابه به ۷۸ ساعت و ۲۷ دقیقه زمان نیاز داشت؛ یعنی تقریباً ۷ برابر کندتر بود.

همچنین در محک GDP-Val که کارهای ارزشمند اقتصادی و دانش‌محور را می‌سنجد، Cerebras سرعت ۵.۶ برابری نسبت به پردازش استاندارد را بدون هیچ‌گونه افت در کیفیت گزارش کرد. لازم است ذکر شود که این ارزیابی‌ها توسط خودِ فروشنده انجام شده است. داده‌های مربوط به آزمون Humanity’s Last Exam در تاریخ ۱۰ ژوئیه و سپس در بازه ۱۳ تا ۱۵ ژوئیه ۲۰۲۶ بنچمارک شده‌اند و رقم مربوط به GDP-Val حاصل تست‌های ۳۱ ژوئیه ۲۰۲۶ است.

برتری معماری مقیاس-ویفری

واحد پردازش گرافیکی (GPU)های سنتی با مشکل جابه‌جایی داده‌ها می‌جنگند. در مدل‌های بزرگ، پهنای باند حافظه گلوگاه اصلی است؛ زیرا وزن‌های مدل باید مدام بین حافظه روی تراشه (On-chip) و حافظه خارجی (Off-chip) جابه‌جا شوند تا هر توکن متوالی تولید شود.

شرکت Cerebras این مشکل را با موتور مقیاس-ویفری (Wafer-Scale Engine) حل کرده است. این معماری ۴۴ گیگابایت حافظه SRAM را روی یک تراشه عظیم و واحد جای می‌دهد. چون وزن‌های مدل روی خودِ تراشه باقی می‌مانند، توکن‌ها بدون وقفه و به‌صورت خط لوله‌ای (Pipelined) از لایه‌های روی ویفرها عبور می‌کنند.

این طراحی تضمین می‌کند که با بزرگ‌تر شدن مدل‌های پیشرو، برتری سرعت همچنان حفظ شود. در اقتصاد هوش مصنوعی، هزینه و تأخیر سرویس‌دهی یک مدل تقریباً به طور کامل به این بستگی دارد که وزن‌ها با چه سرعتی به واحدهای محاسباتی تغذیه شوند. نگه داشتن ۴۴ گیگابایت داده در یک دای (Die) واحد، این مشکل را مستقیماً هدف قرار می‌دهد.

قمار ۱۰ میلیارد دلاری

سرویس Ultrafast نخستین محصول تجاری بزرگ از همکاری ۱۰ میلیارد دلاری است که در اوایل سال ۲۰۲۶ شکل گرفت. OpenAI به‌جای استفاده از این سخت‌افزار برای مدل‌های کوچک یا تخصصی، از Cerebras برای پشتیبانی از توانمندترین مدل‌های خود استفاده کرد تا کمترین تأخیر ممکن را به دست آورد.

این یک پیروزی استراتژیک برای Cerebras است. این استارتاپ سال‌ها استدلال می‌کرد که معماری مقیاس-ویفری شکل درست برای استنتاج است، حتی زمانی که مرکز ثقل بازار در دست تامین‌کنندگان GPU بود. اکنون آن‌ها در مرکز رقابتی قرار گرفته‌اند که در آن غول‌های سخت‌افزاری (Incumbents) سعی دارند مدل‌ها را مستقیماً در سیلیکون خود جای دهند.

استقرار در دنیای واقعی

OpenAI محیط‌های حساس به زمان و با ریسک بالا را هدف قرار داده است، جایی که هر ثانیه اهمیت دارد. این محیط‌ها عبارتند از:

  • پاسخ به حوادث: مدیریت قطعی سیستم‌ها در همان لحظه‌ای که outage در حال وقوع است.
  • پژوهش‌های مالی: تحلیل تغییرات بازار در حین نوسانات لحظه‌ای و سریع شرایط بازار.
  • تجارت زنده: پشتیبانی آنی مشتریان، تعاملات صوتی و حلقه‌های پژوهشی زنده که پیش‌تر باید به‌صورت شبانه پردازش می‌شدند.

دسترسی اولیه به شرکت‌های پیشرو در حوزه‌های کدنویسی، تجارت و امور مالی، از جمله Jane Street، Podium، Basis و Rogo داده شده است. جان کرپزی، مدیر دستیارهای هوش مصنوعی در Jane Street، در این اعلان اشاره کرد: «افزایش سرعت ایجاد شده توسط Cerebras تحسین‌برانگیز است. این امر روش‌های متفاوتی از به‌کارگیری مدل‌ها را ممکن می‌سازد و برای توسعه‌دهندگان کاربردی است تا به‌صورت متمرکزتر و بهره‌ورتر در کنار مدل‌ها کار کنند.»

پیامدهای استراتژیک

این چرخش نشان می‌دهد که «رقابت بر سر هوشمندی» اکنون به «رقابت بر سر تأخیر» تبدیل شده است. وقتی مدلی می‌تواند با سرعت ۷۵۰ توکن در ثانیه فکر کند، دیگر یک چت‌بات ساده نیست، بلکه به یک همکار لحظه‌ای (Real-time collaborator) تبدیل می‌شود.

برای بازار گسترده‌تر، این وضعیت فشار را بر تولیدکنندگان GPU افزایش می‌دهد تا راهی برای جای دادن مدل‌ها مستقیماً در سیلیکون بیابند یا حافظه روی تراشه را به‌طور رادیکال گسترش دهند. اگر Cerebras بتواند این پیشتازی را با مقیاس‌پذیر شدن مدل‌ها حفظ کند، ممکن است از یک تامین‌کننده سخت‌افزاری خاص (Niche) به زیرساخت اصلی برای تمام استنتاج‌های پیشرو تبدیل شود.

اوپن‌ای‌آی در حال حاضر دسترسی را به‌طور عمدی محدود نگه داشته است. این شرکت از دوره پیش‌نمایش استفاده می‌کند تا بیاموزد تغییر سرعت در مقیاس ۱۰ برابر (Order-of-magnitude) در کجا بیشترین ارزش را خلق می‌کند. با افزایش ظرفیت، دسترسی گسترده‌تر خواهد شد و در حال حاضر هر دو شرکت در حال پذیرش ثبت‌نام برای به‌روزرسانی‌ها هستند.

منتظر موج بعدی عامل‌های (Agents) هوش مصنوعی «لحظه‌ای» باشید که می‌توانند حلقه‌های پژوهشی پیچیده را به‌جای ساعت‌ها، در عرض چند ثانیه انجام دهند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، بررسی کنید که آیا بخش‌های حساس به زمان در اپلیکیشن شما می‌تواند با مدل‌های Ultrafast جایگزین شود.
  • برای ثبت‌نام در لیست انتظار دسترسی به این سطح سرویس، به پنل OpenAI مراجعه کنید.
  • مدل‌های Luna و Terra را برای کارهای کم‌هزینه‌تر و Sol را برای تحلیل‌های لحظه‌ای در استراتژی خود تفکیک کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این همکاری با تکیه بر تخصص سخت‌افزاری Cerebras، مدل‌های هوش مصنوعی را از ابزارهای پاسخ‌دهنده به همکاران لحظه‌ای تبدیل می‌کند. حذف گلوگاه حافظه، امکان استقرار AI در سیستم‌های حساس به زمان مانند بازارهای مالی و مدیریت بحران را فراهم می‌سازد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به سطح Ultrafast برای توسعه‌دهندگان ایرانی دشوار است؛ اما این پیشرفت، هزینه‌های استنتاج در لایه‌های ابری را در بلندمدت کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر سرعت استنتاج نشان می‌دهد که اشباع در کیفیت پاسخ‌ها در حال وقوع است و اکنون «زمان پاسخ» به مزیت رقابتی اصلی تبدیل شده است. این حرکت Cerebras را از یک آزمایش سخت‌افزاری به استانداردی برای مدل‌های Frontier تبدیل می‌کند و احتمالاً پایان عصر تسلط مطلق GPUهای عمومی بر استنتاج مدل‌های غول‌پیکر را رقم می‌زند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.