پرش به محتوای اصلی
پرش به محتوای مقاله

حالت Ultrafast در GPT-5.6 Sol سرعت تولید متن را به ۷۵۰ توکن در ثانیه رساند

·۲۶ مرداد ۱۴۰۵۹ دقیقه مطالعه
ChatGPT با سرعت ۱۴ برابری: چه معنایی برای کاربران دارد
ChatGPT با سرعت ۱۴ برابری: چه معنایی برای کاربران دارد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک مود پردازشی (نه مدل جدید) که سرعت استنتاج مدل پرچم‌دار را بدون کاهش اندازه مدل، تا ۱۴ برابر افزایش می‌دهد، اما در عوض سقف خروجی را به‌شدت محدود می‌کند.

تصور کنید مدل هوش مصنوعی شما سریع‌تر از آن چیزی که بتوانید بخوانید، بنویسد. اوپن‌ای‌آی (OpenAI) با معرفی حالت Ultrafast، این تخیل را به واقعیت تبدیل کرد تا مدل‌های پرچم‌دار را به تجربه‌ای آنی تبدیل کند. طبق اعلام این شرکت در ۱۷ اوت ۲۰۲۶، مدل GPT-5.6 Sol اکنون می‌تواند تا ۷۵۰ توکن (Token) در ثانیه تولید کند. این یعنی سرعت تولید متن در این حالت، ۱۴ برابر سریع‌تر از پردازش استاندارد است و عملاً سریع‌تر از هر انسانی می‌نویسد.

این تحول در حالی رخ می‌دهد که سرعت به میدان نبرد اصلی آزمایشگاه‌های هوش مصنوعی تبدیل شده است. برای سال‌ها، صنعت با یک موازنه ساده روبرو بود: یا از مدل‌های عظیم و کند برای کیفیت بالا استفاده می‌کردید یا از مدل‌های کوچک و سریع برای کاهش تأخیر (Latency). همان‌طور که در تحلیل قبلی ما درباره‌ی برتری مدل Sonnet شرکت آنتروپیک در کدنویسی تولیدی به دلیل تعادل میان سرعت و قدرت اشاره کردیم، اوپن‌ای‌آی اکنون تلاش می‌کند پیوند میان کیفیت و تأخیر را به‌طور کامل قطع کند.

زمینه‌ی ظهور Ultrafast

حالت Ultrafast یک مود پردازشی اختصاصی برای GPT-5.6 Sol است که هدفش تنها یک چیز است: سرعت. هدف این است که پاسخ‌ها سریع‌تر از خط لوله‌ی پردازشی استاندارد به دست کاربر برسند. این حالت به طور خاص برای مدل پرچم‌دار فعلی شرکت طراحی شده است تا پاسخ‌ها را با سرعتی بسیار بیشتر از روال معمول بازگرداند. برای درک دقیق‌تر این جهش، می‌توان به بررسی این موضوع پرداخت که چگونه لایه Ultrafast توانست سرعت مدل GPT-5.6 Sol را به این میزان افزایش دهد.

به نقل از مستندات اوپن‌ای‌آی، این شرکت پیش از این برای افزایش سرعت، کاربران را به مدل‌های کوچک‌تر و سبک‌تر هدایت می‌کرد؛ مدل‌هایی که برای رسیدن به تأخیر کمتر، بخشی از توانایی‌های خود را فدا می‌کردند. اما Ultrafast رویکردی متفاوت دارد و قدرت کامل مدل پرچم‌دار را با تأخیری به‌شدت کاهش‌یافته ارائه می‌دهد.

اوپن‌ای‌آی این به‌روزرسانی را یک چرخش فنی توصیف کرده است. هدف این است که «کار مفیدتری در هر ثانیه» ارائه شود تا کاربران مجبور نباشند بین کیفیت و سرعت یکی را انتخاب کنند. برای کاربران عادی ChatGPT، این به معنای دریافت پاسخ‌های سریع به سؤالات واقعی است، بدون اینکه کیفیت پاسخ‌ها (که معمولاً در مدل‌های کوچک‌تر و بهینه‌شده برای سرعت کاهش می‌یابد) افت کند.

سازوکار فنی Ultrafast

باید دقت کرد که Ultrafast یک مدل جدید نیست، بلکه یک مود پردازشی برای مدل موجود است. بر اساس گزارش وب‌سایت dev.to، این حالت با بهینه‌سازی خط لوله‌ی پردازش برای دستیابی به حداکثر سرعت عمل می‌کند و تمرکز آن بر تولید «کار مفیدتر در هر ثانیه» است.

مشخصات فنی این حالت عبارت است از:

  • سرعت تولید: تا ۷۵۰ توکن در ثانیه. توکن‌ها واحدهای متنی مجزایی هستند که مدل تولید می‌کند؛ هر توکن تقریباً معادل سه-چهارم یک کلمه است.
  • ضریب سرعت: ۱۴ برابر سریع‌تر از «پردازش استاندارد».
  • سقف خروجی: محدودیت سخت ۷۵۰ توکن برای هر پاسخ.

این محدودیت توکنی، حیاتی‌ترین جزئیات فنی است. از آنجا که هر توکن حدود ۷۵٪ یک کلمه است، کاربران به پاسخ‌هایی با طول تقریبی ۵۵۰ تا ۶۰۰ کلمه محدود می‌شوند. این مقدار برای یک پاراگراف جامع، یک توضیح شفاف یا پیش‌نویس یک ایمیل کوتاه کافی است، اما این حالت را برای تولید محتوای بلند مانند گزارش‌های مفصل، اسناد چندبخشی یا بلوک‌های گسترده‌ی کد، عملاً بی‌فایده می‌کند.

بحث بر سر «ریاضیات بازاریابی»

برخی منتقدان استدلال می‌کنند که ادعای افزایش ۱۴ برابری سرعت، بیش از آنکه نتیجه‌ی یک پیشرفت در بهره‌وری باشد، حاصل محدودیت‌های معماری است. چون سیستم در این حالت بسیار زودتر از حالت استاندارد تولید متن را متوقف می‌کند، معیارهای توان عملیاتی (Throughput) به‌طور طبیعی بالاتر به نظر می‌رسند. سیستمی که زودتر متوقف شود، همیشه در آمارهای توان عملیاتی سریع‌تر جلوه می‌کند.

اوپن‌ای‌آی مشخص نکرده است که مدل پایه برای این مقایسه چه بوده یا از چه پیکربندی سخت‌افزاری استفاده شده است. عبارت «پردازش استاندارد» بدون ذکر نوع وظایف تست‌شده، فضای زیادی برای تفسیر باقی می‌گذارد و در واقع بدون شفافیت در مورد متدولوژی تست، کار می‌کند.

در استنتاج (Inference)، بنچمارک‌های سرعت به‌شدت به زمینه (Context) حساس هستند. نرخ تولید توکن در یک پرامپت کوتاه و تک‌مرحله‌ای، با توان عملیاتی در یک وظیفه‌ی استدلالی پیچیده که نیاز به زنجیره‌سازی منطق در ده‌ها خروجی میانی دارد، کاملاً متفاوت است. بدون داده‌های متناسب با هر وظیفه، عدد ۱۴ برابر بیشتر یک سقف در بهترین حالت است تا یک میانگین تضمین‌شده. یک افزایش ۱۴ برابری که در پرس‌وجوهای ساده اندازه‌گیری شده باشد، تقریباً به طور قطع زمانی که مدل مجبور به انجام پردازش‌های شناختی سنگین‌تر شود، کاهش می‌یابد.

استراتژی سازمانی در برابر تجربه‌ی مصرف‌کننده

این عرضه بیشتر از آنکه برای کاربر عادی ChatGPT باشد، برای حفظ کاربران API است. در سال ۲۰۲۵، سرعت به محور اصلی رقابت در بازار مدل‌ها تبدیل شد. توسعه‌دهندگان شروع به مهاجرت به Gemini Flash گوگل و Claude Haiku آنتروپیک برای برنامه‌های حساس به تأخیر (مانند دستیارهای صوتی، بات‌های خدمات مشتری و ابزارهای کدنویسی زنده) کردند.

این‌ها محصولات حاشیه‌ای نیستند؛ بلکه مدل‌هایی هستند که توسعه‌دهندگان سازمانی برای بهینه‌سازی تجربه کاربر و درآمد به سراغشان می‌روند، زیرا در این موارد، زمان پاسخگویی مستقیماً بر درآمد تأثیر می‌گذارد. اوپن‌ای‌آی با مشاهده این روند، واکنش نشان داد. منطق تجاری ساده است: توسعه‌دهندگانی که برنامه‌های آنی می‌سازند، به پاسخ‌هایی در حد میلی‌ثانیه و در مقیاس بالا نیاز دارند، بدون اینکه کاربر منتظر بماند.

اوپن‌ای‌آی با ارائه قدرت مدل پرچم‌دار در سرعت‌های زیر یک ثانیه، در حال دفاع از جایگاه خود به عنوان لایه‌ی زیرساختی پیش‌فرض برای محصولات AI-native است. شرکت اذعان کرد که «رسیدن به سرعت آنی معمولاً به معنای انتخاب یک مدل کوچک‌تر یا تخصصی‌تر بود»، که به‌طور غیرمستقیم تایید می‌کند توسعه‌دهندگان برای پروژه‌های حساس به تأخیر، GPT-5.6 Sol را کنار می‌گذاشتند.

بنابراین Ultrafast یک بازی برای حفظ درآمد API است. توسعه‌دهندگانی که استنتاج را در برنامه‌های تولیدی ادغام می‌کنند، درآمدی مستمر و حجیم ایجاد می‌کنند که هزینه‌های زیرساختی را بسیار مطمئن‌تر از مشترکین فردی پوشش می‌دهد. از دست دادن این توسعه‌دهندگان به نفع Gemini Flash یا Claude Haiku یک ریسک درآمدی ساختاری را برای اوپن‌ای‌آی ایجاد می‌کرد.

موازنه پنهان کیفیت

برای کاربر معمولی، خطر ایجاد یک «دینامیک کیفی دو لایه» وجود دارد. سرعت هزینه‌ای دارد و Ultrafast این هزینه را ساختاری می‌کند. این حالت سریع است چون محدود شده است، نه به این دلیل که تضاد بنیادی میان سرعت تولید و عمق پاسخ را حل کرده باشد.

از آنجا که مدل به‌طور صریح اعلام نمی‌کند چه زمانی به سقف ۷۵۰ توکن رسیده است، ممکن است پاسخ دقیقاً در جایی که محدودیت اعمال شده، قطع شود، بدون اینکه کاربر متوجه شود مدل «بنزینش تمام شده است» یا به انتهای مسیر رسیده است.

کاربران ممکن است یک تحلیل سطحی را به عنوان یک پاسخ کامل بپذیرند، صرفاً چون آن پاسخ فوراً رسیده است. تحلیل سطحی وقتی نسخه‌ی کامل‌تر را نبینید، شبیه تحلیل عادی به نظر می‌رسد. این یعنی یک مدل واحد، بسته به مود فعال، عمق‌های متفاوتی از بینش را ارائه می‌دهد، بدون اینکه کاربر لزوماً دلیل آن را بداند. کاربران حرفه‌ای که محدودیت‌های توکن را می‌شناسند، خودشان انتخاب می‌کنند، اما کاربران عادی احتمالاً کاهش کیفیت را همزمان با افزایش سرعت می‌پذیرند.

چه کسی از کدام حالت استفاده کند؟

کارکنان دانشی — از جمله پژوهشگران، برنامه‌نویسان و کسانی که قرارداد می‌نویسند — باید از Ultrafast برای وظایف پیچیده دوری کنند. سقف ۷۵۰ توکن دقیقاً در جایی که بیشترین اهمیت را دارد (مثلاً وسط یک توضیح پیچیده کد یا خلاصه پژوهشی چندبخشی) به یک مانع سخت تبدیل می‌شود. قطع شدن پاسخ در میانه راه، کاربر را مجبور به ارسال پرامپت‌های تکمیلی می‌کند که تمام زمان ذخیره شده در سرعت اولیه را می‌بلعد. برای این موارد، پردازش استاندارد GPT-5.6 Sol تنها گزینه عملی باقی می‌ماند.

در مقابل، کسانی که از هوش مصنوعی برای پرس‌وجوهای محاوره‌ای، جست‌وجوهای سریع یا گردش‌کارهای پشتیبانی آنی استفاده می‌کنند، این حالت را تحول‌آفرین خواهند یافت. در سرعت ۷۵۰ توکن در ثانیه، آن وقفه بصری که باعث می‌شود AI مکانیکی به نظر برسد، از بین می‌رود و اصطکاکی که تعاملات فعلی را به مجموعه‌ای از «درخواست و انتظار» تبدیل کرده بود، حذف می‌شود.

هنوز مشخص نیست که این حالت برای همه کاربران در دسترس است یا محدود به مشترکین Plus، Pro و API. تمرکز اعلان اوپن‌ای‌آی بر قابلیت‌ها بود، نه دسترسی. اگر دسترسی محدود باشد، تأثیر عملی آن تنها به کاربران قدرتمند با پرداخت بالا و توسعه‌دهندگان API محدود خواهد شد که بیشترین درآمد مستمر را برای اوپن‌ای‌آی ایجاد می‌کنند.

آنچه باید دنبال کرد

سه پرسش کلیدی تعیین می‌کند که آیا ادعای ۱۴ برابری فراتر از اعلان اولیه باقی می‌ماند یا خیر:

  • سقف توکن: آیا محدودیت ۷۵۰ توکن دائمی است یا یک نقطه شروع محافظه‌کارانه؟ اگر این مقدار قابل تنظیم شود یا افزایش یابد، ممکن است تأخیرهای واقعی کمتر شود اما موازنه‌های کیفی جدیدی ظاهر شوند.
  • بنچمارک‌های مستقل: عدد ۱۴ برابر یک معیار بازاریابی از اندازه‌گیری‌های خود اوپن‌ای‌آی است. پژوهشگران شخص ثالث هنوز تست‌های رودررو با GPT-5.6 Sol استاندارد یا رقبای گوگل و آنتروپیک منتشر نکرده‌اند. سرعت در دنیای واقعی با شرایط شبکه، بار سرور و پیچیدگی پرامپت تغییر می‌کند.
  • واکنش رقبا: اوپن‌ای‌آی با نام‌گذاری یک سطح سرعت به عنوان «Ultrafast»، دسته‌بندی جدیدی ایجاد کرد. در حالی که Gemini و Claude گزینه‌های سریع دارند، هیچ‌کدام مودی با نام خاص و عدد توکن در ثانیه بازاریابی نمی‌کنند.

لایه بندی مدل‌ها بر اساس مود (Mode-based tiering)، که در آن کاربر در لحظه استفاده بین سرعت، عمق و هزینه انتخاب می‌کند، در حال تبدیل شدن به معماری استاندارد رابط‌های LLM است. اوپن‌ای‌آی با یک ادعای نام‌گذاری شده و عددی پیش‌دستی کرد؛ ماه‌های آینده نشان خواهد داد که آیا رقبا با همین چارچوب پاسخ می‌دهند یا متدولوژی آن را به چالش می‌کشند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، در API خود حالت Ultrafast را برای توابع «پاسخ سریع» (Quick Reply) تست کنید تا نرخ ریزش کاربر در انتظار پاسخ را بسنجید.
  • برای وظایف تحلیلی، همچنان از حالت استاندارد استفاده کنید تا با قطع شدن ناگهانی پاسخ در سقف ۷۵۰ توکن مواجه نشوید.
  • تغییر در رفتار مدل هنگام رسیدن به سقف توکن را رصد کنید تا متوجه شوید آیا مدل تلاش می‌کند پاسخ را خلاصه کند یا صرفاً آن را قطع می‌کند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار زیرساختی اوپن‌ای‌آی، تلاش می‌کند جلوی مهاجرت توسعه‌دهندگان به مدل‌های سبک‌تر رقیب را بگیرد. در واقع، سرعت اکنون به عنوان یک ویژگی رقابتی در سطح سازمانی (Enterprise) تعریف شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به این مود در محیط تولید محدود است، اما برای کاربرانی که از طریق واسط‌ها به ChatGPT دسترسی دارند، سرعت پاسخ‌دهی در چت‌های کوتاه به‌طور محسوسی افزایش می‌یابد.

·نگاه ما
تحریریه دات‌هوش

تمرکز اوپن‌ای‌آی بر سرعت در سطح API نشان می‌دهد که جنگ مدل‌ها از «باهوش‌ترین بودن» به «کاربردی‌ترین بودن در مقیاس» تغییر مسیر داده است. این حرکت عملاً پذیرشی از این واقعیت است که برای بسیاری از کاربردهای تجاری، تأخیر (Latency) مهم‌تر از دقت در حد چند درصد است. احتمالاً در آینده شاهد مدل‌هایی خواهیم بود که به‌طور پویا بین مودهای سرعت و عمق جابه‌جا می‌شوند تا هزینه استنتاج را بهینه کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.