پرش به محتوای اصلی
پرش به محتوای مقاله

تأخیر پاسخ‌دهی GPT-Live-1 به ۰.۷۹۸ ثانیه رسید

·۲۰ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
لوگوی OpenAI در کنار نماد پخش زنده و برچسب قیمت ۰.۰۵ دلار بر دقیقه
لوگوی OpenAI در کنار نماد پخش زنده و برچسب قیمت ۰.۰۵ دلار بر دقیقه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی زنجیره «گفتار-متن-استدلال-گفتار» با یک مدل واحد استدلالی روی صوت که تأخیر را از ۱.۴ ثانیه به ۰.۷۹ ثانیه رسانده است.

۰.۷۹۸ ثانیه؛ این تنها زمانی است که طول می‌کشد تا یک عامل صوتی، به‌جای شبیه بودن به ماشین، شبیه به یک انسان واقعی پاسخ دهد. در ۱۰ سپتامبر ۲۰۲۶، شرکت OpenAI مدل GPT-Live-1 را در API خود عرضه کرد و قیمت لایه صوتی front-end آن را ۰.۰۵ دلار برای هر دقیقه تعیین نمود. این اقدام در راستای استراتژی کلان شرکت برای تقریب مکالمه به انسان صورت گرفته است تا فاصله میان تعاملات ماشینی و انسانی به حداقل برسد.

بیشتر دستیارهای صوتی فعلی از یک زنجیره کند و تکه‌تکه استفاده می‌کنند: آن‌ها ابتدا گفتار را به متن تبدیل می‌کنند (STT)، آن را از طریق یک مدل استدلالی پردازش کرده و سپس متن را دوباره به گفتار برمی‌گردانند (TTS). این جابه‌جایی مداوم، همان ریتم «توقف-شروع» آزاردهنده‌ای را می‌سازد که کاربران از آن متنفرند. هر مرحله از این انتقال، تأخیر را افزایش می‌دهد و فرصت‌های بیشتری برای از دست رفتن زمان‌بندی، بافتار (Context) یا ریتم طبیعی یک مکالمه ایجاد می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی شکست عامل‌های هوش مصنوعی در اجرای گرافیکی پیچیده در فروشگاه‌های آنلاین اشاره کردیم، این حرکت نشان می‌دهد که اکنون اولویت OpenAI از خروجی خام به سمت «روانی» (Fluidity) رابط کاربری تغییر کرده است.

تصور کنید در یک تماس پشتیبانی مشتری، بتوانید حرف عامل را در وسط جمله قطع کنید، یا معلمی داشته باشید که دقیقاً می‌فهمد چه زمانی برای فکر کردن مکث کرده‌اید. GPT-Live-1 این کار را با مدیریت هم‌زمان شنیدن و صحبت کردن در یک مدل واحد انجام می‌دهد که روی صوت در لحظه (Real-time) استدلال می‌کند.

زمینه و تکامل

مدل GPT-Live نخستین بار در ۸ ژوئیه ۲۰۲۶ به‌عنوان موتور محرک ChatGPT Voice معرفی شد. در آن تاریخ، OpenAI نسخه‌های GPT-Live-1 و GPT-Live-1 mini را برای کاربران جهانی منتشر کرد. نسخه اصلی برای کاربران Go، Plus و Pro پیش‌فرض شد و نسخه mini در اختیار کاربران رایگان قرار گرفت.

انتشار این مدل در قالب API، این سامانه مکالمه‌ای را به برنامه‌های شخص ثالث و جریان‌های کاری تجاری گسترش می‌دهد. این قابلیت به مدل اجازه می‌دهد هم‌زمان بشنود و صحبت کند و استدلال‌های عمیق‌تر و اقدامات اجرایی را به ابزارهای جفت‌شده، مانند Codex و ChatGPT Work بسپارد.

معماری فنی و شخصی‌سازی

برخلاف مدل‌های نوبتی (Turn-based)، GPT-Live-1 از ساختار «دوطرفه» (Full-Duplex) استفاده می‌کند؛ به این معنا که صوت ورودی و خروجی را به‌طور هم‌زمان پردازش می‌کند. طبق گزارش unite.ai، این مدل استدلال‌های عمیق را به ابزارهای پس‌زمینه (Backend) می‌سپارد تا جریان مکالمه روان بماند در حالی که کارهای پیچیده در پشت صحنه در حال انجام است.

توسعه‌دهندگان کنترل قابل‌توجهی روی مغز این عامل دارند:

  • جفت‌سازی پس‌زمینه: توسعه‌دهندگان می‌توانند لایه صوتی را با مدل‌هایی مثل Luna برای کارهای حجیم (مانند زمان‌بندی یا به‌روزرسانی سفارشات) یا Astra برای مسائل پیچیده مشتریان که نیاز به استدلال عمیق دارند، جفت کنند. همچنین امکان استفاده از مدل‌های شخص ثالث به عنوان پس‌زمینه وجود دارد.
  • شخصی‌سازی: لحن، سرعت و سبک مکالمه از طریق پرامپت سیستمی (System Prompt) مدیریت می‌شود. توسعه‌دهندگان می‌توانند تجربه کاربری را بر اساس کاربران خاص و اهداف مشخص هدایت کنند.
  • زیرساخت: این سامانه از تلفنی پشتیبانی می‌کند تا عامل‌های تلفنی دوطرفه بتوانند همه چیز، از رزرو رستوران تا پشتیبانی مشتری را مدیریت کنند. این سیستم متن‌های بازشناسی گفتار (ASR) و متن پاسخ‌ها را به‌صورت بومی ارائه می‌دهد.
  • کنترل‌های پیشرفته: مدل از سوگیری کلمات کلیدی (Keyword Biasing) و درک حروف و اعداد (Alphanumeric Understanding) پشتیبانی می‌کند. اگرچه این یک مدل نوبتی نیست، اما برای توسعه‌دهندگانی که به مرزهای صریح نوبت نیاز دارند، قابلیت تشخیص نوبت (Turn Detection) را به‌صورت بومی پشتیبانی می‌کند.

یک قطعه کد منتشرشده این انعطاف‌پذیری را به نمایش می‌گذارد؛ به گونه‌ای که یک اپلیکیشن، بافتار مکالمه را به Codex منتقل کرده و پاسخ را در حین یک جلسه زنده به GPT-Live-1 بازمی‌گرداند.

محک‌های عملکردی

به نقل از OpenAI، مدل GPT-Live-1 عملکرد Full Duplex Bench را ۳۰ درصد نسبت به GPT-Realtime-2.1 بهبود داده است. چشمگیرترین پیشرفت در تأخیر نوبت‌گیری است که از ۱.۴۱ ثانیه در GPT-Realtime-2.1 و ۱.۶۳ ثانیه در GPT-Realtime-2، به ۰.۷۹۸ ثانیه کاهش یافته است.

در محک Tau3 Voice Intelligence که وظایف گفتاری خدمات مشتری در حوزه‌های هواپیمایی، خرده‌فروشی و مخابرات را می‌سنجد، GPT-Live-1 به امتیاز موفقیت Pass@1 معادل ۸۶.۲٪ رسید. در مقابل، GPT-Realtime-2.1 امتیاز ۴۵.۷٪ و GPT-Realtime-2 امتیاز ۴۲.۴٪ را کسب کردند. این مدل وقتی با GPT-6 Astra در سطح استدلال متوسط جفت شود، رتبه اول این محک را کسب می‌کند.

سایر آمارهای گزارش‌شده عبارت‌اند از:

  • دانش بانکی: در محک Tau Banking (Voice) که شامل ۹۷ تکلیف است، GPT-Live-1 موفقیت ۳۲.۰٪ را ثبت کرد، در حالی که این رقم برای GPT-Realtime-2.1 حدود ۱۲.۴٪ و برای GPT-Realtime-2 حدود ۱۰.۳٪ بود.
  • پویایی مکالمه: در مقیاس Artificial Analysis برای مدیریت مکث‌ها، قطع کردن حرف و واکنش‌های کوتاه (Backchannels)، امتیاز ۹۷.۳٪ را کسب کرد و از GPT-Realtime-2.1 (۹۵.۷٪) و GPT-Realtime-2 (۹۵.۳٪) پیشی گرفت.
  • تعاملی بودن: در تست Full Duplex Bench v1.5 Interactivity که واکنش به صدای پس‌زمینه و واکنش‌های شنونده را می‌سنجد، امتیاز ۸۰.۱۰٪ را به دست آورد، در حالی که نسخه‌های قبلی ۴۵.۴٪ و ۴۷.۸٪ امتیاز گرفتند.
  • فراخوانی ابزار: در Full Duplex Bench v3 (با استفاده از پس‌زمینه Terra در سطح استدلال پایین)، نرخ موفقیت Pass@1 برای فراخوانی ابزار ۸۷.۰٪ و کیفیت پاسخ ۹۰.۰٪ گزارش شده است که به‌طور قابل‌توجهی بالاتر از ۶۰.۰٪ و ۸۸.۰٪ در مدل‌های پیشین است.

پذیرش سازمانی

پذیرندگان اولیه همین حالا نتایج ملموسی را گزارش کرده‌اند. الکس لِوی، مدیر فنی Yelp، اشاره کرد که ادغام GPT-Live-1 در سرویس‌های Yelp Host و Hatch، نرخ مدیریت تماس‌ها برای رزرو و سفارش غذا را بهبود بخشیده است. لِوی مشاهده کرد که تماس‌گیرندگان اکنون از جملات کامل و طبیعی‌تر استفاده می‌کنند و تجربه «واقعاً متفاوت» است.

سایر کاربردهای صنعتی شامل موارد زیر است:

  • Speak: اندرو هسو، یکی از بنیان‌گذاران، گزارش داد که در درس‌های خصوصی (Live Tutor Lessons)، قطع کردن حرف در زمان مکث‌های فکری دانش‌آموزان در مقایسه با سیستم‌های نوبتی، ۸۰٪ کاهش یافته است.
  • Fin: جردن نیل، مدیر عملیات، بیان کرد که این مدل به مشتریان اجازه می‌دهد مکث کنند، حرف مدل را قطع کنند و مسیر بحث را تغییر دهند، در حالی که هوش مصنوعی مکالمه را با یک سیستم پشتیبانی اختصاصی جفت می‌کند.
  • Cognition: والدن یان، مدیر محصول، از این مدل در کنار Devin استفاده می‌کند تا درباره ایده‌ها بحث کند، رویکردها را به چالش بکشد یا در حالی که دور از کیبورد است، کارها را تحویل دهد.

ایمنی و مقیاس‌پذیری

برای مقابله با جعل عمیق (Deepfake)، OpenAI در ۳۱ ژوئیه ۲۰۲۶ نشان‌گذاری SynthID را به تمام صداهای تولیدی از طریق GPT-Live اضافه کرد. این اقدام شامل دسترسی به یک ابزار تأیید عمومی برای کاربران API است.

برای سازمان‌های بزرگ، OpenAI محصول OpenAI Presence را در ۲۲ ژوئیه ۲۰۲۶ معرفی کرد. این محصول سازمانی از GPT-Live-1 برای ایجاد عامل‌هایی استفاده می‌کند که به سوالات پاسخ می‌دهند، از سیستم‌های داخلی شرکت استفاده می‌کنند و در صورت نیاز تماس را به انسان ارجاع می‌دهند. این سرویس یک محصول self-serve (خودکار) نیست و از طریق یک برنامه دسترسی محدود تحت هدایت مهندسان Forward Deployed و یکپارچه‌سازان سیستم‌های جهانی ارائه می‌شود.

OpenAI اکنون در حال گسترش کتابخانه صداهای خود برای پوشش لهجه‌ها، گویش‌ها و زبان‌های بیشتر است. دسترسی به صداهای سفارشی همچنان محدود است و نیاز به درخواست مستقیم از بخش فروش OpenAI دارد. شرکت قصد دارد گزینه‌های صوتی و دسترسی به زبان‌ها را در ماه‌های آینده گسترش دهد.

این چرخش به سمت استدلال بومی صوتی نشان می‌دهد که عصر «چت‌بات‌ها» در حال پایان است. ما به سمت عامل‌های «صوت‌محور» (Voice-first) می‌رویم که می‌توانند هرج‌ومرج صداهای دنیای واقعی و قطع کردن‌های انسانی را بدون خارج شدن از نقش مدیریت کنند.

باید منتظر ماند و دید این تحول چگونه بر بازار سخت‌افزار تأثیر می‌گذارد؛ به‌ویژه اینکه آیا گجت‌های پوشیدنیِ AI-native جایگزین صفحه نمایش به‌عنوان رابط اصلی برای این عامل‌های کم‌تأخیر خواهند شد یا خیر.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار فنی OpenAI در مدل‌های چندوجهی، باعث می‌شود رابط‌های صوتی از ابزارهای کمکی به جایگزین‌های واقعی برای تماس‌های تلفنی تبدیل شوند. این تغییر، مدل‌های متنی سنتی را در کاربردهای تعاملی به حاشیه می‌راند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به GPT-Live-1 دشوار است، اما این مدل استاندارد جدیدی برای پیاده‌سازی عامل‌های صوتی فارسی در آینده تعیین می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز OpenAI بر کاهش تأخیر به زیر یک ثانیه، در واقع تلاش برای شکستن سد روان‌شناختی «درک ماشین» است. وقتی تأخیر به زیر ۸۰۰ میلی‌ثانیه می‌رسد، مغز انسان دیگر متوجه پردازش مدل نمی‌شود و تعامل را «طبیعی» می‌پذیرد. این یعنی رقابت از روی «دقت پاسخ» به سمت «کیفیت حضور» در لحظه تغییر کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.