۰.۷۹۸ ثانیه؛ این تنها زمانی است که طول میکشد تا یک عامل صوتی، بهجای شبیه بودن به ماشین، شبیه به یک انسان واقعی پاسخ دهد. در ۱۰ سپتامبر ۲۰۲۶، شرکت OpenAI مدل GPT-Live-1 را در API خود عرضه کرد و قیمت لایه صوتی front-end آن را ۰.۰۵ دلار برای هر دقیقه تعیین نمود. این اقدام در راستای استراتژی کلان شرکت برای تقریب مکالمه به انسان صورت گرفته است تا فاصله میان تعاملات ماشینی و انسانی به حداقل برسد.
بیشتر دستیارهای صوتی فعلی از یک زنجیره کند و تکهتکه استفاده میکنند: آنها ابتدا گفتار را به متن تبدیل میکنند (STT)، آن را از طریق یک مدل استدلالی پردازش کرده و سپس متن را دوباره به گفتار برمیگردانند (TTS). این جابهجایی مداوم، همان ریتم «توقف-شروع» آزاردهندهای را میسازد که کاربران از آن متنفرند. هر مرحله از این انتقال، تأخیر را افزایش میدهد و فرصتهای بیشتری برای از دست رفتن زمانبندی، بافتار (Context) یا ریتم طبیعی یک مکالمه ایجاد میکند. همانطور که در تحلیل قبلی ما دربارهی شکست عاملهای هوش مصنوعی در اجرای گرافیکی پیچیده در فروشگاههای آنلاین اشاره کردیم، این حرکت نشان میدهد که اکنون اولویت OpenAI از خروجی خام به سمت «روانی» (Fluidity) رابط کاربری تغییر کرده است.
تصور کنید در یک تماس پشتیبانی مشتری، بتوانید حرف عامل را در وسط جمله قطع کنید، یا معلمی داشته باشید که دقیقاً میفهمد چه زمانی برای فکر کردن مکث کردهاید. GPT-Live-1 این کار را با مدیریت همزمان شنیدن و صحبت کردن در یک مدل واحد انجام میدهد که روی صوت در لحظه (Real-time) استدلال میکند.
زمینه و تکامل
مدل GPT-Live نخستین بار در ۸ ژوئیه ۲۰۲۶ بهعنوان موتور محرک ChatGPT Voice معرفی شد. در آن تاریخ، OpenAI نسخههای GPT-Live-1 و GPT-Live-1 mini را برای کاربران جهانی منتشر کرد. نسخه اصلی برای کاربران Go، Plus و Pro پیشفرض شد و نسخه mini در اختیار کاربران رایگان قرار گرفت.
انتشار این مدل در قالب API، این سامانه مکالمهای را به برنامههای شخص ثالث و جریانهای کاری تجاری گسترش میدهد. این قابلیت به مدل اجازه میدهد همزمان بشنود و صحبت کند و استدلالهای عمیقتر و اقدامات اجرایی را به ابزارهای جفتشده، مانند Codex و ChatGPT Work بسپارد.
معماری فنی و شخصیسازی
برخلاف مدلهای نوبتی (Turn-based)، GPT-Live-1 از ساختار «دوطرفه» (Full-Duplex) استفاده میکند؛ به این معنا که صوت ورودی و خروجی را بهطور همزمان پردازش میکند. طبق گزارش unite.ai، این مدل استدلالهای عمیق را به ابزارهای پسزمینه (Backend) میسپارد تا جریان مکالمه روان بماند در حالی که کارهای پیچیده در پشت صحنه در حال انجام است.
توسعهدهندگان کنترل قابلتوجهی روی مغز این عامل دارند:
- جفتسازی پسزمینه: توسعهدهندگان میتوانند لایه صوتی را با مدلهایی مثل Luna برای کارهای حجیم (مانند زمانبندی یا بهروزرسانی سفارشات) یا Astra برای مسائل پیچیده مشتریان که نیاز به استدلال عمیق دارند، جفت کنند. همچنین امکان استفاده از مدلهای شخص ثالث به عنوان پسزمینه وجود دارد.
- شخصیسازی: لحن، سرعت و سبک مکالمه از طریق پرامپت سیستمی (System Prompt) مدیریت میشود. توسعهدهندگان میتوانند تجربه کاربری را بر اساس کاربران خاص و اهداف مشخص هدایت کنند.
- زیرساخت: این سامانه از تلفنی پشتیبانی میکند تا عاملهای تلفنی دوطرفه بتوانند همه چیز، از رزرو رستوران تا پشتیبانی مشتری را مدیریت کنند. این سیستم متنهای بازشناسی گفتار (ASR) و متن پاسخها را بهصورت بومی ارائه میدهد.
- کنترلهای پیشرفته: مدل از سوگیری کلمات کلیدی (Keyword Biasing) و درک حروف و اعداد (Alphanumeric Understanding) پشتیبانی میکند. اگرچه این یک مدل نوبتی نیست، اما برای توسعهدهندگانی که به مرزهای صریح نوبت نیاز دارند، قابلیت تشخیص نوبت (Turn Detection) را بهصورت بومی پشتیبانی میکند.
یک قطعه کد منتشرشده این انعطافپذیری را به نمایش میگذارد؛ به گونهای که یک اپلیکیشن، بافتار مکالمه را به Codex منتقل کرده و پاسخ را در حین یک جلسه زنده به GPT-Live-1 بازمیگرداند.
محکهای عملکردی
به نقل از OpenAI، مدل GPT-Live-1 عملکرد Full Duplex Bench را ۳۰ درصد نسبت به GPT-Realtime-2.1 بهبود داده است. چشمگیرترین پیشرفت در تأخیر نوبتگیری است که از ۱.۴۱ ثانیه در GPT-Realtime-2.1 و ۱.۶۳ ثانیه در GPT-Realtime-2، به ۰.۷۹۸ ثانیه کاهش یافته است.
در محک Tau3 Voice Intelligence که وظایف گفتاری خدمات مشتری در حوزههای هواپیمایی، خردهفروشی و مخابرات را میسنجد، GPT-Live-1 به امتیاز موفقیت Pass@1 معادل ۸۶.۲٪ رسید. در مقابل، GPT-Realtime-2.1 امتیاز ۴۵.۷٪ و GPT-Realtime-2 امتیاز ۴۲.۴٪ را کسب کردند. این مدل وقتی با GPT-6 Astra در سطح استدلال متوسط جفت شود، رتبه اول این محک را کسب میکند.
سایر آمارهای گزارششده عبارتاند از:
- دانش بانکی: در محک Tau Banking (Voice) که شامل ۹۷ تکلیف است، GPT-Live-1 موفقیت ۳۲.۰٪ را ثبت کرد، در حالی که این رقم برای GPT-Realtime-2.1 حدود ۱۲.۴٪ و برای GPT-Realtime-2 حدود ۱۰.۳٪ بود.
- پویایی مکالمه: در مقیاس Artificial Analysis برای مدیریت مکثها، قطع کردن حرف و واکنشهای کوتاه (Backchannels)، امتیاز ۹۷.۳٪ را کسب کرد و از GPT-Realtime-2.1 (۹۵.۷٪) و GPT-Realtime-2 (۹۵.۳٪) پیشی گرفت.
- تعاملی بودن: در تست Full Duplex Bench v1.5 Interactivity که واکنش به صدای پسزمینه و واکنشهای شنونده را میسنجد، امتیاز ۸۰.۱۰٪ را به دست آورد، در حالی که نسخههای قبلی ۴۵.۴٪ و ۴۷.۸٪ امتیاز گرفتند.
- فراخوانی ابزار: در Full Duplex Bench v3 (با استفاده از پسزمینه Terra در سطح استدلال پایین)، نرخ موفقیت Pass@1 برای فراخوانی ابزار ۸۷.۰٪ و کیفیت پاسخ ۹۰.۰٪ گزارش شده است که بهطور قابلتوجهی بالاتر از ۶۰.۰٪ و ۸۸.۰٪ در مدلهای پیشین است.
پذیرش سازمانی
پذیرندگان اولیه همین حالا نتایج ملموسی را گزارش کردهاند. الکس لِوی، مدیر فنی Yelp، اشاره کرد که ادغام GPT-Live-1 در سرویسهای Yelp Host و Hatch، نرخ مدیریت تماسها برای رزرو و سفارش غذا را بهبود بخشیده است. لِوی مشاهده کرد که تماسگیرندگان اکنون از جملات کامل و طبیعیتر استفاده میکنند و تجربه «واقعاً متفاوت» است.
سایر کاربردهای صنعتی شامل موارد زیر است:
- Speak: اندرو هسو، یکی از بنیانگذاران، گزارش داد که در درسهای خصوصی (Live Tutor Lessons)، قطع کردن حرف در زمان مکثهای فکری دانشآموزان در مقایسه با سیستمهای نوبتی، ۸۰٪ کاهش یافته است.
- Fin: جردن نیل، مدیر عملیات، بیان کرد که این مدل به مشتریان اجازه میدهد مکث کنند، حرف مدل را قطع کنند و مسیر بحث را تغییر دهند، در حالی که هوش مصنوعی مکالمه را با یک سیستم پشتیبانی اختصاصی جفت میکند.
- Cognition: والدن یان، مدیر محصول، از این مدل در کنار Devin استفاده میکند تا درباره ایدهها بحث کند، رویکردها را به چالش بکشد یا در حالی که دور از کیبورد است، کارها را تحویل دهد.
ایمنی و مقیاسپذیری
برای مقابله با جعل عمیق (Deepfake)، OpenAI در ۳۱ ژوئیه ۲۰۲۶ نشانگذاری SynthID را به تمام صداهای تولیدی از طریق GPT-Live اضافه کرد. این اقدام شامل دسترسی به یک ابزار تأیید عمومی برای کاربران API است.
برای سازمانهای بزرگ، OpenAI محصول OpenAI Presence را در ۲۲ ژوئیه ۲۰۲۶ معرفی کرد. این محصول سازمانی از GPT-Live-1 برای ایجاد عاملهایی استفاده میکند که به سوالات پاسخ میدهند، از سیستمهای داخلی شرکت استفاده میکنند و در صورت نیاز تماس را به انسان ارجاع میدهند. این سرویس یک محصول self-serve (خودکار) نیست و از طریق یک برنامه دسترسی محدود تحت هدایت مهندسان Forward Deployed و یکپارچهسازان سیستمهای جهانی ارائه میشود.
OpenAI اکنون در حال گسترش کتابخانه صداهای خود برای پوشش لهجهها، گویشها و زبانهای بیشتر است. دسترسی به صداهای سفارشی همچنان محدود است و نیاز به درخواست مستقیم از بخش فروش OpenAI دارد. شرکت قصد دارد گزینههای صوتی و دسترسی به زبانها را در ماههای آینده گسترش دهد.
این چرخش به سمت استدلال بومی صوتی نشان میدهد که عصر «چتباتها» در حال پایان است. ما به سمت عاملهای «صوتمحور» (Voice-first) میرویم که میتوانند هرجومرج صداهای دنیای واقعی و قطع کردنهای انسانی را بدون خارج شدن از نقش مدیریت کنند.
باید منتظر ماند و دید این تحول چگونه بر بازار سختافزار تأثیر میگذارد؛ بهویژه اینکه آیا گجتهای پوشیدنیِ AI-native جایگزین صفحه نمایش بهعنوان رابط اصلی برای این عاملهای کمتأخیر خواهند شد یا خیر.




گفتگو