پرش به محتوای اصلی
پرش به محتوای مقاله

معماری دوطرفه GPT-Live تأخیر در مکالمات صوتی هوش مصنوعی را حذف کرد

·۱۸ تیر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
چت‌جی‌پی‌تی اکنون همزمان می‌تواند گوش دهد و صحبت کند، مکالمات هوش مصنوعی را انسانی‌تر می‌کند.
چت‌جی‌پی‌تی اکنون همزمان می‌تواند گوش دهد و صحبت کند، مکالمات هوش مصنوعی را انسانی‌تر می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی معماری نوبتی (Turn-based) با معماری دوطرفه (Full-Duplex) که امکان شنیدن و گفتن هم‌زمان را فراهم کرده و لایهٔ مدیریت گفتگو را از موتور استدلال تفکیک کرده است.

تصور کنید با دستیاری صحبت می‌کنید که دقیقاً می‌داند چه زمانی سکوت کند، کجا میان حرف شما بپرد و چطور با یک «اوم‌هم» ساده نشان دهد که به شما گوش می‌دهد. این دیگر یک رویای علمی نیست، بلکه خروجی مدل جدید GPT-Live است که مرز میان ابزار و هم‌صحبت را می‌شکند.

به نقل از OpenAI، تفاوت بنیادین این مدل در معماری دوطرفه (Full-Duplex) آن است. در سیستم‌های صوتی سنتی هوش مصنوعی، تعامل بر اساس یک چرخهٔ «سخن گفتن و منتظر ماندن» (Turn-based) بود؛ یعنی مدل باید ابتدا حرف شما را تمام می‌کرد، پردازش می‌نمود و سپس پاسخ می‌داد. اما GPT-Live — شبیه به یک مکالمهٔ واقعی در دنیای فیزیکی که در آن دو نفر می‌توانند هم‌زمان صدا تولید کنند — اجازه می‌دهد مدل هم‌زمان که می‌شنود، تحلیل کند و پاسخ دهد. این تغییر ساختاری، یک جریان مکالمه‌ای روان و ارگانیک ایجاد می‌کند که به‌شدت شبیه به تعامل انسان با انسان است.

همان‌طور که در تحلیل‌های پیشین ما دربارهٔ تکامل رابط‌های کاربری صوتی اشاره کردیم، چالش اصلی همواره «تأخیر» یا همان لگ بوده است. GPT-Live با اتخاذ تصمیمات میکرو چندین بار در هر ثانیه، تعیین می‌کند که آیا باید به صحبت ادامه دهد، برای شنیدن مکث کند، کاربر را قطع کند یا یک ابزار خاص را برای ارائه اطلاعات فعال نماید. این رویکرد، تکاملی چشمگیر در نحوه تعامل کاربران با هوش مصنوعی از طریق صداست.

طبق گزارش این شرکت، جزئیات فنی و مدل‌های توزیع این به‌روزرسانی شامل موارد زیر است:

  • عرضه مدل GPT-Live-1: این نسخه برای کاربران حرفه‌ای طراحی شده و برای کسانی است که دارای طرح‌های اشتراکی Go, Plus و Pro هستند.
  • عرضه مدل GPT-Live-1 mini: این نسخه برای دسترسی گسترده‌تر، برای کاربران حساب‌های رایگان در حال استقرار است.
  • سازگاری کامل با iOS، اندروید و وب از طریق وب‌سایت ChatGPT.com.
  • بازطراحی کتابخانهٔ ۹ صوتی موجود برای سازگاری بهتر با ظرافت‌های سیستم دوطرفه.
  • دسترسی API: OpenAI اعلام کرده است که دسترسی برای توسعه‌دهندگان به‌زودی فراهم می‌شود و در حال حاضر فرآیند ثبت‌نام برای مدیریت عرضه فعال است.

ربات چت‌جی‌پی‌تی اکنون همزمان می‌شنود و صحبت می‌کند؛ گفتگو با هوش مصنوعی انسان‌وارتر شده است.

برای افزایش واقع‌گرایی و اصالت تعاملات، این مدل از نشانه‌های مکالمه‌ای طبیعی استفاده می‌کند. هوش مصنوعی اکنون می‌تواند از عبارات پرکننده (Filler phrases) مانند «mhm» یا «got it» (فهمیدم) استفاده کند تا بدون اینکه تسلط بر گفتگو را از کاربر بگیرد، فعال بودن گوش خود را اعلام کند. کاربر اکنون تشویق می‌شود که طبیعی‌تر رفتار کند؛ به این معنا که می‌تواند در میانه‌ی جمله‌ی مدل بپرد، برای جمع‌بندی افکارش مکث کند یا در لحظه از مدل بخواهد سرعت صحبتش را تغییر دهد. این سطح از پاسخ‌دهی، جهشی بزرگ نسبت به حالت Advanced Voice Mode قدیمی است و حس حضور و توجهی را ایجاد می‌کند که پیش‌تر در رابط‌های صوتی AI غایب بود.

داده‌های تست‌های داخلی OpenAI ترجیح شدید کاربران برای این معماری جدید را تایید می‌کند. طبق اعلام این شرکت، در ۷۵.۷ درصد از موارد تست، کاربران مدل GPT-Live-1 را به Advanced Voice Mode ترجیح دادند. در مورد نسخه سبک‌تر، مدل GPT-Live-1 mini در ۶۹.۲ درصد موارد ترجیح داده شد. این آمارها نشان‌دهنده تقاضای بالای کاربران برای تأخیر کمتر و دینامیک‌های مکالمه‌ای بصری‌تر و شهودی‌تر در دستیاران هوشمند است.

یک لایهٔ بصری نیز به این تجربه اضافه شده است. این به‌روزرسانی شامل «کارت‌های بصری» است که هنگام گفتگو روی صفحه ظاهر می‌شوند. این کارت‌ها داده‌های لحظه‌ای برای پرس‌وجوهای رایج را ارائه می‌دهند؛ برای مثال، به‌روزرسانی‌های وضعیت آب‌وهوا، نوسانات قیمت سهام یا نتایج زنده مسابقات ورزشی. این قابلیت اجازه می‌دهد کاربر در حالی که توضیحات صوتی AI را می‌شنود، داده‌های دقیق را به‌طور بصری مشاهده کند.

بر اساس مستندات فنی، یکی از حیاتی‌ترین تغییرات معماری، جداسازی مدیریت گفتگو از استدلال عمیق است. لایهٔ GPT-Live مسئول واکنش‌های سریع و نیازهای کم-تأخیر در یک چت زنده است، اما وظایف پیچیده و استدلال‌های سنگین را در پس‌زمینه به مدل GPT-5.5 می‌سپارد. این تفکیک باعث می‌شود مدل در مواجهه با سوالات دشوار، دچار «لگ» یا سکوت‌های طولانی و آزاردهنده نشود؛ در واقع لایه مکالمه تعامل را نرم نگه می‌دارد در حالی که مدل قدرتمندتر در حال پردازش منطق پاسخ است. این رویکرد ترکیبی (Hybrid)، شکاف هوشمندی را که اغلب سیستم‌های صوتی آنی را دچار مشکل می‌کند، به‌طور مؤثری می‌پوشاند.

البته هنوز محدودیت‌هایی وجود دارد. در حال حاضر GPT-Live از تعاملات صوتی ترکیبی با ویدیو یا اشتراک صفحه پشتیبانی نمی‌کند، هرچند OpenAI تایید کرده که این قابلیت‌ها به‌زودی اضافه خواهند شد. در این فاصله، حالت‌های قدیمی یعنی Standard و Advanced Voice Mode برای کاربرانی که به‌طور خاص به آن قابلیت‌ها نیاز دارند، در دسترس باقی می‌مانند. همان‌طور که OpenAI تعادل بین سرعت و هوشمندی را اصلاح می‌کند، GPT-Live گامی محوری به سوی هوش مصنوعی است که کمتر شبیه به یک ابزار و بیشتر شبیه به یک همکار به نظر برسد.

گام بعدی شما

  • اگر کاربر Plus هستید، در تنظیمات صوتی ChatGPT، مدل جدید را برای مدیریت جلسات طوفان فکری امتحان کنید.
  • توسعه‌دهندگان را توصیه می‌کنیم در لیست انتظار API ثبت‌نام کنند تا قابلیت‌های Full-Duplex را در اپلیکیشن‌های خود پیاده کنند.
  • تفاوت سرعت پاسخ‌دهی مدل Mini را با نسخه اصلی در محیط‌های پر سر و صدا بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر معماری، استانداردهای تعامل انسان و ماشین را از حالت «فرمان و پاسخ» به «همکاری زنده» تغییر می‌دهد. اعتبار این ادعا را می‌توان در نرخ پذیرش ۷۵.۷ درصدی کاربران در تست‌های OpenAI دید که نشان از نیاز شدید بازار به کاهش تأخیر دارد.

تأثیر برای ایران

دسترسی به نسخه‌های جدید GPT-Live همچنان نیازمند تغییر IP و حساب‌های غیرایرانی است، اما برای توسعه‌دهندگان داخلی، باز شدن API این مدل فرصتی برای ساخت دستیارهای صوتی فارسی با تأخیر بسیار کم خواهد بود.

·نگاه ما
تحریریه دات‌هوش

تفکیک لایهٔ واکنش سریع از لایهٔ استدلال (GPT-5.5)، هوشمندانه ترین بخش این معماری است. OpenAI پذیرفته است که یک مدل تک‌سایز نمی‌تواند هم‌زمان «سریع» و «عمیق» باشد؛ بنابراین با ایجاد یک سیستم ترکیبی، توهم سرعت را در لایهٔ رابط کاربری حفظ کرده و پردازش سنگین را به لایه‌ای دیگر منتقل کرده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.