پرش به محتوای اصلی
پرش به محتوای مقاله

GPT-Live: تفکیک «مغز» از «گوش» برای حذف تأخیر در مکالمات صوتی

·۱۹ تیر ۱۴۰۵۶ دقیقه مطالعه
مدل‌های صوتی تمام‌دوطرفه OpenAI که استدلال عمیق‌تر را به GPT-5.5 واگذار می‌کنند
مدل‌های صوتی تمام‌دوطرفه OpenAI که استدلال عمیق‌تر را به GPT-5.5 واگذار می‌کنند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری دوبلکس کامل (Full-Duplex) که اجازه می‌دهد مدل هم‌زمان بشنود و صحبت کند، در کنار تفویض تکالیف سنگین به مدل پس‌زمینه (GPT-5.5) برای جلوگیری از سکوت‌های طولانی.

تصور کنید با هوش مصنوعی صحبت می‌کنید و دیگر لازم نیست منتظر بمانید تا جمله‌اش تمام شود یا با سکوت‌های طولانی و خجالت‌آور مواجه شوید. اوپن‌ای‌آی (OpenAI) در ۸ جولای ۲۰۲۶ از GPT-Live و نسخهٔ کوچک‌تر آن یعنی GPT-Live-1 mini پرده برداشت تا دوران «گوش دادن، سپس صحبت کردن» را به پایان برساند.

به نقل از وب‌سایت marktechpost.com، این سامانه جدید به مدل اجازه می‌دهد صوت را به‌طور پیوسته پردازش کند. این رویکرد نوآورانه در واقع همان معماری دوطرفه‌ای است که تأخیرهای آزاردهنده در مکالمات صوتی را به‌طور کلی حذف کرده است. نتیجه این است که هوش مصنوعی می‌تواند به‌صورت لحظه‌ای به قطع کردن‌های کاربر واکنش نشان دهد یا از عبارت‌های تکیهگاهی مثل «اوهوم» استفاده کند، حتی وقتی شما هنوز در حال صحبت هستید. هدف اعلام‌شده برای این پروژه، دستیابی به مکالمات طبیعی و در لحظه (Real-time) با هوش مصنوعی است.

این تحول در حالی رخ می‌دهد که اوپن‌ای‌آی به‌شدت در حال ادغام قابلیت‌های استدلالی در محصولات مصرفی خود است. همان‌طور که در تحلیل قبلی ما درباره‌ی جابجایی‌های مدیریتی در این شرکت و خروج فیجی سیمو از نقش استقرار AGI دیدیم، تمرکز این غول فناوری اکنون بر استقرار بی‌وقفه استدلال‌های پیشرو (Frontier) در رابط‌های کاربری روزمره است. برای اکثر کاربران، این یعنی هوش مصنوعی دیگر شبیه به یک بی‌سیم نیست، بلکه مانند همکاری انسانی است که هم‌زمان با گوش دادن، فکر می‌کند. هر دو نسخهٔ این مدل از امروز برای کاربران ChatGPT در سراسر جهان فعال شده‌اند.

تکامل هوش مصنوعی صوتی

برای درک دلیل اهمیت GPT-Live، باید شکست‌های معماری‌های قبلی را بررسی کنیم. سیستم‌های صوتی پیشین با تضاد شدیدی میان تأخیر (Latency) و روانی کلام دست‌وپنجه نرم می‌کردند.

سیستم‌های متوالی (Cascaded)، که نسخهٔ اولیه صدای ChatGPT را می‌راندند، از زنجیره‌ای از سه مدل مجزا استفاده می‌کردند. ابتدا یک مدل بازشناسی گفتار (STT) صوت کاربر را به متن تبدیل می‌کرد. سپس یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — پاسخ متنی می‌ساخت. در نهایت، یک مدل تبدیل متن به گفتار (TTS) این متن را دوباره به صوت تبدیل می‌کرد. این خط لوله باعث می‌شد اطلاعات در مرز مدل‌ها گم شوند و خروجی، تجربه‌ای کند و خشک با مکث‌های طولانی باشد.

مدل‌های نوبتی (Turn-based)، مانند حالت Advanced Voice، با پردازش صوت در یک مدل واحد، تأخیر را کم کردند. اما این سیستم‌ها هنوز نوبتی بودند و برای تشخیص پایان صحبت کاربر، به سکوت او تکیه می‌کردند. چون مکث‌های کوتاه یا نویز محیطی اغلب به عنوان پایان صحبت تلقی می‌شد، هوش مصنوعی در زمان‌های نامناسب کاربر را قطع می‌کرد.

تحلیل مقایسه‌ای معماری‌ها

اوپن‌ای‌آی برای نمایش کیفیت تعامل در GPT-Live، تفاوت‌های این سیستم دوبلکس کامل را در چندین بُعد با نسل‌های پیشین فهرست کرده است تا بهبود کیفیت تعامل را برجسته کند:

  • خط لوله (Pipeline): سیستم‌های متوالی از زنجیره STT $ \rightarrow $ LLM $ \rightarrow $ TTS استفاده می‌کردند؛ مدل‌های نوبتی از تک‌مدل صوتی بهره می‌بردند؛ اما GPT-Live از یک مدل با پردازش پیوسته استفاده می‌کند.
  • مدیریت نوبت: سیستم‌های قبلی نوبتی یا مبتنی بر تشخیص سکوت بودند، اما GPT-Live در هر ثانیه چندین بار دربارهٔ نحوهٔ تعامل تصمیم می‌گیرد.
  • قابلیت شنیدن: هیچ‌کدام از مدل‌های متوالی یا نوبتی نمی‌توانستند هم‌زمان با صحبت کردن، گوش دهند؛ در حالی که GPT-Live می‌تواند هر دو کار را به‌طور هم‌زمان انجام دهد.
  • بازخوردهای کوتاه (Backchannels): عبارت‌های تکیه‌گاهی مثل «اوهوم» در نسخه‌های قبلی غایب بودند، اما اکنون در GPT-Live ادغام شده‌اند.
  • تأخیر: حس کاربر از «کند و خشک» به «سریع، طبیعی و پراحساس» تغییر کرده است.
  • پردازش عمیق: برخلاف مدل‌های قبلی که استدلال را در همان مسیر اصلی (In-line) انجام می‌دادند، GPT-Live تکالیف پیچیده را در پس‌زمینه به مدل GPT-5.5 می‌سپارد.

معماری دوبلکس کامل (Full-Duplex)

GPT-Live با استفاده از معماری دوبلکس کامل، مسیر را تغییر داده است. در اصطلاح فنی، دوبلکس کامل یعنی مدل می‌تواند هم‌زمان گوش دهد و صحبت کند، نه اینکه بین این دو حالت جابه‌جا شود.

  • پردازش پیوسته: مدل در حالی که خروجی تولید می‌کند، ورودی را هم به‌طور هم‌زمان پردازش می‌کند. این سیستم در هر ثانیه چندین بار تصمیمات تعاملی می‌گیرد.
  • تصمیمات پویا: این تصمیمات با فرکانس بالا شامل این است که آیا مدل باید صحبت کند، به گوش دادن ادامه دهد، مکث کند، کاربر را قطع کند یا ابزاری (Tool) را فراخوانی کند. این موضوع باعث درک بهتری از زمان (Sense of time) می‌شود.
  • نشانه‎‌های طبیعی: به دلیل شنیدن هم‌زمان، مدل می‌تواند واکنش‌های کوتاهی مثل «اوهوم»، «آره» یا «متوجهم» بدهد که دقیقاً آینه مکالمات انسانی است.
  • زمان‌بندی و روانی: این رویکرد زمان‌بندی دقیق‌تری ایجاد می‌کند و قابلیت‌هایی مثل ترجمهٔ زنده در حین گفتگو را ممکن می‌سازد.

مکانیسم تفویض استدلال (Delegation)

برای اینکه فرآیند «فکر کردن» باعث توقف مکالمه نشود، اوپن‌ای‌آی تعامل را از استدلال سنگین جدا کرد. این تغییر معماری تضمین می‌کند که روانی صدا به سرعتِ منطق پیچیدهٔ در حال اجرا وابسته نباشد.

طبق اعلام OpenAI، وقتی سؤال پیچیده‌ای می‌پرسید که نیاز به جست‌وجوی وب، استدلال عمیق یا قابلیت‌های عامل‌محور (Agentic) دارد، GPT-Live سکوت نمی‌کند. در عوض، این تکلیف را به یک مدل پیشرو در پس‌زمینه — یعنی GPT-5.5 — می‌سپارد. در حالی که GPT-5.5 در پس‌زمینه کار می‌کند، GPT-Live با عبارت‌هایی مثل «یک لحظه صبر کن، هنوز باهاتم» جریان گفتگو را زنده نگه می‌دارد.

پس از اتمام کار مدل پس‌زمینه، نتیجه بازگردانده شده و در مکالمه جاری بافته و ادغام می‌شود. این طراحی اجازه می‌دهد لایهٔ صوتی بدون نیاز به بازنویسی، با هر مدل پیشرؤ جدیدی که عرضه شود، به‌روزرسانی شود. در واقع، یک جدایی دائمی بین «گوش و دهان» (GPT-Live) و «مغز» (GPT-5.5) ایجاد شده است.

عملکرد و محک‌های ارزیابی

در ارزیابی‌های انسانی، مکالمات ۵ تا ۱۰ دقیقه‌ای مشابه را برای سنجش میزان لذت‌بخش بودن (Pleasantness) و روانی گفتگو بررسی کردند. در این تست‌های رویارویی، کاربران GPT-Live-1 و نسخهٔ mini را به‌شدت به Advanced Voice Mode ترجیح دادند. ارزیابان به‌طور خاص روی مدیریت نوبت‌ها، نحوه قطع‌کردن‌ها و طبیعی بودن تعامل تمرکز کردند.

در تست‌های خودکار، GPT-Live-1 در چندین محک تخصصی پیشرفت‌های قابل‌اندازه‌گیری داشت:

  • GPQA: مدل در استدلال‌های علمی سطح خبره، به‌طور قابل‌توجهی از نسل‌های قبلی بهتر عمل کرد.
  • BrowseComp: پیشرفت‌های زیادی در قابلیت‌های جست‌وجوی وب به‌صورت عامل‌محور (Agentic) نشان داد.
  • τ³-Voice Telecom: در این تست داخلی، GPT-Live-1 در وظایف پشتیبانی مخابراتی با چندین مرحلهٔ گفت‌وگو (Multi-turn)، برتر بود. اوپن‌ای‌آی اشاره کرد که این ارزیابی خاص از یک مدل کاربر سفارشی بهره می‌برد که توسط جدیدترین مدل‌های استدلالی آن‌ها هدایت می‌شد.

کاربران اکنون می‌توانند بین سه سطح استدلال برای این تعاملات انتخاب کنند:

  • Instant (لحظه‌ای): مدل‌های GPT-Live-1 (Instant) و نسخه mini از GPT-5.5 Instant در پس‌زمینه استفاده می‌کنند.
  • Medium (متوسط): استفاده از GPT-5.5 Thinking با تلاش استدلالی متوسط.
  • High (بالا): استفاده از GPT-5.5 Thinking با حداکثر تلاش استدلالی.

کاربردها و ادغام

بیش از ۱۵۰ میلیون کاربر هفتگی ChatGPT Voice و Dictation اکنون به این تجربه دسترسی دارند. با زدن دکمهٔ Voice، موتور GPT-Live فعال می‌شود. این به‌روزرسانی شامل ۹ صدای بازسازی‌شده و امکان نمایش کارت‌های بصری برای سهام، آب‌وهوا و ورزش در حین تماس است.

کاربردهای عملی فعلی عبارتند از:

  • کمک بدون دست: درخواست مراحل آشپزی یا دستورات مسیریابی بدون نیاز به لمس صفحه نمایش.
  • تمرین زبان: برگزاری چت‌های رفت‌وبرگشتی در حالی که هوش مصنوعی اصلاحات ملایمی را انجام می‌دهد.
  • ترجمهٔ زنده: بهره‌گیری از زمان‌بندی دوبلکس کامل برای ترجمهٔ گفتار در حین مکالمات واقعی.
  • پژوهش در مسیر: پرسیدن سؤالات دشوار هنگام رفت‌وآمد در حالی که GPT-5.5 در پس‌زمینه وب را می‌گردد.
  • گردش کارهای پشتیبانی: مدیریت وظایف پیچیده و چند-مرحله‌ای مخابراتی، همان‌طور که در ارزیابی τ³-Voice Telecom تأیید شده است.

اگرچه سیستم از جست‌وجو، حافظه، تصاویر و آپلود فایل پشتیبانی می‌کند، اما برخی ویژگی‌ها مثل ویدیو، اشتراک‌گذاری صفحه و برابری کامل زبانی (Multilingual Parity) در لحظهٔ عرضه فعال نشده‌اند. با این حال، مدل اکنون در محیط‌های پرسرصدا تمرکز بهتری دارد و به‌جای پریدن به داخل مکث‌ها، منتظر کاربر می‌ماند.

نگاه مفهومی به حلقهٔ دوبلکس

هرچند API رسمی هنوز عرضه نشده، اما این معماری بر اساس یک حلقهٔ تصمیم‌گیری عمل می‌کند. در یک محیط شبیه‌سازی‌شده، مدل فریم‌های صوتی را چندین بار در ثانیه ارزیابی می‌کند. اگر تشخیص دهد کاربر در حال صحبت است، بین «گوش دادن» یا «ارائه بازخورد کوتاه» (مثل اوهوم) یکی را انتخاب می‌کند. اگر درخواست نیاز به کار عمیق داشته باشد، یک اکشن «تفویض» (Delegate) به مدل پس‌زمینه (GPT-5.5) ارسال می‌کند و هم‌زمان با کاربر صحبت می‌کند تا ارتباط قطع نشود. پس از آماده شدن نتیجه پس‌زمینه، جریان پاسخ‌دهی عادی از سر گرفته می‌شود.

این تفکیک معماری به اوپن‌ای‌آی اجازه می‌دهد سرعت استدلال را مستقل از تأخیر مکالمه‌ای بهبود ببخشد. برای کاربر تجاری، این یعنی تبدیل ابزاری که نیاز به ذهنیت خاص «پرامپت‌نویسی» داشت به دستیاری اجرایی که دقیقاً شبیه انسان عمل می‌کند.

منتظر انتشار API این سیستم باشید؛ این ابزار احتمالاً به توسعه‌دهندگان اجازه می‌دهد تا حلقه‌های استدلال تفویض‌شده و دوبلکس کامل را در اپلیکیشن‌های شخص ثالث پیاده کنند.

گام بعدی شما

  • اگر کاربر ChatGPT هستید، تنظیمات Voice را بررسی کرده و سطح استدلال را روی High قرار دهید تا قدرت GPT-5.5 را در پاسخ‌های پیچیده تست کنید.
  • برای تمرین زبان، سعی کنید با مدل مکالماتی سریع داشته باشید و ببینید آیا واکنش‌های «تکیه‌گاهی» مدل، جریان صحبت شما را طبیعی‌تر می‌کند یا خیر.
  • منتظر انتشار API این سیستم باشید؛ این ابزار می‌تواند نحوهٔ طراحی دستیارهای صوتی در اپلیکیشن‌های شخصی را به‌کلی تغییر دهد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های جدید برای کاهش هزینه استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر معماری با تکیه بر اعتبار فنی مدل‌های GPT-5.5، تأخیر در رابط‌های صوتی را حذف کرده و تجربه کاربر را از یک ابزار به یک دستیار واقعی تبدیل می‌کند. این گام، پیش‌نیاز تبدیل هوش مصنوعی به یک عامل (Agent) است که می‌تواند هم‌زمان با محیط تعامل داشته باشد و تصمیم بگیرد.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای جدید OpenAI، توسعه‌دهندگان ایرانی فعلاً تنها از طریق اپلیکیشن ChatGPT می‌توانند این معماری را تست کنند؛ اما انتشار احتمالی API در آینده، فرصت ساخت دستیارهای صوتی پیشرفته با زبان فارسی را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تفکیک لایهٔ تعاملی از لایهٔ استدلالی، یک حرکت هوشمندانه برای دور زدن محدودیت‌های فیزیکی سرعت پردازش است. اوپن‌ای‌آی پذیرفته است که استدلال عمیق (Reasoning) ذاتاً زمان‌بر است، پس به‌جای تلاش برای سریع‌تر کردنِ «فکر کردن»، «رفتار» مدل را از «تفکر» جدا کرده تا کاربر احساس کند مدل همچنان گوش می‌دهد. این رویکرد، استاندارد جدید تعامل انسان و ماشین را از «پرسش و پاسخ» به «هم‌زمانی» تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.