پرش به محتوای اصلی
پرش به محتوای مقاله

PolyAI: کاهش ۳۷ درصدی تأخیر صوتی با معماری Dialog-RSN-1

·۹ مرداد ۱۴۰۵۴ دقیقه مطالعه۵ بازدید
مدل گفتگوی صوتی Dialog-RSN-1 با قابلیت‌های نوبت‌گیری، تشخیص گفتار، فراخوانی توابع و پاسخگویی
مدل گفتگوی صوتی Dialog-RSN-1 با قابلیت‌های نوبت‌گیری، تشخیص گفتار، فراخوانی توابع و پاسخگویی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری Hybrid-Audio؛ برخلاف مدل‌های کاملاً صوتی، این مدل فقط در ورودی Audio-native است تا کنترل TTS خروجی حفظ شود و هم‌زمان تأخیر را به زیر ۳۰۰ میلی‌ثانیه برساند.

تصور کنید در یک تماس تلفنی با پشتیبانی بیمه، هر پاسخ مدل با یک وقفه آزاردهنده شروع شود. این «تپق» یا لکنت دیجیتالی در خط‌لوله‌های سنتی هوش مصنوعی صوتی بسیار رایج است، زیرا سیستم‌ها باید ابتدا متن‌های بازشناسی شده را بخوانند و سپس پاسخ دهند. PolyAI با عرضه مدل Dialog-RSN-1، این مشکل را برطرف کرده و تأخیر پاسخ‌دهی را برای کاربران بخش بیمه ۳۷٪ کاهش داده است. این مدل جدید، یک مدل بومی-صوتی (Audio-native) است که به‌جای متن، مستقیماً سیگنال‌های صوتی خام را درک می‌کند.

بر اساس مستندات فنی این شرکت، این مدل به‌جای تکیه بر متن، مستقیماً سیگنال‌های صوتی خام را درک می‌کند. در پوشش پیشین ما از معماری‌های درگاه صوتی (Audio Gateway)، دیدیم که حذف لایه‌های واسطه تنها راه رسیدن به واکنش‌های آنی است. این عرضه جدید، هوشمندی را به لایه‌های عمیق‌تر مسیر سیگنال منتقل کرده است. در حالی که اکثر عامل‌های صوتی از یک پشته متوالی (Cascaded Stack) استفاده می‌کنند — جایی که یک ابزار بازشناسی گفتار (ASR) متن را حدس می‌زند و سپس آن را به مدل زبانی بزرگ (LLM) می‌فرستد — مدل Dialog-RSN-1 مستقیماً روی خودِ صوت استدلال می‌کند. این رویکرد باعث می‌شود مدل بتواند جزئیاتی مثل تردید در لحن، آهنگ صدا و عدم قطعیت کاربر را که معمولاً در ترجمه به متن گم می‌شوند، به‌وضوح تشخیص دهد.

به نقل از وبلاگ مهندسی PolyAI در ۳۰ ژوئیه ۲۰۲۶، این مدل قابلیت‌های مدیریت نوبت گفتگو، بازشناسی گفتار و فراخوانی تابع (Function Calling) را در یک واحد ادغام کرده است. برخلاف مدل‌های کاملاً تبدیل-صوت-به-صوت (Speech-to-Speech) مانند GPT Realtime، مدل Dialog-RSN-1 فقط در بخش ورودی نسبت به صوت حساس است. این رویکرد در تضاد با استراتژی OpenAI است که در معماری دوطرفه GPT-Live برای حذف تأخیرات مکالمی، بر جریان مداوم داده‌ها تمرکز کرده است. این تفکیک استراتژیک باعث می‌شود خروجی تبدیل متن به گفتار (TTS) همچنان مستقل باقی بماند و سازمان‌ها کنترل کاملی بر لحن و تلفظ برند خود در خروجی داشته باشند.

زمینه: حل گلوگاه‌های هوش مصنوعی صوتی

ساختارهای متوالی سنتی به این دلیل دچار مشکل هستند که مدل زبانی (LLM) تنها «بهترین حدس» ابزار ASR را می‌بیند. این فرآیند باعث حذف نشانه‌های صوتی حیاتی می‌شود که برای درک معنای واقعی گفتگو ضروری هستند. توسعه‌دهندگان برای رفع این مشکل معمولاً پارامترهای پایان‌گویندگی (End-pointing) و بایاس‌های ASR را به‌صورت دستی تنظیم می‌کنند، اما این تنظیمات به‌ندرت در تمامی موارد استفاده و سناریوهای مختلف کاربر، به‌طور کلی جواب می‌دهند.

از سوی دیگر، مدل‌های تمام‌صوتی (مانند Gemini Live)، صدا را در دل مدل می‌پزند. این رویکرد باعث محدود شدن کنترل روی تلفظ می‌شود و اغلب به‌دلیل استریم مداوم دوطرفه (Full-duplex)، یک واحد پردازش گرافیکی (GPU) را برای کل مدت تماس اشغال می‌کند. Dialog-RSN-1 با اجرای مدل به‌صورت درخواستی (Request-based) که در زمان نیاز فراخوانی می‌شود، از این مشکل اجتناب کرده است. در این سیستم، یک واحد تشخیص فعالیت صوتی (VAD) با بازدهی بالا و چند تایمر مشخص می‌کنند که چه زمانی مدل باید مورد پرسش قرار گیرد، تا از اشغال دائمی GPU در طول تماس جلوگیری شود.

معماری فنی و دستاوردهای عملکردی

طبق گزارش PolyAI، برای رسیدن به هدف تأخیر زیر ۳۰۰ میلی‌ثانیه روی GPUهای A100، بهینه‌سازی‌های زیر اعمال شده است:

  • مدیریت پیش‌بینانه نوبت: اولین توکن خروجی مدل یکی از سه حالت EMPTY (خالی)، ONGOING (در جریان) یا COMPLETE (کامل) است. این قابلیت به مدل اجازه می‌دهد بر اساس زمینه صوتی تصمیم بگیرد که آیا کاربر صحبتش را تمام کرده است یا خیر. برای مثال، اگر کاربر پس از چهارمین رقم از یک کد ۶ رقمی مکث کند، یک تایمر سکوت معمولی باعث پاسخ زودهنگام سیستم می‌شد، اما Dialog-RSN-1 حالت ONGOING را پیش‌بینی می‌کند تا به گوش دادن ادامه دهد.
  • استنتاج بهینه: سیستم از یک رمزگشای گمانه‌زنانه (Speculative Drafter) تنظیم‌شده با میانگین پذیرش ۳.۹ توکن استفاده می‌کند. همچنین حافظه توجه (Attention Cache) در حالی که کاربر در حال صحبت است پیش‌پُر می‌شود و سیستم از یک قالب پرامپت «فقط-الحاقی» (Append-only) استفاده می‌کند تا از باطل شدن حافظه کش (Cache Invalidation) به حداقل برساند.
  • مقیاس مدل: خط‌لوله این سیستم نسبت به مدل پایه agnostic است و مدل‌های Gemma، GPT-OSS، Qwen و Mistral مورد ارزیابی قرار گرفته‌اند. PolyAI بازه ۸ میلیارد پارامتر متراکم تا ۳۰ میلیارد پارامتر پراکنده (Sparse) را برای ایجاد توازن میان عملکرد و تأخیر هدف قرار داد.
  • آموزش تکمیلی: مدل با استفاده از تنظیم نظارت‌شده (SFT) و یادگیری تقویتی (RFT) روی داده‌های داخلی شرکت ساخته شده است، که شامل استدلال‌های خودکار (Auto-reasoning) یادگرفته شده در طول فرآیند RFT می‌شود.

در تست‌های واقعی، یک گروه رستوران‌داری شاهد افزایش ۱۱ درصدی در نرخ «محبوس‌سازی تماس» (Call Containment) بود. همچنین در بنچمارک داخلی Dialog-Eval، این مدل از سیستم‌های زنجیره‌ای (که سقف ۷۷ امتیاز داشتند) پیشی گرفت. PolyAI خاطرنشان کرد که GPT Realtime 2.1 در مثال‌های حساس به صوت، امتیازی مشابه با سیستم‌های زنجیره‌ای کسب کرده است. این در حالی است که OpenAI پیش‌تر در نسخه GPT-Realtime-2.1-mini توانسته بود سرعت پاسخ‌دهی صوتی را به‌طور چشم‌گیری ارتقا دهد. همچنین دقت نسخه‌برداری بهبود یافت و نرخ خطای کلمه (WER) به زیر ۶.۹٪ رسید، که از رکورد gpt-4o-transcribe در زمان ارائه زمینه (Context) بهتر است.

استقرار صنعتی و کاربرد

این تغییر، فرض قدیمی درباره «ساندویچی بودن» هوش مصنوعی صوتی (ASR-LLM-TTS) را می‌شکند. با تبدیل LLM به یک مدل حساس به صوت، PolyAI وابستگی به پارامترهای شکننده پایان‌گویندگی را از بین برده است. برای سازمان‌ها، این به معنای کاهش تعداد مشتریانی است که صحبتشان قطع می‌شود و ایجاد تلاقی‌های طبیعی‌تر میان انسان و ماشین است.

تا دسامبر ۲۰۲۵، PolyAI پس از جذب ۸۶ میلیون دلار سرمایه در سری D، بیش از ۱۰۰ مشتری سازمانی و ۲۰۰۰ استقرار فعال دارد. این مدل به‌خصوص برای سازمان‌های با حجم تماس بالا در بخش‌های زیر بهینه شده است:

  • صنایعی نظیر: بیمه، بهداشت و درمان، خدمات مالی، رستوران‌ها، هتل‌ها، خرده‌فروشی، تلکام، حمل‌ونقل و خدمات شهری (Utilities).
  • کاربرها: مسیریابی تماس، احراز هویت، رزرو و پذیرش، صورت‌حساب، پرداخت‌ها، مدیریت سفارشات و عیب‌یابی فنی.

با این حال، این مدل به‌صورت وزن‌های باز (Open Weights) یا API عمومی در دسترس نیست. دسترسی به آن محدود به پلتفرم PolyAI است؛ مشتریان فعلی می‌توانند همین امروز آن را فعال کنند و مشتریان جدید باید درخواست دسترسی زودهنگام (Early Access) دهند. در زمان عرضه، Dialog-RSN-1 تنها از زبان انگلیسی پشتیبانی می‌کند و PolyAI همچنان مدل Raven 3.5 را برای زبان‌های غیرانگلیسی و چت‌های وب توصیه می‌کند.

منتظر انتشار مقاله Dialog-Eval و گزارش فنی باشید تا ببینید این رویکرد بومی-صوتی در برابر نسل بعدی مدل‌های پیشرو چندوجهی چگونه مقیاس‌پذیر می‌شود.

گام بعدی شما

  • اگر از سیستم‌های صوتی مبتنی بر ASR استفاده می‌کنید، نرخ خطای کلمه (WER) خود را با داده‌های مدل‌های Audio-native مقایسه کنید.
  • بررسی کنید آیا محصول شما نیاز به تشخیص «لحن و تردید» دارد یا صرفاً محتوای متنی برایش کافی است.
  • منتظر انتشار مقاله فنی Dialog-Eval باشید تا مقیاس‌پذیری این روش در برابر مدل‌های چندوجهی جدید را بسنجید.

اما تأثیر این معماری روی هزینه‌های محاسباتی در مقیاس میلیونی هنوز مبهم است — به تحلیل ما درباره بهینه‌سازی‌های KV Cache در مدل‌های بزرگ مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر تخصص در پردازش سیگنال، گلوگاه قدیمی تأخیر در Voice AI را می‌شکند. نتیجه آن، جابه‌جایی تجربه کاربر از یک «ربات تلفنی» به یک «هم‌صحبت دیجیتال» است که تفاوتش در میلی‌ثانیه‌هاست.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و مدل تجاری PolyAI، دسترسی مستقیم برای توسعه‌دهندگان ایرانی دشوار است، اما این معماری الگویی برای پیاده‌سازی سیستم‌های صوتی بومی با تأخیر کم در زبان فارسی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال هوش از لایه متن به لایه سیگنال، پایان عصر «حدس زدن» در رابط‌های صوتی است. با اینکه مدل‌های Speech-to-Speech موج زده‌اند، تفکیک ورودی صوتی از خروجی متنی در Dialog-RSN-1 یک حرکت استراتژیک برای حفظ کنترل برند در سازمان‌های بزرگ است. این یعنی پذیرش اینکه برای کاربر، «چه می‌شنود» اهمیت دارد، اما برای سازمان «چطور شنیده شود» حیاتی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.