تصور کنید در یک تماس تلفنی با پشتیبانی بیمه، هر پاسخ مدل با یک وقفه آزاردهنده شروع شود. این «تپق» یا لکنت دیجیتالی در خطلولههای سنتی هوش مصنوعی صوتی بسیار رایج است، زیرا سیستمها باید ابتدا متنهای بازشناسی شده را بخوانند و سپس پاسخ دهند. PolyAI با عرضه مدل Dialog-RSN-1، این مشکل را برطرف کرده و تأخیر پاسخدهی را برای کاربران بخش بیمه ۳۷٪ کاهش داده است. این مدل جدید، یک مدل بومی-صوتی (Audio-native) است که بهجای متن، مستقیماً سیگنالهای صوتی خام را درک میکند.
بر اساس مستندات فنی این شرکت، این مدل بهجای تکیه بر متن، مستقیماً سیگنالهای صوتی خام را درک میکند. در پوشش پیشین ما از معماریهای درگاه صوتی (Audio Gateway)، دیدیم که حذف لایههای واسطه تنها راه رسیدن به واکنشهای آنی است. این عرضه جدید، هوشمندی را به لایههای عمیقتر مسیر سیگنال منتقل کرده است. در حالی که اکثر عاملهای صوتی از یک پشته متوالی (Cascaded Stack) استفاده میکنند — جایی که یک ابزار بازشناسی گفتار (ASR) متن را حدس میزند و سپس آن را به مدل زبانی بزرگ (LLM) میفرستد — مدل Dialog-RSN-1 مستقیماً روی خودِ صوت استدلال میکند. این رویکرد باعث میشود مدل بتواند جزئیاتی مثل تردید در لحن، آهنگ صدا و عدم قطعیت کاربر را که معمولاً در ترجمه به متن گم میشوند، بهوضوح تشخیص دهد.
به نقل از وبلاگ مهندسی PolyAI در ۳۰ ژوئیه ۲۰۲۶، این مدل قابلیتهای مدیریت نوبت گفتگو، بازشناسی گفتار و فراخوانی تابع (Function Calling) را در یک واحد ادغام کرده است. برخلاف مدلهای کاملاً تبدیل-صوت-به-صوت (Speech-to-Speech) مانند GPT Realtime، مدل Dialog-RSN-1 فقط در بخش ورودی نسبت به صوت حساس است. این رویکرد در تضاد با استراتژی OpenAI است که در معماری دوطرفه GPT-Live برای حذف تأخیرات مکالمی، بر جریان مداوم دادهها تمرکز کرده است. این تفکیک استراتژیک باعث میشود خروجی تبدیل متن به گفتار (TTS) همچنان مستقل باقی بماند و سازمانها کنترل کاملی بر لحن و تلفظ برند خود در خروجی داشته باشند.
زمینه: حل گلوگاههای هوش مصنوعی صوتی
ساختارهای متوالی سنتی به این دلیل دچار مشکل هستند که مدل زبانی (LLM) تنها «بهترین حدس» ابزار ASR را میبیند. این فرآیند باعث حذف نشانههای صوتی حیاتی میشود که برای درک معنای واقعی گفتگو ضروری هستند. توسعهدهندگان برای رفع این مشکل معمولاً پارامترهای پایانگویندگی (End-pointing) و بایاسهای ASR را بهصورت دستی تنظیم میکنند، اما این تنظیمات بهندرت در تمامی موارد استفاده و سناریوهای مختلف کاربر، بهطور کلی جواب میدهند.
از سوی دیگر، مدلهای تمامصوتی (مانند Gemini Live)، صدا را در دل مدل میپزند. این رویکرد باعث محدود شدن کنترل روی تلفظ میشود و اغلب بهدلیل استریم مداوم دوطرفه (Full-duplex)، یک واحد پردازش گرافیکی (GPU) را برای کل مدت تماس اشغال میکند. Dialog-RSN-1 با اجرای مدل بهصورت درخواستی (Request-based) که در زمان نیاز فراخوانی میشود، از این مشکل اجتناب کرده است. در این سیستم، یک واحد تشخیص فعالیت صوتی (VAD) با بازدهی بالا و چند تایمر مشخص میکنند که چه زمانی مدل باید مورد پرسش قرار گیرد، تا از اشغال دائمی GPU در طول تماس جلوگیری شود.
معماری فنی و دستاوردهای عملکردی
طبق گزارش PolyAI، برای رسیدن به هدف تأخیر زیر ۳۰۰ میلیثانیه روی GPUهای A100، بهینهسازیهای زیر اعمال شده است:
- مدیریت پیشبینانه نوبت: اولین توکن خروجی مدل یکی از سه حالت EMPTY (خالی)، ONGOING (در جریان) یا COMPLETE (کامل) است. این قابلیت به مدل اجازه میدهد بر اساس زمینه صوتی تصمیم بگیرد که آیا کاربر صحبتش را تمام کرده است یا خیر. برای مثال، اگر کاربر پس از چهارمین رقم از یک کد ۶ رقمی مکث کند، یک تایمر سکوت معمولی باعث پاسخ زودهنگام سیستم میشد، اما Dialog-RSN-1 حالت ONGOING را پیشبینی میکند تا به گوش دادن ادامه دهد.
- استنتاج بهینه: سیستم از یک رمزگشای گمانهزنانه (Speculative Drafter) تنظیمشده با میانگین پذیرش ۳.۹ توکن استفاده میکند. همچنین حافظه توجه (Attention Cache) در حالی که کاربر در حال صحبت است پیشپُر میشود و سیستم از یک قالب پرامپت «فقط-الحاقی» (Append-only) استفاده میکند تا از باطل شدن حافظه کش (Cache Invalidation) به حداقل برساند.
- مقیاس مدل: خطلوله این سیستم نسبت به مدل پایه agnostic است و مدلهای Gemma، GPT-OSS، Qwen و Mistral مورد ارزیابی قرار گرفتهاند. PolyAI بازه ۸ میلیارد پارامتر متراکم تا ۳۰ میلیارد پارامتر پراکنده (Sparse) را برای ایجاد توازن میان عملکرد و تأخیر هدف قرار داد.
- آموزش تکمیلی: مدل با استفاده از تنظیم نظارتشده (SFT) و یادگیری تقویتی (RFT) روی دادههای داخلی شرکت ساخته شده است، که شامل استدلالهای خودکار (Auto-reasoning) یادگرفته شده در طول فرآیند RFT میشود.
در تستهای واقعی، یک گروه رستورانداری شاهد افزایش ۱۱ درصدی در نرخ «محبوسسازی تماس» (Call Containment) بود. همچنین در بنچمارک داخلی Dialog-Eval، این مدل از سیستمهای زنجیرهای (که سقف ۷۷ امتیاز داشتند) پیشی گرفت. PolyAI خاطرنشان کرد که GPT Realtime 2.1 در مثالهای حساس به صوت، امتیازی مشابه با سیستمهای زنجیرهای کسب کرده است. این در حالی است که OpenAI پیشتر در نسخه GPT-Realtime-2.1-mini توانسته بود سرعت پاسخدهی صوتی را بهطور چشمگیری ارتقا دهد. همچنین دقت نسخهبرداری بهبود یافت و نرخ خطای کلمه (WER) به زیر ۶.۹٪ رسید، که از رکورد gpt-4o-transcribe در زمان ارائه زمینه (Context) بهتر است.
استقرار صنعتی و کاربرد
این تغییر، فرض قدیمی درباره «ساندویچی بودن» هوش مصنوعی صوتی (ASR-LLM-TTS) را میشکند. با تبدیل LLM به یک مدل حساس به صوت، PolyAI وابستگی به پارامترهای شکننده پایانگویندگی را از بین برده است. برای سازمانها، این به معنای کاهش تعداد مشتریانی است که صحبتشان قطع میشود و ایجاد تلاقیهای طبیعیتر میان انسان و ماشین است.
تا دسامبر ۲۰۲۵، PolyAI پس از جذب ۸۶ میلیون دلار سرمایه در سری D، بیش از ۱۰۰ مشتری سازمانی و ۲۰۰۰ استقرار فعال دارد. این مدل بهخصوص برای سازمانهای با حجم تماس بالا در بخشهای زیر بهینه شده است:
- صنایعی نظیر: بیمه، بهداشت و درمان، خدمات مالی، رستورانها، هتلها، خردهفروشی، تلکام، حملونقل و خدمات شهری (Utilities).
- کاربرها: مسیریابی تماس، احراز هویت، رزرو و پذیرش، صورتحساب، پرداختها، مدیریت سفارشات و عیبیابی فنی.
با این حال، این مدل بهصورت وزنهای باز (Open Weights) یا API عمومی در دسترس نیست. دسترسی به آن محدود به پلتفرم PolyAI است؛ مشتریان فعلی میتوانند همین امروز آن را فعال کنند و مشتریان جدید باید درخواست دسترسی زودهنگام (Early Access) دهند. در زمان عرضه، Dialog-RSN-1 تنها از زبان انگلیسی پشتیبانی میکند و PolyAI همچنان مدل Raven 3.5 را برای زبانهای غیرانگلیسی و چتهای وب توصیه میکند.
منتظر انتشار مقاله Dialog-Eval و گزارش فنی باشید تا ببینید این رویکرد بومی-صوتی در برابر نسل بعدی مدلهای پیشرو چندوجهی چگونه مقیاسپذیر میشود.
گام بعدی شما
- اگر از سیستمهای صوتی مبتنی بر ASR استفاده میکنید، نرخ خطای کلمه (WER) خود را با دادههای مدلهای Audio-native مقایسه کنید.
- بررسی کنید آیا محصول شما نیاز به تشخیص «لحن و تردید» دارد یا صرفاً محتوای متنی برایش کافی است.
- منتظر انتشار مقاله فنی Dialog-Eval باشید تا مقیاسپذیری این روش در برابر مدلهای چندوجهی جدید را بسنجید.
اما تأثیر این معماری روی هزینههای محاسباتی در مقیاس میلیونی هنوز مبهم است — به تحلیل ما درباره بهینهسازیهای KV Cache در مدلهای بزرگ مراجعه کنید.




گفتگو