اگر برای پیادهسازی یک عامل صوتی در حال تلاش هستید، احتمالاً با دیوارِ سختِ «تأخیر» برخورد کردهاید؛ لحظهای که فاصله بین پاسخ مدل و شنیده شدن صدا، حس طبیعی گفتگو را میکشد. حالا Cartesia با معرفی Sonic-3.6 ادعا میکند که این سد را شکسته است. در حالی که Sonic-3.5 تنها سه ماه پیش منتشر شده بود، Cartesia با سرعت بسیار زیاد معیارهای سنتز گفتار طبیعی را جابهجا کرد و مدل Sonic-3.6 را به عنوان یک مدل تبدیل متن به گفتار (TTS) در زمان واقعی عرضه کرد.
طبق گزارش Artificial Analysis در ۱۸ اوت ۲۰۲۶، مدل Sonic-3.6 اکنون رتبه نخست هر دو جدول ردهبندی تبدیل متن به گفتار (TTS) را در اختیار دارد. در حالی که اکثر صنعت برای مدتها بر پایه معماری ترنسفورمر (Transformer) بنا شده است، Cartesia روی مدلهای فضای حالت (State Space Models یا SSM) شرطبندی کرده تا موازنه میان سرعت و کیفیت را تغییر دهد. این تغییر معماری به مدل اجازه میدهد تا وفاداری صوتی بالا (High Fidelity) را حفظ کند، بدون اینکه دچار جریمههای تأخیری شود که معمولاً در سنتزهای مقیاسبزرگ دیده میشود. Cartesia این تضادها — یعنی سرعت در برابر طبیعی بودن و دقت در برابر هزینه — را نه به عنوان محدودیتهای اجتنابناپذیر، بلکه به عنوان انتخابهای معماری میبیند.
به نقل از گزارش Marktechpost، این مدل در جدول Provider Voice به امتیاز Elo ۱۲۸۳ و در جدول Controlled Voice به امتیاز ۱۱۲۳ رسیده است. نکته کلیدی اینجاست که در آزمون Controlled Voice، تمام مدلها روی ۸ صدای مرجع یکسان شبیهسازی شدند؛ این یعنی برتری Sonic-3.6 ناشی از کیفیت موتور سنتز است، نه صرفاً داشتن یک کتابخانه صدای بهتر. در این رقابت، Sonic-3.6 در جایگاه اول، Sonic-3.5 در جایگاه دوم و مدل Eleven v3 از شرکت ElevenLabs در جایگاه سوم قرار دارند. در حالی که مدلهای تجاری مانند Sonic-3.6 برتری فنی دارند، برخی ابزارهای متنباز نیز در حال نزدیک شدن به کیفیت سرویسهای پولی هستند و گزینههای جایگزینی را برای توسعهدهندگان فراهم میکنند.

زمینه و کاربردهای صنعتی
مدل Sonic-3.6 یک محصول تجاری و بسته است. این مدل به صورت یک API میزبانیشده (Hosted API) در دسترس است، اما هیچ وزنهای باز (Open Weights) یا مخزنی در Hugging Face برای میزبانی شخصی (Self-hosting) وجود ندارد.
این مدل طیف گستردهای از صنایع را هدف قرار داده است، از جمله خدمات مالی، مراقبتهای بهداشتی، خردهفروشی، تجارت الکترونیک، لجستیک، استخدام، پشتیبانی SaaS و اپلیکیشنهای همراه مصرفکننده. Sonic-3.6 بهطور خاص برای کاربردهای حساس و با ریسک بالا طراحی شده است؛ مواردی مانند عاملهای پشتیبانی ورودی (Inbound)، تماسهای احراز صلاحیت خروجی (Outbound Qualification)، جایگزینی سیستمهای IVR، یادآورهای قرار ملاقات، شبیهسازهای آموزش فروش و بومیسازی صوتی (Audio Localization).
مشخصات فنی و ویژگیهای تولید
Sonic-3.6 به جای روایتهای ساده، برای گردشهای کاری عاملمحور (Agentic) طراحی شده است. قابلیتهای کلیدی تولیدی این مدل عبارتند از:
- تأخیر فوقکم: زمان اعلام شده توسط فروشنده برای «زمان تا نخستین صوت» (TTFA) زیر ۹۰ میلیثانیه است. برای تکمیل این زنجیره در بخش تبدیل گفتار به متن، مدل Ink-2 تأخیر ۱۰۰ میلیثانیهای در ارائه متن (Transcript) را ارائه میدهد. برای درک بهتر هزینههای عملیاتی در این زنجیره، تحلیل دقیقتری از معیارهای هزینه تبدیل گفتار به متن میتواند به بهینهسازی بودجه پروژهها کمک کند.
- کنترل بیان: پشتیبانی از تگهای بیان داخلی (مانند [laughter] برای خنده) و بازنویسی IPA برای تلفظ دقیق کلمات. برای مثال، برای کلمه "subpoena" میتوان از کد <<s|ə|ˈ|p|i|n|ə>> استفاده کرد.
- شبیهسازی سریع: توانایی شبیهسازی صدا (Voice Cloning) تنها با استفاده از حدود ۱۰ ثانیه فایل صوتی.
- درک بومی اعداد و حروف: خواندن صحیح شماره سفارشها، شماره تلفنها و کدهای تأیید بدون نیاز به هرگونه پیشپردازش متنی.
- تنوع زبانی: دموها نشاندهنده اجرای طبیعی زبان انگلیسی همراه با کلمات پرکننده (Filler words) و همچنین قابلیت کد-سوئیچینگ بین هندی و انگلیسی (Hinglish) است.
- یکپارچگی با API: پارامترهای سرعت، حجم صدا و احساسات از طریق API و پلاگین LiveKit Agents در دسترس توسعهدهندگان قرار گرفته است.
دسترسی تجاری و قیمتگذاری
در حال حاضر Sonic-3.6 در مرحله بتا به عنوان یک API میزبانیشده در دسترس است. با وجود فعال بودن نسخه بتا، مستندات رسمی همچنان Sonic 3.5 را به عنوان نسخه پایدار (Stable) برای شرکا معرفی میکنند.
ساختار قیمتگذاری بر اساس اعتبار (Credit) است و نه تعداد کاراکترها. تحلیل Artificial Analysis هزینه را ۴۹ دلار به ازای هر ۱ میلیون کاراکتر نرمالسازی کرده است. این رقم تقریباً نصف هزینه مدل Eleven v3 (۱۰۰ دلار) است، هرچند از مدل Simba 3.2 شرکت Speechify (۱۰ دلار) گرانتر است.
طرحهای قیمتی به شرح زیر است:
- Free/Pro: لایههای ۵ دلاری برای توسعهدهندگان مستقل و استارتاپها.
- Startup/Scale: مبالغ ۴۹ تا ۲۹۹ دلار در ماه برای شرکتهای در حال رشد و مراکز تماس. طرح Scale شامل تقریباً ۱۰,۶۶۷ دقیقه TTS و ۱۵ درخواست همزمان است.
- Enterprise: طرحهای سفارشی برای صنایع تحت نظارت که به توافقنامههای پردازش داده (DPA)، توافقنامههای BAA و ورود یکپارچه (SSO) نیاز دارند.
- Voice Agents: عاملهای صوتی خطی بهطور جداگانه با نرخ ۰.۰۶ دلار در دقیقه محاسبه میشوند.
برای متخصصان فنی، این تغییر رویکرد ثابت میکند که مدلهای فضای حالت (SSM) جایگزینی واقعی، کارآمد و پرقدرت برای ترنسفورمرها در استریمینگ صوتی هستند. Cartesia با جداسازی عملکرد موتور سنتز از کاتالوگ صداها، نشان داد که بهرهوری معماری میتواند مستقیماً باعث افزایش حس طبیعی بودن صدا شود.
این حرکت فشار را بر سایر ارائهدهندگان TTS افزایش میدهد تا برای کاربردهای حساس به تأخیر، مانند جایگزینی IVR و شبیهسازهای فروش در زمان واقعی، بهینهسازی کنند. اکنون تمرکز صنعت از «چقدر صدای مدل انسانی است» به «چقدر صدای مدل در کمتر از ۱۰۰ میلیثانیه انسانی است» تغییر کرده است.
توسعهدهندگان باید مسیر رفت و برگشت (Round Trip) سیستم خود را بسنجند، زیرا ادعای زیر ۹۰ میلیثانیه مربوط به تأخیر مدل است و نه کل تأخیر شبکه. در ماههای آینده، انتقال Sonic-3.6 از نسخه بتا به لایه تولید پایدار را دنبال کنید.
گام بعدی شما
- اگر از APIهای TTS استفاده میکنید، تأخیر End-to-End خود را با عدد ۹۰ میلیثانیه مدل Sonic-3.6 مقایسه کنید.
- برای پیادهسازی عاملهای صوتی، ترکیب Sonic-3.6 و Ink-2 را برای رسیدن به مجموع تأخیر زیر ۲۰۰ میلیثانیه تست کنید.
- منتظر انتقال Sonic-3.6 از نسخه بتا به لایه پایدار (Stable) در ماههای آینده باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و بهینهسازی استنتاج مراجعه کنید.




گفتگو