اگر امروز برای ساخت یک همزاد صوتی هزینه میکنید، احتمالاً متوجه شدهاید که تفاوت میان «طبیعی بودن» و «شبیه بودن» بسیار زیاد است. امتیاز ۴.۰۳ از ۵؛ این عدد مدل s2-pro متعلق به شرکت Fish Audio را در صدر بازار شباهت گوینده قرار داده است. این رقم از جدول رتبهبندی ۱۰ سپتامبر ۲۰۲۶ منتشر شده توسط Hume به دست آمده است. در این آزمایش، ۱۱ مدل مختلف روی ۲۵ صدای مرجع و با ۷ پرامپت متفاوت تست شدند و سه ارزیاب انسانی در یک محیط کور (Blind Test)، کلیپهای صوتی را از ۱ تا ۵ امتیاز دادند. در حالی که ElevenLabs همچنان انتخاب پیشفرض صنعت است، مدل Eleven v3 آن با امتیاز ۲.۹۱ در انتهای فهرست ارائهدهندگان مورد آزمایش قرار گرفت.
شبیهسازی صدا (Voice Cloning) — شبیه ساختن یک کپی دیجیتال از صدای انسان که هر کلمهای را با همان لحن و تکیههای فرد اصلی بگوید — از مرحلهی «طبیعی به نظر رسیدن» عبور کرده و حالا به دنبال «دقیق بودن» است. یک صدای پیشفرض (Stock Voice) فقط باید خوب و دلپذیر به نظر برسد، اما یک صدای شبیهسازی شده باید دقیقاً شبیه به یک شخص خاص باشد. برای توسعهدهندگان و کسبوکارها، انتخاب API اکنون به موازنهای میان حجم صدای مرجع در دسترس، هزینه به ازای هر میلیون کاراکتر و ضرورت داشتن رضایت قانونی و قابل اثبات گوینده بستگی دارد. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای مولد اشاره کردیم، توازن میان دسترسی سریع و امنیت دادهها همواره یک چالش است. اکثر پلتفرمها اکنون دو مسیر ارائه میدهند: شبیهسازی «لحظهای» (Instant) برای استقرار سریع و شبیهسازی «حرفهای» (Professional) برای خلق صدای برند با وفاداری بالا.
شکاف میان شباهت و کیفیت
بر اساس مستندات جدول رتبهبندی Hume، طبیعی بودن صدا و هویت آن دو معیار متفاوت هستند. برای مثال، مدل sonic-3.6-beta متعلق به Cartesia با امتیاز ۴.۳۶ در صدر جدول طبیعی بودن قرار گرفت، اما در بخش هویت (شباهت به شخص) رتبه هشتم را کسب کرد. در مقابل، مدل TTS-2 شرکت Inworld با امتیاز ۴.۶۱، بالاترین کیفیت کلی صدا را ثبت کرد.
سایر امتیازات قابل توجه در این جدول شامل Cartesia sonic-3.5 با ۳.۷۰، ElevenLabs Multilingual v2 با ۳.۶۸، Cartesia sonic-3.6-beta با ۳.۶۳ و Inworld TTS-2 با ۳.۶۲ است. این دادهها که در Hugging Face منتشر شدهاند، ثابت میکنند امتیاز بالای طبیعی بودن اگر با هویت گوینده همراه نباشد، فریبنده است و میتواند منجر به گم شدن هویت شخص هدف شود.
کالبدشکافی فنی ارائهدهندگان
ElevenLabs: سختگیرترین سیستم امنیتی را دارد. شبیهسازی حرفهای (PVC) آن نیازمند «کپچای صوتی» (Voice Captcha) است که در آن مالک صدا باید متنی را که روی صفحه نمایش داده میشود، بخواند. PVC به حداقل ۳۰ دقیقه صدای مرجع نیاز دارد، هرچند ۲ تا ۳ ساعت صدا ایدهآل است. این قابلیت در طرح Creator و بالاتر در دسترس است. این پلتفرم از بیش از ۷۰ زبان پشتیبانی میکند. قیمتها از ۵۰ دلار (برای مدل Flash) تا ۱۰۰ دلار به ازای هر ۱ میلیون کاراکتر برای مدل v3 متغیر است. نرخ API برای Eleven v3 و Multilingual v2 معادل ۰.۱۰ دلار به ازای هر ۱ هزار کاراکتر است، در حالی که مدلهای Flash، Turbo و v3 Conversational هزینه ۰.۰۵ دلار دارند.
Fish Audio: پیشتاز فعلی در شباهت است. مدل S2.1 Pro آن ۸۳ زبان را پوشش میدهد و هزینه ثابت ۱۵ دلار به ازای هر ۱ میلیون بایت UTF-8 دارد. توجه داشته باشید که کاراکترهای غیرانگلیسی (مانند چینی، ژاپنی و کرهای) حدود ۳ بایت به ازای هر کاراکتر مصرف میکنند که عملاً هزینه را سه برابر میکند. شبیهسازی لحظهای از حدود ۱۰ ثانیه صدا شروع میشود، اما نسخههای حرفهای به ۱۰ تا ۱۸۰ دقیقه داده و تایید مالکیت زنده نیاز دارند. استفاده تجاری از طرح Plus با قیمت ۱۵ دلار آغاز میشود.
Cartesia: روی کاهش تأخیر (Latency) — یعنی فاصله زمانی بین ارسال دستور و شنیدن جواب، شبیه فاصله بین فشار دادن دکمه چراغ راهنمایی و روشن شدن آن — تمرکز کرده است. این رویکرد برای برنامههایی که نیاز به پاسخدهی آنی دارند حیاتی است، مشابه آنچه در بهینهسازیهای زیر میلیثانیهای API شرکت Groq برای مدلهای زبانی مشاهده کردیم. مدلهای Sonic 3.6 و نسخههای جدیدتر از ۶۰ ثانیه صدا برای حفظ بهتر لهجهها استفاده میکنند. شبیهسازهای حرفهای روی بیش از ۳۰ دقیقه صدا آموزش میبینند و از طرح Startup با قیمت ۴۹ دلار شروع میشوند. سیستم پرداخت Sonic بر اساس ۱ کریدیت به ازای هر کاراکتر است؛ طرحها از ۵ دلار برای ۱۰۰ هزار کریدیت تا ۲۹۹ دلار برای ۸ میلیون کریدیت متغیر است. این سرویس ۴۴ زبان را لیست کرده و هزینه نهایی آن حدود ۳۷ تا ۵۰ دلار به ازای هر ۱ میلیون کاراکتر است.
Inworld: ارزانترین گزینه برای مقیاسهای بزرگ است. مدل TTS-2 Flash در طرحهای سطح بالا تنها ۷ دلار به ازای هر ۱ میلیون کاراکتر هزینه دارد. مدل Realtime TTS-2 در حالت On-demand قیمت ۲۵ دلار دارد که در طرح ۳۰۰ دلار در ماه به ۱۵ دلار و در طرح ۱۵۰۰ دلار در ماه به ۱۲.۵۰ دلار کاهش مییابد. این پلتفرم کتابخانه عظیمی از بیش از ۲۰۰ زبان و لهجه را پشتیبانی میکند که ۱۵ مورد از آنها در سطح کیفیت برتر قرار دارند. شبیهسازی حرفهای در حال حاضر در مرحله بتا است، به ۱۰ دقیقه صدا نیاز دارد و فعلاً فقط از انگلیسی پشتیبانی میکند.
Resemble AI: بر امنیت و اصالت تمرکز دارد. این شرکت از واترمارک PerTh برای تمام خروجیها استفاده میکند و سیستم تشخیص جعل عمیق (Deepfake) را در خود ادغام کرده است. شبیهسازی سریع (Rapid Clone) به ۱۰ ثانیه صدا نیاز دارد و در کمتر از یک دقیقه آماده میشود، در حالی که شبیهسازی حرفهای به ۱۰ تا ۲۵+ دقیقه صدا و حدود ۴۰ دقیقه زمان آموزش نیاز دارد. این شرکت رضایت صریح و قابل تایید گوینده را الزامی میداند. مدل Chatterbox Multilingual آن ۲۳ زبان را پوشش میدهد و دسترسی به API نیازمند طرح Business است.
Gradium: گزینهای تخصصی برای بازارهای اروپایی است که توسط بنیانگذاران Kyutai ایجاد شده و از زبانهای انگلیسی، فرانسوی، آلمانی، اسپانیایی و پرتغالی پشتیبانی میکند. طرح رایگان آن اجازه ساخت ۵ شبیهساز برای مصارف غیرتجاری را میدهد. طرحهای پولی از ۱۳ دلار برای ۲۲۵ هزار کریدیت (۱ کریدیت به ازای هر کاراکتر) شروع میشوند. شبیهسازی حرفهای حداقل به ۳۰ دقیقه صدا نیاز دارد و از طرح M با قیمت ۳۴۰ دلار آغاز میشود.
Hume: با مدل Octave 2 بر روی انتقال احساسات و تحویل صدا بر اساس جهتدهی عاطفی تمرکز دارد و ۱۱ زبان را پوشش میدهد. حداقل صدای مورد نیاز برای آن ۱۵ ثانیه است که باید به صورت زنده ضبط یا توسط گویندهای که رضایت داده، آپلود شود. استفاده تجاری از طرح Creator با ۱۴ دلار در ماه شروع میشود. کاراکترهای اضافی در طرح Creator به قیمت ۰.۱۵ دلار و در طرح Business به قیمت ۰.۰۵ دلار به ازای هر ۱ هزار کاراکتر محاسبه میشوند.
الزامات صدای مرجع و اخلاقیات
اکثر شبیهسازهای لحظهای بین ۳ تا ۳۰ ثانیه صدا میخواهند. Inworld جسورانهترین است و با تنها ۳ ثانیه کار میکند، هرچند نمونههای تا ۳۰ ثانیه شباهت را بهبود میبخشند. Hume سختگیرترین است و کف ۱۵ ثانیه را برای مسیرهای لحظهای تعیین کرده است.
در بخش حرفهای، الزامات سختگیرانهتر است. ElevenLabs برای PVC حدود ۲ تا ۳ ساعت صدا توصیه میکند، در حالی که Gradium و Resemble AI حداقلهای خود را بین ۱۰ تا ۳۰ دقیقه قرار دادهاند. شبیهسازهای حرفهای Fish Audio میتوانند تا ۱۸۰ دقیقه متریال مرجع را بپذیرند.
به گزارش Marktechpost، تنها ElevenLabs، Fish Audio و Resemble AI بررسیهای فنی برای تایید رضایت گوینده در سطوح حرفهای مستند کردهاند. ElevenLabs از کپچای صوتی، Fish Audio از بررسی مالکیت زنده و Resemble AI از رضایت قابل تایید استفاده میکند. سایرین به شرایط خدمات (ToS)، گواهیهای حقوقی یا تاییدیه ساده کاربر اکتفا میکنند که این موضوع یک ریسک حقوقی و شکاف مسئولیت برای شرکتهای بزرگی ایجاد میکند که به زنجیره custody (مالکیت) قابل اثبات برای استعدادهای صوتی نیاز دارند.
راهنمای استقرار: کدام API برای چه کاری؟
- عاملهای صوتی ارزان در مقیاس بالا: Inworld یا Fish Audio.
- تأخیر کم با پوشش گسترده زبانی: Cartesia.
- صدای برند با رضایت قانونی سختگیرانه: ElevenLabs PVC.
- زبانهای اروپایی با تست رایگان: Gradium.
- شبیهسازی همراه با واترمارک و تشخیص جعل: Resemble AI.
- تولید صدا با هدایت احساسی: Hume.
این دادهها نشان میدهند بازار AI صوتی از مدل «یک ابزار برای همه» به سمت مجموعهای از ابزارهای تخصصی (Specialized Stack) میرود. شما ممکن است از Inworld برای یک عامل صوتی ارزان با حجم بالای درخواست استفاده کنید، اما برای صدای رسمی یک شرکت که در آن رضایت قانونی غیرقابل مذاکره است، به ElevenLabs سوییچ کنید.
برای کاربر نهایی، این به معنای کاهش «هزینه کیفیت» است. توانایی Fish Audio در رسیدن به شباهت بالا با دادههای حداقلی و قیمت ۱۵ دلار به ازای هر ۱ میلیون کاراکتر، فشار شدیدی بر ارائهدهندگان قدیمی وارد میکند تا یا حاشیه سود خود را کاهش دهند یا دقت هویت را به طور قابل توجهی افزایش دهند.
توسعهدهندگان باید اکنون به جای امتیاز «طبیعی بودن»، روی محکهای «هویت» (Identity Benchmarks) تمرکز کنند. صدایی که انسانی به نظر برسد اما شبیه شخص هدف نباشد، در دنیای شبیهسازی یک شکست است.
گام بعدی شما
- اگر به دنبال کاهش هزینه هستید، مدلهای Inworld را برای عاملهای حجیم تست کنید.
- برای پروژههای حساس برندینگ، حتماً از مسیر PVC در ElevenLabs استفاده کنید تا ریسک حقوقی کاهش یابد.
- در انتخاب مدل، به جای تکیه بر تبلیغات «طبیعی بودن»، نمونههای تست را با صدای مرجع مقایسه کنید.
اما ادغام تشخیص جعل عمیق در لحظه (Real-time Deepfake Detection) مستقیماً در جریان APIها، ترندی است که Resemble AI را پیشتاز کرده و احتمالاً تا سال ۲۰۲۷ به یک الزام قانونی برای رسانههای سنتتیک تجاری تبدیل میشود.




گفتگو