پرش به محتوای اصلی
پرش به محتوای مقاله

بنچمارک ۲۰۲۶: Fish Audio در شباهت صوتی پیشتاز ۷ رابط API است

·۳۰ شهریور ۱۴۰۵۶ دقیقه مطالعه۴ بازدید
مقایسه بهترین APIهای کپی صدا در ۲۰۲۶: شباهت گوینده، بررسی رضایت و قیمت هر یک میلیون کاراکتر
مقایسه بهترین APIهای کپی صدا در ۲۰۲۶: شباهت گوینده، بررسی رضایت و قیمت هر یک میلیون کاراکتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی ElevenLabs توسط Fish Audio در معیار شباهت گوینده؛ این اولین بار است که یک ارائه‌دهنده با قیمت بسیار پایین‌تر، در دقت هویت از استاندارد صنعت پیشی می‌گیرد.

اگر امروز برای ساخت یک همزاد صوتی هزینه می‌کنید، احتمالاً متوجه شده‌اید که تفاوت میان «طبیعی بودن» و «شبیه بودن» بسیار زیاد است. امتیاز ۴.۰۳ از ۵؛ این عدد مدل s2-pro متعلق به شرکت Fish Audio را در صدر بازار شباهت گوینده قرار داده است. این رقم از جدول رتبه‌بندی ۱۰ سپتامبر ۲۰۲۶ منتشر شده توسط Hume به دست آمده است. در این آزمایش، ۱۱ مدل مختلف روی ۲۵ صدای مرجع و با ۷ پرامپت متفاوت تست شدند و سه ارزیاب انسانی در یک محیط کور (Blind Test)، کلیپ‌های صوتی را از ۱ تا ۵ امتیاز دادند. در حالی که ElevenLabs همچنان انتخاب پیش‌فرض صنعت است، مدل Eleven v3 آن با امتیاز ۲.۹۱ در انتهای فهرست ارائه‌دهندگان مورد آزمایش قرار گرفت.

شبیه‌سازی صدا (Voice Cloning) — شبیه ساختن یک کپی دیجیتال از صدای انسان که هر کلمه‌ای را با همان لحن و تکیه‌های فرد اصلی بگوید — از مرحله‌ی «طبیعی به نظر رسیدن» عبور کرده و حالا به دنبال «دقیق بودن» است. یک صدای پیش‌فرض (Stock Voice) فقط باید خوب و دلپذیر به نظر برسد، اما یک صدای شبیه‌سازی شده باید دقیقاً شبیه به یک شخص خاص باشد. برای توسعه‌دهندگان و کسب‌وکارها، انتخاب API اکنون به موازنه‌ای میان حجم صدای مرجع در دسترس، هزینه به ازای هر میلیون کاراکتر و ضرورت داشتن رضایت قانونی و قابل اثبات گوینده بستگی دارد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های مولد اشاره کردیم، توازن میان دسترسی سریع و امنیت داده‌ها همواره یک چالش است. اکثر پلتفرم‌ها اکنون دو مسیر ارائه می‌دهند: شبیه‌سازی «لحظه‌ای» (Instant) برای استقرار سریع و شبیه‌سازی «حرفه‌ای» (Professional) برای خلق صدای برند با وفاداری بالا.

شکاف میان شباهت و کیفیت

بر اساس مستندات جدول رتبه‌بندی Hume، طبیعی بودن صدا و هویت آن دو معیار متفاوت هستند. برای مثال، مدل sonic-3.6-beta متعلق به Cartesia با امتیاز ۴.۳۶ در صدر جدول طبیعی بودن قرار گرفت، اما در بخش هویت (شباهت به شخص) رتبه هشتم را کسب کرد. در مقابل، مدل TTS-2 شرکت Inworld با امتیاز ۴.۶۱، بالاترین کیفیت کلی صدا را ثبت کرد.

سایر امتیازات قابل توجه در این جدول شامل Cartesia sonic-3.5 با ۳.۷۰، ElevenLabs Multilingual v2 با ۳.۶۸، Cartesia sonic-3.6-beta با ۳.۶۳ و Inworld TTS-2 با ۳.۶۲ است. این داده‌ها که در Hugging Face منتشر شده‌اند، ثابت می‌کنند امتیاز بالای طبیعی بودن اگر با هویت گوینده همراه نباشد، فریبنده است و می‌تواند منجر به گم شدن هویت شخص هدف شود.

کالبدشکافی فنی ارائه‌دهندگان

  • ElevenLabs: سخت‌گیرترین سیستم امنیتی را دارد. شبیه‌سازی حرفه‌ای (PVC) آن نیازمند «کپچای صوتی» (Voice Captcha) است که در آن مالک صدا باید متنی را که روی صفحه نمایش داده می‌شود، بخواند. PVC به حداقل ۳۰ دقیقه صدای مرجع نیاز دارد، هرچند ۲ تا ۳ ساعت صدا ایده‌آل است. این قابلیت در طرح Creator و بالاتر در دسترس است. این پلتفرم از بیش از ۷۰ زبان پشتیبانی می‌کند. قیمت‌ها از ۵۰ دلار (برای مدل Flash) تا ۱۰۰ دلار به ازای هر ۱ میلیون کاراکتر برای مدل v3 متغیر است. نرخ API برای Eleven v3 و Multilingual v2 معادل ۰.۱۰ دلار به ازای هر ۱ هزار کاراکتر است، در حالی که مدل‌های Flash، Turbo و v3 Conversational هزینه ۰.۰۵ دلار دارند.

  • Fish Audio: پیشتاز فعلی در شباهت است. مدل S2.1 Pro آن ۸۳ زبان را پوشش می‌دهد و هزینه ثابت ۱۵ دلار به ازای هر ۱ میلیون بایت UTF-8 دارد. توجه داشته باشید که کاراکترهای غیرانگلیسی (مانند چینی، ژاپنی و کره‌ای) حدود ۳ بایت به ازای هر کاراکتر مصرف می‌کنند که عملاً هزینه را سه برابر می‌کند. شبیه‌سازی لحظه‌ای از حدود ۱۰ ثانیه صدا شروع می‌شود، اما نسخه‌های حرفه‌ای به ۱۰ تا ۱۸۰ دقیقه داده و تایید مالکیت زنده نیاز دارند. استفاده تجاری از طرح Plus با قیمت ۱۵ دلار آغاز می‌شود.

  • Cartesia: روی کاهش تأخیر (Latency) — یعنی فاصله زمانی بین ارسال دستور و شنیدن جواب، شبیه فاصله بین فشار دادن دکمه چراغ راهنمایی و روشن شدن آن — تمرکز کرده است. این رویکرد برای برنامه‌هایی که نیاز به پاسخ‌دهی آنی دارند حیاتی است، مشابه آنچه در بهینه‌سازی‌های زیر میلی‌ثانیه‌ای API شرکت Groq برای مدل‌های زبانی مشاهده کردیم. مدل‌های Sonic 3.6 و نسخه‌های جدیدتر از ۶۰ ثانیه صدا برای حفظ بهتر لهجه‌ها استفاده می‌کنند. شبیه‌سازهای حرفه‌ای روی بیش از ۳۰ دقیقه صدا آموزش می‌بینند و از طرح Startup با قیمت ۴۹ دلار شروع می‌شوند. سیستم پرداخت Sonic بر اساس ۱ کریدیت به ازای هر کاراکتر است؛ طرح‌ها از ۵ دلار برای ۱۰۰ هزار کریدیت تا ۲۹۹ دلار برای ۸ میلیون کریدیت متغیر است. این سرویس ۴۴ زبان را لیست کرده و هزینه نهایی آن حدود ۳۷ تا ۵۰ دلار به ازای هر ۱ میلیون کاراکتر است.

  • Inworld: ارزان‌ترین گزینه برای مقیاس‌های بزرگ است. مدل TTS-2 Flash در طرح‌های سطح بالا تنها ۷ دلار به ازای هر ۱ میلیون کاراکتر هزینه دارد. مدل Realtime TTS-2 در حالت On-demand قیمت ۲۵ دلار دارد که در طرح ۳۰۰ دلار در ماه به ۱۵ دلار و در طرح ۱۵۰۰ دلار در ماه به ۱۲.۵۰ دلار کاهش می‌یابد. این پلتفرم کتابخانه عظیمی از بیش از ۲۰۰ زبان و لهجه را پشتیبانی می‌کند که ۱۵ مورد از آن‌ها در سطح کیفیت برتر قرار دارند. شبیه‌سازی حرفه‌ای در حال حاضر در مرحله بتا است، به ۱۰ دقیقه صدا نیاز دارد و فعلاً فقط از انگلیسی پشتیبانی می‌کند.

  • Resemble AI: بر امنیت و اصالت تمرکز دارد. این شرکت از واترمارک PerTh برای تمام خروجی‌ها استفاده می‌کند و سیستم تشخیص جعل عمیق (Deepfake) را در خود ادغام کرده است. شبیه‌سازی سریع (Rapid Clone) به ۱۰ ثانیه صدا نیاز دارد و در کمتر از یک دقیقه آماده می‌شود، در حالی که شبیه‌سازی حرفه‌ای به ۱۰ تا ۲۵+ دقیقه صدا و حدود ۴۰ دقیقه زمان آموزش نیاز دارد. این شرکت رضایت صریح و قابل تایید گوینده را الزامی می‌داند. مدل Chatterbox Multilingual آن ۲۳ زبان را پوشش می‌دهد و دسترسی به API نیازمند طرح Business است.

  • Gradium: گزینه‌ای تخصصی برای بازارهای اروپایی است که توسط بنیان‌گذاران Kyutai ایجاد شده و از زبان‌های انگلیسی، فرانسوی، آلمانی، اسپانیایی و پرتغالی پشتیبانی می‌کند. طرح رایگان آن اجازه ساخت ۵ شبیه‌ساز برای مصارف غیرتجاری را می‌دهد. طرح‌های پولی از ۱۳ دلار برای ۲۲۵ هزار کریدیت (۱ کریدیت به ازای هر کاراکتر) شروع می‌شوند. شبیه‌سازی حرفه‌ای حداقل به ۳۰ دقیقه صدا نیاز دارد و از طرح M با قیمت ۳۴۰ دلار آغاز می‌شود.

  • Hume: با مدل Octave 2 بر روی انتقال احساسات و تحویل صدا بر اساس جهت‌دهی عاطفی تمرکز دارد و ۱۱ زبان را پوشش می‌دهد. حداقل صدای مورد نیاز برای آن ۱۵ ثانیه است که باید به صورت زنده ضبط یا توسط گوینده‌ای که رضایت داده، آپلود شود. استفاده تجاری از طرح Creator با ۱۴ دلار در ماه شروع می‌شود. کاراکترهای اضافی در طرح Creator به قیمت ۰.۱۵ دلار و در طرح Business به قیمت ۰.۰۵ دلار به ازای هر ۱ هزار کاراکتر محاسبه می‌شوند.

الزامات صدای مرجع و اخلاقیات

اکثر شبیه‌سازهای لحظه‌ای بین ۳ تا ۳۰ ثانیه صدا می‌خواهند. Inworld جسورانه‌ترین است و با تنها ۳ ثانیه کار می‌کند، هرچند نمونه‌های تا ۳۰ ثانیه شباهت را بهبود می‌بخشند. Hume سخت‌گیرترین است و کف ۱۵ ثانیه را برای مسیرهای لحظه‌ای تعیین کرده است.

در بخش حرفه‌ای، الزامات سخت‌گیرانه‌تر است. ElevenLabs برای PVC حدود ۲ تا ۳ ساعت صدا توصیه می‌کند، در حالی که Gradium و Resemble AI حداقل‌های خود را بین ۱۰ تا ۳۰ دقیقه قرار داده‌اند. شبیه‌سازهای حرفه‌ای Fish Audio می‌توانند تا ۱۸۰ دقیقه متریال مرجع را بپذیرند.

به گزارش Marktechpost، تنها ElevenLabs، Fish Audio و Resemble AI بررسی‌های فنی برای تایید رضایت گوینده در سطوح حرفه‌ای مستند کرده‌اند. ElevenLabs از کپچای صوتی، Fish Audio از بررسی مالکیت زنده و Resemble AI از رضایت قابل تایید استفاده می‌کند. سایرین به شرایط خدمات (ToS)، گواهی‌های حقوقی یا تاییدیه ساده کاربر اکتفا می‌کنند که این موضوع یک ریسک حقوقی و شکاف مسئولیت برای شرکت‌های بزرگی ایجاد می‌کند که به زنجیره custody (مالکیت) قابل اثبات برای استعدادهای صوتی نیاز دارند.

راهنمای استقرار: کدام API برای چه کاری؟

  • عامل‌های صوتی ارزان در مقیاس بالا: Inworld یا Fish Audio.
  • تأخیر کم با پوشش گسترده زبانی: Cartesia.
  • صدای برند با رضایت قانونی سخت‌گیرانه: ElevenLabs PVC.
  • زبان‌های اروپایی با تست رایگان: Gradium.
  • شبیه‌سازی همراه با واترمارک و تشخیص جعل: Resemble AI.
  • تولید صدا با هدایت احساسی: Hume.

این داده‌ها نشان می‌دهند بازار AI صوتی از مدل «یک ابزار برای همه» به سمت مجموعه‌ای از ابزارهای تخصصی (Specialized Stack) می‌رود. شما ممکن است از Inworld برای یک عامل صوتی ارزان با حجم بالای درخواست استفاده کنید، اما برای صدای رسمی یک شرکت که در آن رضایت قانونی غیرقابل مذاکره است، به ElevenLabs سوییچ کنید.

برای کاربر نهایی، این به معنای کاهش «هزینه کیفیت» است. توانایی Fish Audio در رسیدن به شباهت بالا با داده‌های حداقلی و قیمت ۱۵ دلار به ازای هر ۱ میلیون کاراکتر، فشار شدیدی بر ارائه‌دهندگان قدیمی وارد می‌کند تا یا حاشیه سود خود را کاهش دهند یا دقت هویت را به طور قابل توجهی افزایش دهند.

توسعه‌دهندگان باید اکنون به جای امتیاز «طبیعی بودن»، روی محک‌های «هویت» (Identity Benchmarks) تمرکز کنند. صدایی که انسانی به نظر برسد اما شبیه شخص هدف نباشد، در دنیای شبیه‌سازی یک شکست است.

گام بعدی شما

  • اگر به دنبال کاهش هزینه هستید، مدل‌های Inworld را برای عامل‌های حجیم تست کنید.
  • برای پروژه‌های حساس برندینگ، حتماً از مسیر PVC در ElevenLabs استفاده کنید تا ریسک حقوقی کاهش یابد.
  • در انتخاب مدل، به جای تکیه بر تبلیغات «طبیعی بودن»، نمونه‌های تست را با صدای مرجع مقایسه کنید.

اما ادغام تشخیص جعل عمیق در لحظه (Real-time Deepfake Detection) مستقیماً در جریان APIها، ترندی است که Resemble AI را پیشتاز کرده و احتمالاً تا سال ۲۰۲۷ به یک الزام قانونی برای رسانه‌های سنتتیک تجاری تبدیل می‌شود.

چرا این موضوع مهم است؟

این رتبه‌بندی با تکیه بر ارزیابی انسانی (Human Evaluation)، اعتبار ادعاهای بازاریابی شرکت‌ها را می‌گیرد و معیار «هویت» را جایگزین «طبیعی بودن» می‌کند. این تغییر باعث می‌شود توسعه‌دهندگان بر اساس داده‌های واقعی و نه وعده‌های تبلیغاتی، زیرساخت صوتی خود را انتخاب کنند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی به اکثر این سرویس‌ها برای توسعه‌دهندگان ایرانی دشوار است. با این حال، قیمت پایین Fish Audio می‌تواند برای تولیدکنندگان محتوای فارسی که از واسطه‌ها استفاده می‌کنند، جذاب باشد.

·نگاه ما
تحریریه دات‌هوش

تغییر معیار موفقیت از Naturalness به Identity نشان می‌دهد که مدل‌های صوتی از مرحله تقلید کلی از انسان به مرحله بازسازی دقیق فرد رسیده‌اند. این اتفاق باعث می‌شود مدل‌های ارزان‌قیمت اما دقیق مثل Fish Audio، مدل‌های گران‌قیمت‌تر را به چالش بکشند. در واقع، ما شاهد دموکراتیزه شدن صدای برندهای سطح بالا هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.