پرش به محتوای اصلی
پرش به محتوای مقاله

ElevenLabs در برابر Speechify؛ تفاوت قیمت در مقابل کیفیت

·۱۶ مهر ۱۴۰۵۹ دقیقه مطالعه
رده‌بندی APIهای تبدیل متن به گفتار در ۲۰۲۶: آزمون نابینا و هزینه واقعی ۵ میلیون کاراکتر
رده‌بندی APIهای تبدیل متن به گفتار در ۲۰۲۶: آزمون نابینا و هزینه واقعی ۵ میلیون کاراکتر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای شکاف قیمتی ۱۰ برابری میان مدل‌های با کیفیت مشابه و هشدار درباره تاریخ دقیق خاموشی سرویس‌های قدیمی OpenAI در ۶ ژانویه ۲۰۲۷.

اگر امروز برای سرویس‌های تبدیل متن به گفتار هزینه می‌پردازید، احتمالاً برای کیفیتی پرداخت می‌کنید که در مدل‌های ارزان‌تر هم یافت می‌شود. تفاوت قیمت میان مدل‌های برتر این حوزه اکنون به ۱۰ برابر رسیده است، در حالی که گوش انسان به‌سختی می‌تواند تفاوت کیفیت آن‌ها را تشخیص دهد. تحلیل‌های مربوط به تست‌های کور (Blind-test) نشان می‌دهد که شکاف قیمتی بین ۱۰ مدل برتر، بسیار گسترده‌تر از شکاف کیفی آن‌هاست.

انتخاب یک API برای تبدیل متن به گفتار (TTS) — شبیه انتخاب یک گوینده برای رادیو است که باید هم صدای خوبی داشته باشد و هم دستمزدش با بودجه شما همخوانی کند — دیگر یک تصمیم ساده‌ی فنی نیست، بلکه یک محاسبه‌ی مالی است. انتخاب یک API در ابتدا ساده به نظر می‌رسد، تا زمانی که صورت‌حساب بر اساس تعداد کاراکترها صادر شود، کاربران متوجه تأخیر (Lag) قبل از شنیدن اولین کلمه شوند، یا مدل کلمات اختصاری مثل «.Dr» را به هر شکلی که دوست دارد بخواند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، توسعه‌دهندگان اکنون با یک بحران زمانی مواجه‌اند. OpenAI در ۱ اکتبر ۲۰۲۶ تمامی مدل‌های مربوط به نقطه اتصال /v1/audio/speech را منسوخ کرد و تاریخ ۶ ژانویه ۲۰۲۷ را برای خاموشی کامل تعیین نموده است. این اقدام هزاران برنامه را مجبور می‌کند تا در بازه‌ای کوتاه، زیرساخت صوتی خود را تغییر دهند. جایگزین این سرویس، مدل gpt-realtime-2.1-mini است که یک مدل Realtime API است. این یعنی جایگزینی درخواست‌های ساده REST با نشست‌های WebSocket یا WebRTC و تغییر هزینه به ۲۰ دلار به‌ازای هر میلیون توکن خروجی صوتی.

برای سنجش اثر واقعی این تغییرات، آزمونی با شبیه‌سازی حجم کاری یک کلینیک در آمریکا اجرا شد: ۵ میلیون کاراکتر در ماه، یا حدود ۳۹ هزار یادآور قرار ملاقات. متن محک یک پیام ۱۲۸ کاراکتری بود: «قرار شما با دکتر پاتل برای سه‌شنبه ۱۳ اکتبر ساعت ۲:۳۰ بعد از ظهر تأیید شد. مبلغ پرداختی شما ۴۵.۵۰ دلار است. سوالی دارید؟ با شماره (۵۵۵) ۰۱۰-۱۲۳۴ تماس بگیرید.» این بنچمارک نشان می‌دهد که صورت‌حساب‌های ماهانه بر اساس تعداد کاراکتر (Metered Billing) چقدر می‌توانند نوسان داشته باشند.

پیشتازان کیفیت

به نقل از داده‌های Voice Arena در ۶ اکتبر ۲۰۲۶، شرکت ElevenLabs دو جایگاه نخست را در اختیار دارد. کیفیت در اینجا بر اساس رتبه‌بندی Elo و انتخاب کاربران بین دو کلیپ ناشناس تعیین شده است؛ به این صورت که شنوندگان دو کلیپ بی‌نام را می‌شنوند و یکی را انتخاب می‌کنند. این فرآیند رتبه‌بندی Elo را برای ۹۲ مدل ایجاد کرده است. مدل Eleven v4 Turbo با امتیاز ۱۳۳۴ در صدر است و مدل Eleven v4 (منتشر شده در ۲۸ سپتامبر ۲۰۲۶) با امتیاز ۱۳۲۱ در رتبه دوم قرار دارد. هر دو مدل از بیش از ۹۰ زبان و شبیه‌سازی صدای باکیفیت (High-fidelity voice cloning) پشتیبانی می‌کنند.

رتبه‌بندی APIهای تبدیل متن به گفتار در ۲۰۲۶: آزمون کور و هزینه واقعی ۵ میلیون کاراکتر

اما این کیفیت هزینه‌ی بالایی دارد. ElevenLabs میانگین استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره‌ی آموزش آشپز — را برای v4 Turbo روی سرورهای خود ۱۰۰ میلی‌ثانیه اعلام کرده است. قیمت هر ۱۰۰۰ کاراکتر برای v4 معادل ۰.۰۸ دلار و برای v4 Turbo و Flash v2.5 معادل ۰.۰۴ دلار است. در نتیجه، هزینه عملیات کلینیک روی v4 حدود ۴۰۰ دلار و روی Turbo حدود ۲۰۰ دلار می‌شود.

در مقابل، مدل Speechify Simba 3.2 در رتبه هشتم (امتیاز ۱۲۴۲) قرار دارد اما ارزان‌ترین نرخ منتشر شده برای سرویس‌های خودکار (Self-serve) را در بین ۱۰ مدل برتر ارائه می‌دهد. با نرخ‌های ۱۰ دلار به‌ازای هر میلیون در طرح Starter، ۸ دلار در Pro و ۶ دلار در Scale، هزینه عملیات کلینیک به ۴۱ دلار کاهش می‌یابد. Speechify زمان شروع پخش اولین صدا (First-audio times) را ۱۰۶ میلی‌ثانیه روی Coval و ۱۲۳ میلی‌ثانیه روی Voice Arena اعلام کرده است، هرچند دسترسی کاربران عادی در Simba 3.2 به زبان انگلیسی و در Simba 3.0 به شش زبان محدود است.

شکاف در تلفظ و دقت

کیفیت فقط مربوط به لحن نیست، بلکه به دقت هم بستگی دارد. آزمونی روی اعداد، تاریخ‌ها و کدها نشان داد که حتی مدل‌های برتر در خواندن اختصارات مشکل دارند. برای مثال، اختصار «.Tue» (سه‌شنبه) توسط چندین مدل به اشتباه عدد «دو» (Two) خوانده شد.

  • Eleven v4: امتیاز ۹۱.۷٪ در تست‌های تلفظ
  • Gemini 3.8 Flash TTS: امتیاز ۸۹.۵٪
  • Cartesia Sonic-3.6: امتیاز ۷۴.۵٪ (عقب‌ماندگی قابل توجه)

مدل‌های وزن‌باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده و نه فقط غذای آماده — مانند Kokoro-82M و Piper نیز در تست «.Tue» شکست خوردند. در اجرای این مدل‌ها روی پردازنده M3 Pro MacBook Pro و تبدیل صوت به متن توسط faster-whisper 1.2.1، مدل Kokoro-82M (نسخه af_heart) تاریخ را به صورت «تأیید شد برای ۲ اکتبر ۱۳» خواند و شماره تلفن را به شکلی نامفهوم و غیرقابل شماره‌گیری بیان کرد. مدل Piper (نسخه en_US-lessac-medium) آن را به صورت «تأیید شد برای ۲.۰۰ اکتبر ۱۳» خواند.

برای حل این مشکل، استفاده از یک لایه نرمال‌سازی با Python Regex ضروری است. نویسنده این تحقیق تابعی را پیاده کرد تا اختصارات روزها (مثلاً Mon به Monday) و ماه‌ها (مثلاً Jan به January) را باز کند و «.Dr» را به «Doctor» تبدیل کند. همچنین شماره‌های تلفن آمریکا را طوری فرمت کرد که هر رقم به صورت جداگانه و با مکث بین گروه‌ها خوانده شود. پس از این اصلاحات، هر دو مدل Kokoro و Piper توانستند تاریخ‌ها و شماره‌ها را درست بخوانند.

غول‌های ابری و جایگزین‌ها

برای کسانی که با قراردادهای ابری بزرگ در ارتباط‌اند، گزینه‌ها متفاوت است. مدل Neural HD شرکت Azure AI Speech در رتبه ۲۸ با قیمت ۲۲ دلار به‌ازای هر میلیون کاراکتر در منطقه East US قرار دارد، در حالی که صدای Neural استاندارد آن در رتبه ۶۸ با قیمت ۱۵ دلار است.

مدل Gemini 3.8 Flash TTS گوگل با امتیاز ۱۲۷۵ در رتبه پنجم است. قیمت این مدل تا ۳۱ دسامبر ۲۰۲۶ بسیار پایین است (۰.۵۰ دلار به‌ازای هر میلیون توکن متنی ورودی و ۹ دلار به‌ازای هر میلیون توکن صوتی خروجی)، اما از ۱ ژانویه ۲۰۲۷ قیمت‌ها دو برابر می‌شوند. سایر گزینه‌های گوگل مثل Chirp 3 HD در رتبه ۵۸ با قیمت ۳۰ دلار به‌ازای هر میلیون کاراکتر قرار دارند (اولین میلیون کاراکتر رایگان است).

رده‌بندی APIهای تبدیل متن به گفتار در ۲۰۲۶: آزمون نابینا و هزینه واقعی ۵ میلیون کاراکتر

صداهای مولد (Generative) Amazon Polly در رتبه ۵۳ با قیمت ۳۰ دلار و صداهای Neural آن در رتبه ۹۰ از ۹۲ مدل با قیمت ۱۶ دلار به‌ازای هر میلیون کاراکتر قرار گرفته‌اند.

مدل Inworld TTS-2 (رتبه هفتم، امتیاز ۱۲۵۱) یک مزیت استراتژیک برای مهاجران OpenAI دارد؛ زیرا دقیقاً از همان فرمت درخواست POST /v1/audio/speech استفاده می‌کند. توسعه‌دهندگان می‌توانند تنها با تغییر آدرس API به https://api.inworld.ai/v1 و تغییر نام مدل به inworld-tts-2 سیستم خود را منتقل کنند. هزینه این سرویس ۲۵ دلار به‌ازای هر میلیون کاراکتر در حالت On-demand است یا ۱۷.۵۰ دلار در طرح Builder (با هزینه ۱۰۰ دلار). هزینه عملیات کلینیک در این مدل ۱۲۵ دلار در حالت On-demand یا مبلغ ثابت ۱۰۰ دلار در طرح Builder است.

مدل‌های تخصصی و حاشیه‌ای

خارج از لیست ۱۰ مدل برتر، توازن‌های متفاوتی وجود دارد:

  • Alibaba Qwen-Audio: مدل Qwen-Audio-3.1-TTS-Plus در رتبه سوم (امتیاز ۱۲۹۲) است اما فاقد منطقه آمریکا است و فقط در پکن و سنگاپور در دسترس است. مدل 3.0 Plus در سنگاپور ۰.۲۰ دلار به‌ازای هر ۱۰,۰۰۰ کاراکتر هزینه دارد که هزینه عملیات کلینیک را به ۱۰۰ دلار می‌رساند.
  • Cartesia Sonic-3.6: رتبه چهارم (امتیاز ۱۲۷۸) با تأخیر زیر ۹۰ میلی‌ثانیه. این مدل قابلیت «تثبیت مدل» (Model Pinning) را دارد، به این معنی که اسنپ‌شات‌های sonic-3.6-YYYY-MM-DD هرگز تغییر نمی‌کنند. هزینه عملیات کلینیک در طرح Startup (۴۹ دلار در ماه برای ۱.۲۵ میلیون اعتبار) معادل ۲۱۷.۷۵ دلار است.
  • MiniMax Speech 2.8 HD: رتبه ۱۹ اما گران‌ترین مدل با قیمت ۱۰۰ دلار به‌ازای هر میلیون کاراکتر (۵۰۰ دلار برای عملیات کلینیک). این مدل از درخواست‌های async طولانی تا ۱ میلیون کاراکتر و شبیه‌سازی سریع صدا با قیمت ۱.۵۰ دلار پشتیبانی می‌کند.
  • Fish Audio S2.1 Pro: رتبه ۲۴ با قیمت ۱۵ دلار به‌ازای هر میلیون بایت UTF-8. در متون انگلیسی ساده هزینه حدود ۷۵ دلار است، اما در متون CJK (چینی، ژاپنی، کره‌ای) یا متون دارای Accent، تعداد بایت‌ها و در نتیجه هزینه افزایش می‌یابد.
  • Deepgram Flux TTS: منتشر شده در ۱۲ اوت ۲۰۲۶. این مدل کل تماس را در زمینه (Context) نگه می‌دارد و گزارش می‌دهد که کاربر هنگام وقفه‌ها چه چیزی شنیده است. مدل Aura-2 هزینه ۰.۰۳۰ دلار و Flux TTS هزینه ۰.۰۴۵ دلار به‌ازای هر ۱۰۰۰ کاراکتر دارد.
  • Rime: مدل Coda (رتبه ۵۵) هزینه ۰.۰۵ دلار و مدل Mist v3 هزینه ۰.۰۳ دلار به‌ازای هر ۱۰۰۰ کاراکتر دارد.
  • Hume Octave 2: رتبه ۶۱، اما برای قیمت‌گذاری نیاز به استعلام مستقیم دارد زیرا صفحه قیمت‌ها به صفحه اصلی منتقل می‌شود.

موازنه مدل‌های وزن‌باز

اجرای مدل‌های محلی، صورت‌حساب‌های ماهانه را با مدیریت زیرساخت جایگزین می‌کند. مدل Kokoro-82M (رتبه ۵۴) تحت لایسنس Apache 2.0 است. مدل Piper روی پردازنده CPU حدود ۴۰ برابر سریع‌تر از زمان واقعی اجرا شد، اما مخزن اصلی MIT آن در ۶ اکتبر ۲۰۲۵ آرشیو شد و اکنون تحت لایسنس GPL-3.0 با نام piper1-gpl ادامه می‌یابد. هر دو مدل از espeak-ng (GPL-3.0) استفاده می‌کنند.

رتبه‌بندی APIهای تبدیل متن به گفتار در ۲۰۲۶: آزمون کور و هزینه واقعی ۵ میلیون کاراکتر

سایر گزینه‌ها شامل Chatterbox (MIT) و Orpheus (Apache 2.0) هستند. با این حال، مدل‌های رتبه‌بالای وزن‌باز مانند Breeze TTS 2 (رتبه ۱۱) و Fish Audio S2 Pro محدود به استفاده پژوهشی و غیرتجاری هستند و برای کاربردهای تجاری مثل کلینیک مناسب نیستند. این روند بهینه سازی مدل‌ها با پیشرفت‌های اخیر در شبیه‌سازی صدای انسان روی موبایل همسو است که امکان اجرای سریع‌تر مدل‌ها را فراهم کرده است.

تحلیل: چرخش به سمت ارزش

برای یک توسعه‌دهنده، نتیجه این است که «سقف کیفیت» لمس شده است. تفاوت بین رتبه اول و هشتم برای اکثر کاربران غیرقابل تشخیص است، اما تفاوت هزینه تقریباً ۱۰ برابر است. مدل Simba 3.2 در رتبه هشتم است اما هزینه آن یک‌دهم Eleven v4 است.

ما از عصر «یافتن صدایی که انسانی به نظر برسد» به عصر «بهینه‌سازی هزینه به‌ازای هر کاراکتر» وارد شده‌ایم. برندگان سال ۲۰۲۶ مدل‌هایی هستند که کیفیت «به اندازه کافی خوب» را با ظرفیت پردازشی بالا (High-concurrency caps) و قیمت پیش‌بینی‌پذیر ارائه می‌دهند.

اگر از نقاط اتصال قدیمی OpenAI استفاده می‌کنید، زمان شما در حال اتمام است. انتقال به Realtime API، درخواست‌های ساده را با WebSocket جایگزین می‌کند و هزینه را به ۲۰ دلار به‌ازای هر میلیون توکن خروجی می‌رساند. مدل tts-1 تا تاریخ ۶ ژانویه با قیمت ۱۵ دلار به‌ازای هر میلیون کاراکتر باقی می‌ماند.

برای جلوگیری از مهاجرت دوباره، توسعه‌دهندگان باید از اسنپ‌شات‌های تاریخ‌دار مدل‌ها استفاده کنند و نقاط اتصال سازگار با OpenAI یا مدل‌های وزن‌باز را ترجیح دهند. قبل از انتخاب تأمین‌کننده، اسکریپت‌های واقعی یک ماه اخیر خود (شامل SSML) را استخراج کرده و تعداد کاراکترها را دقیقاً محاسبه کنید. سخت‌ترین رشته‌های متنی خود (نام داروها، کدهای سفارش و تاریخ‌ها) را از یک لایه نرمال‌سازی عبور دهید و آن‌ها را روی سه مدل کاندید در منطقه استقرار واقعی خود (مثلاً us-east-1) تست کنید، زیرا تأخیر اعلامی شرکت‌ها در سمت سرورهای آن‌هاست، نه در سمت شما.

گام بعدی شما

  • اسکریپت‌های واقعی یک ماه اخیر خود را استخراج کرده و تعداد کاراکترها را دقیقاً محاسبه کنید.
  • سخت‌ترین رشته‌های متنی خود (نام داروها، کدهای سفارش و تاریخ‌ها) را از یک لایه نرمال‌سازی عبور دهید.
  • سه مدل کاندید را در منطقه استقرار واقعی خود (مثلاً us-east-1) تست کنید، زیرا تأخیر اعلامی شرکت‌ها همیشه با واقعیت کاربر متفاوت است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش نشان می‌دهد که در بازار TTS، اعتبار فنی جای خود را به بهینه‌سازی مالی داده است. مهاجرت اجباری از OpenAI در ژانویه ۲۰۲۷، فرصتی برای بازنگری در هزینه‌های زیرساختی صوتی هزاران شرکت است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی به مدل‌های برتر مانند ElevenLabs برای توسعه‌دهندگان ایرانی دشوار است و این موضوع اهمیت مدل‌های وزن‌باز مانند Kokoro را برای بازار داخلی دوچندان می‌کند.

·نگاه ما
تحریریه دات‌هوش

سقف کیفیت در مدل‌های TTS به نقطه‌ای رسیده است که بازدهی افزایش کیفیت با هزینه پرداختی متناسب نیست. اکنون استراتژی برنده، پذیرش کیفیت «کافی» در برابر کاهش شدید هزینه‌هاست. توسعه‌دهندگانی که روی مدل‌های گران‌قیمت متکی مانده‌اند، در رقابت با کسانی که از مدل‌های بهینه مثل Simba استفاده می‌کنند، از نظر حاشیه سود شکست خواهند خورد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.