اگر برای تبدیل جلسات شلوغ یا سخنرانیهای چندنفره به متن زمان زیادی صرف میکنید، ابزار جدید ElevenLabs میتواند این فرآیند را به یک ویرایش ساده تبدیل کند. این سرویس برخلاف ابزارهای رایگان، میتواند تا ۳۲ گوینده مختلف را شناسایی و حتی اتفاقات غیرگفتاری مثل خنده را برچسبگذاری کند. این تمرکز بر تفکیک گویندگان در حالی است که بحث بر سر جایگزینی قابلیتهای تشخیص نوبت گفتگو با دقت پایه در سیستمهای STT همچنان در میان متخصصان ادامه دارد.
طبق اعلام رسمی این شرکت در ۱۶ اوت ۲۰۲۶، سرویس Scribe برای کاربرانی طراحی شده که به چیزی فراتر از یک متن خام نیاز دارند. اکثر ابزارهای تبدیل گفتار به متن در مواجهه با هرجومرج پنلهای گفتگو یا کلاسهای درس شکست میخورند. Scribe با ارائه برچسبهای زمانی در سطح کلمه و تشخیص خودکار زبان در بیش از ۹۰ زبان و لهجه، این مشکل را حل میکند. این سطح از دقت، ElevenLabs را در جایگاهی برتر قرار میدهد، بهویژه آنکه برخی مدلهای جدید بازشناسی گفتار OpenAI در زمینه نرخ خطا با چالشهایی روبرو بودهاند.
همانطور که در تحلیلهای قبلی ما دربارهی اکوسیستم تولید محتوای صوتی اشاره کردیم، ادغام قابلیتهای مختلف در یک پلتفرم، تجربه کاربر را دگرگون میکند. در این راستا، Scribe به ویرایشگران اجازه میدهد بخشهای متنی را جدا کرده یا برچسب گوینده را تغییر دهند، در حالی که متن همچنان با دقت میلیثانیهای با صوت هماهنگ است.
بر اساس مستندات صفحه محصول، مشخصات فنی این سرویس به شرح زیر است:
- فرمتهای ورودی: MP3, WAV, M4A, AAC, FLAC, OGG و فرمتهای اصلی ویدئویی.
- گزینههای خروجی: TXT, DOCX, PDF, SRT, VTT, JSON و HTML.
- ردیابی گوینده: برچسبگذاری خودکار برای حداکثر ۳۲ صدای مجزا.
بزرگترین چالش برای کاربران جدید، مدل قیمتگذاری است. ElevenLabs از یک سیستم اعتباری مشترک استفاده میکند که در آن هر دقیقه تبدیل صوت به متن حدود ۳۳۰ اعتبار هزینه دارد. اگرچه طرح رایگان ۱۰,۰۰۰ اعتبار ماهانه میدهد، اما این مقدار تنها برای حدود ۳۰ دقیقه صوت کافی است و پس از آن نیاز به ارتقای حساب است. این مدل هزینهای در حالی معرفی میشود که برخی استارتاپهای اروپایی تلاش کردهاند هزینههای تبدیل گفتار به متن را بدون افت کیفیت کاهش دهند.
به نظر ما، این حرکت استراتژیک، تبدیل صوت به متن را از یک مسئله «جمعآوری دادههای خام» به یک «گردشکار ویرایشی» تبدیل میکند. ElevenLabs با ترکیب این قابلیت با سیستمهای سنتز صدای باکیفیت خود، در حال تبدیل شدن به یک مرکز جامع هوش مصنوعی صوتی است، نه فقط یک تولیدکننده صدا.
گام بعدی شما
- یک فایل صوتی با نویز پسزمینه و تداخل صدای گویندگان را تست کنید تا ببینید آیا دقت برچسبها با هزینه ۳۳۰ اعتبار در دقیقه همخوانی دارد یا خیر.
- فرمتهای خروجی SRT یا VTT را برای ساخت زیرنویسهای دقیق آزمایش کنید.
- میزان مصرف اعتبارات خود را در پنل کاربری رصد کنید تا غافلگیر نشوید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو