۱۵۰ میلیثانیه؛ این تنها فاصله زمانی است که تعیین میکند یک عامل هوش مصنوعی چقدر «انسانی» به نظر برسد. ElevenLabs Scribe v2 Realtime با هدف رسیدن به این سرعت، استانداردی جدید برای تبدیل زنده گفتار به متن تعریف کرده است.
طبق گزارشی که در ۲۱ اوت ۲۰۲۶ در وبسایت dev.to منتشر شد، این مدل برای محیطهای حساس به زمان، مانند عاملهای (Agents) مکالمهای و سامانههای مدیریت جلسات زنده طراحی شده است. بازشناسی گفتار (ASR) — شبیه به یک تندنویس حرفهای که همزمان با حرف زدن شما، کلمات را روی کاغذ میریزد — سالهاست با چالش موازنه میان سرعت و دقت دستوپنجه نرم میکند. این رقابت بر سر دقت، پیش از این در مقایسهی مدلهای OpenAI با ElevenLabs به نمایش گذاشته شد، جایی که چالشهای نرخ خطا مورد بحث قرار گرفت.
همانطور که در تحلیلهای قبلی ما دربارهی زیرساختهای استنتاج مدلهای صوتی اشاره کردیم، مدیریت جریان داده در لحظه، سختترین بخش توسعه است. Scribe v2 در بازاری وارد شده که در آن توانایی مدیریت نویزهای محیطی و اصطلاحات تخصصی، مرز بین یک محصول آزمایشی و یک ابزار تجاری است. در این راستا، بحث بر سر اینکه آیا قابلیتهای تشخیص نوبت گفتگو میتواند جایگزین دقت پایه شود، یکی از محورهای اصلی تکامل مدلهای STT است.
مشخصات فنی
به نقل از مستندات فنی این سرویس، ادغام Scribe v2 Realtime از طریق WebSocket یا REST API امکانپذیر است. محدودیتها و قابلیتهای کلیدی عبارتاند از:
- پشتیبانی صوتی: فرمتهای PCM (از ۸ تا ۴۸ کیلوهرتز) و کدگذاری μ-law.
- پوشش زبانی: پشتیبانی از بیش از ۹۰ زبان، شامل واژگان تخصصی فنی و پزشکی.
- مکانیزمهای کنترلی: تشخیص داخلی فعالیت صوتی (VAD) و کنترل دستی برای نهایی کردن متن.
با این حال، این سرویس نقاط ضعف مشخصی دارد. طبق اعلام بخش پرسشهای متداول شرکت، پشتیبانی از کانالهای دوگانه در برنامه نیست و تفکیک گوینده (Speaker Diarization) — یعنی توانایی تشخیص اینکه هر جمله متعلق به کدام شخص است — در حال حاضر در اولویت توسعه قرار ندارد.
برای توسعهدهندگان، این یعنی Scribe v2 یک ابزار تخصصی است، نه یک راهکار جامع. اگر گردش کار شما به شناسایی دقیق هر شرکتکننده در یک تماس گروهی نیاز دارد، باید یک لایه طراحی ثانویه برای ردیابی هویتها اضافه کنید.
هزینه این سرویس بر اساس مدل اعتبار مشترک است. ElevenLabs قیمت آن را حدود ۳۳۰ اعتبار در دقیقه اعلام کرده، هرچند در طرحهای تجاری سالانه، این هزینه به ۰.۲۸ دلار در ساعت کاهش مییابد. این ساختار قیمتی در ادامهی سیاستهای هزینهای Scribe است که پیشتر برای تبدیل صوت به متن تعریف شده بود.
گام بعدی شما
- اگر در حال ساخت باتهای صوتی هستید، تأخیر ۱۵۰ میلیثانیهای را در محیط تست بسنجید تا از عدم قطع شدن جریان مکالمه مطمئن شوید.
- برای کاربردهای پزشکی یا مهندسی، دقت مدل را روی واژگان تخصصی حوزه خود آزمایش کنید.
- در صورت نیاز به تفکیک گوینده، از ترکیب این API با یک مدل جانبی تشخیص هویت استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو