پرش به محتوای اصلی
پرش به محتوای مقاله

Sarvam AI: نرخ خطای تبدیل گفتار در محیط‌های نویزی به نصف رسید

·۵ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
مدل تبدیل گفتار به متن ساراس وی۴ برای ۲۲ زبان هندی و انگلیسی جهانی
مدل تبدیل گفتار به متن ساراس وی۴ برای ۲۲ زبان هندی و انگلیسی جهانی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از رمزگشای ترکیبی فضای حالت (Hybrid State-Space) به‌جای ترنسفورمر خالص برای بهینه‌سازی صوت‌های طولانی و معرفی قابلیت Keyterm Prompting برای حذف توهم در نام برندها.

اگر از مدل‌های عمومی برای تبدیل گفتار به متن در محیط‌های شلوغ استفاده می‌کنید، احتمالاً با نرخ خطای بالایی دست‌وپنجه نرم کرده‌اید. حالا مدل جدید Saaras V4 ادعا می‌کند که این مشکل را در محیط‌های پرنویز، به‌ویژه برای زبان‌های هندی، تا ۵۰٪ بهبود بخشیده است.

به نقل از گزارش‌های فنی، این مدل توانسته است نرخ خطای کلمه (Word Error Rate) را در فایل‌های صوتی فشرده و دارای صدای پس‌زمینه، به کمتر از نیمی از میزان خطای GPT-4o Transcribe و Deepgram Nova-3 برساند. این دستاورد برای محیط‌های واقعی در هند که با لهجه‌های متنوع و نویز محیطی شدید شناخته می‌شوند، یک جهش عملکردی محسوب می‌شود.

بازشناسی گفتار (ASR) برای زبان‌های هندی همواره به دلیل تنوع در رسم‌الخط و لهجه‌های غلیظ با چالش روبرو بوده است. در حالی که مدل‌های جهانی پشتیبانی گسترده‌ای ارائه می‌دهند، اما اغلب در ثبت ظرافت‌های آوایی ۲۲ زبان رسمی هند شکست می‌خورند. این چالش‌ها پیش‌تر در بررسی‌های مربوط به سوگیری‌های منطقه‌ای در بنچمارک‌های ASR مورد تحلیل قرار گرفته بود. شرکت Sarvam AI مدل Saaras V4 را به عنوان یک جایگزین تخصصی معرفی می‌کند که تمامی این زبان‌ها را در یک سیستم واحد و منسجم ادغام کرده است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های زبانی تخصصی اشاره کردیم، تمرکز بر داده‌های بومی معمولاً نتایجی فراتر از مدل‌های General-purpose به همراه دارد.

معماری سیستم

بر اساس گزارش Marktechpost در ۲۶ سپتامبر ۲۰۲۶، این مدل بر پایه معماری رمزگذار-رمزگشا (Encoder-Decoder) بنا شده است. ابتدا یک رمزگذار صوتی، موج‌های صدا را به بردار معنایی (Embedding) تبدیل می‌کند تا جزئیات آوایی و آکوستیک حفظ شوند. سپس یک آداپتور کاهش‌نمونه زمانی (Temporal-downsampling adapter)، توالی‌ها را کوتاه می‌کند و آن‌ها را به فضای بردار مدل زبانی منتقل می‌کند. این فرآیند تضمین می‌کند که ضبط‌های طولانی در محدوده بودجه متنی (Context Budget) رمزگشا باقی بمانند. این سازوکار در واقع نمونه‌ای از نحوه تبدیل داده‌های خام به پیش‌بینی‌های دقیق از طریق مکانیزم استنتاج در مدل‌های مدرن است.

قلب تپنده این سیستم، مدل Sarvam-3B است؛ یک مدل زبانی با ۳ میلیارد پارامتر و معماری ترکیبی فضای حالت (Hybrid State-Space) که به‌صورت داخلی و از صفر آموزش دیده است. این رمزگشا ویژگی‌های صوتی را در کنار یک پرامپت متنی می‌خواند و متن نهایی را به‌صورت خودبازگشتی (Autoregressive) تولید می‌کند، به این صورت که هر توکن تولید شده را به عنوان ورودی برای توکن بعدی بازمی‌گرداند.

مشخصات فنی و محک‌های ارزیابی

  • پوشش زبانی: پشتیبانی از ۲۲ زبان رسمی هند به علاوه لهجه‌های مختلف انگلیسی جهانی. Sarvam گزارش می‌دهد که در تمامی این ۲۲ زبان به دقت سطح استانداردهای جهانی (State-of-the-art) دست یافته است.
  • بنچمارک انگلیسی: این مدل در هفت مجموعه داده ارزیابی شده است. شش مورد از این داده‌ها مربوط به Open ASR Leaderboard در Hugging Face (شامل AMI، GigaSpeech، LibriSpeech clean، LibriSpeech other، SPGISpeech و VoxPopuli) و مورد هفتم مربوط به Svarah از AI4Bharat با لهجه هندی است. Saaras V4 کمترین میانگین WER را در میان مدل‌های مورد آزمایش ثبت کرده است.
  • عملکرد در زبان‌های هندی: در مجموعه داده Vistaar، نتایج با استفاده از هر دو معیار WER و LLM-WER اندازه‌گیری شدند. معیار دوم یک بررسی معنایی را اضافه می‌کند تا خطاهای واقعی در معنا را از تغییرات بی‌ضرر در املای کلمات یا فرمت‌بندی که در رسم‌الخط‌های هندی رایج است، تفکیک کند.
  • صداهای نویزی: در مجموعه داده Kathbath Noisy، که شامل ضبط‌های بریده‌شده و دارای صدای پس‌زمینه شدید است، نرخ خطای LLM-WER این مدل کمتر از ۵۰٪ رقبای نزدیکش گزارش شده است.
  • دقت کلمات کلیدی: در محک IndicContextEval L5 (بر اساس مقاله Interspeech 2026)، این مدل با استفاده از قابلیت Keyterm Prompting به نرخ خطای ۱۶.۰۳٪ رسید که کمترین امتیاز در این بنچمارک است.
  • شناسایی زبان: نرخ خطا برای ۱۰ زبان برتر هندی ۲.۹٪ و برای تمامی ۲۲ زبان در نمونه‌های تأیید شده IndicVoices، مقدار ۵.۲۲٪ گزارش شده است.

حالت‌های خروجی متنوع

مدل Saaras V4 برای حذف نیاز به پردازش‌های تکمیلی خارجی، پنج حالت خروجی بومی را از طریق یک پارامتر واحد ارائه می‌دهد. این رویکرد از انباشت خطاها که معمولاً در مراحل پس‌پردازش رخ می‌دهد، جلوگیری می‌کند:
۱. Transcribe (پیش‌فرض): تبدیل به رسم‌الخط بومی با نرمال‌سازی اعداد و تاریخ‌ها.
۲. Verbatim: ثبت دقیق هر کلمه همان‌طور که گفته شده است، با حفظ تکیه‌کلام‌ها و اعداد تلفظ شده.
۳. Codemix: استفاده از رسم‌الخط بومی، اما کلمات انگلیسی به زبان انگلیسی باقی می‌مانند (ایده‌آل برای برندهایی مانند PhonePe).
۴. Translit: تبدیل کامل گفتار به رسم‌الخط لاتین.
۵. Translate: ترجمه مستقیم به انگلیسی همراه با نرمال‌سازی اعداد.

استقرار و قیمت‌گذاری

این مدل هم‌اکنون از طریق API با شناسه model="saaras:v4" در دسترس است. قیمت‌گذاری Sarvam AI مبلغ ۳۰ روپیه به‌ازای هر ساعت برای پردازش‌های بلادرنگ، استریمینگ و دسته‌ای است که در صورت فعال‌سازی تفکیک گوینده (Speaker Diarization)، به ۴۵ روپیه افزایش می‌یابد.

  • استریمینگ: از طریق WebSocket با زمان تا نخستین توکن (TTFT) زیر ۱۵۰ میلی‌ثانیه مدیریت می‌شود.
  • REST: تبدیل هم‌گام برای کلیپ‌های صوتی تا ۳۰ ثانیه.
  • دسته‌ای (Batch): پردازش نامتقارن برای فایل‌های صوتی تا ۲ ساعت.
  • SDKها: پشتیبانی از Python 3.9+ و Node.js 18+ و ادغام با LiveKit Agents، Pipecat و Vercel AI SDK.

با این حال، شرکت اشاره کرده است که مستندات میزبانی شخصی (Self-hosting) در SageMaker فعلاً فقط از نسخه v3 پشتیبانی می‌کند و نسخه V4 فعلاً انحصاری API است و وزن‌های باز (Open Weights) آن منتشر نشده است.

چرخش به سمت رمزگشای ترکیبی فضای حالت، نشان‌دهنده فاصله گرفتن از معماری‌های صرفاً ترنسفورمر (Transformer) در حوزه صوت است. Sarvam AI با کاهش طول توالی از طریق آداپتور زمانی، استنتاج برای فایل‌های صوتی طولانی را بدون از دست دادن جزئیات آوایی مورد نیاز برای زبان‌های کم‌منبع (Low-resource) بهینه کرده است.

برای جامعه فنی، مهم‌ترین نکته پیاده‌سازی «پرامپت‌نویسی کلمات کلیدی» (Keyterm Prompting) است. این ویژگی به کاربران اجازه می‌دهد لیستی از حداکثر ۵۰ اصطلاح (هر کدام تا ۶۴ کاراکتر) را در قالب JSON ارسال کنند تا مدل در بازشناسی آن‌ها سوگیری مثبت داشته باشد. اگرچه این قابلیت خروجی را تضمین نمی‌کند، اما مشکل «نام برندها» را حل می‌کند؛ جایی که اصطلاحات تخصصی معمولاً توسط مدل‌های ASR عمومی دچار توهم (Hallucination) می‌شوند.

البته باید دید آیا این اعداد گزارش‌شده توسط شرکت در بازبینی‌های مستقل تأیید می‌شوند یا خیر، زیرا هنوز هیچ حسابرسی شخص ثالثی منتشر نشده است. صنعت اکنون منتظر است ببیند آیا این رویکرد تخصصی می‌تواند بر مقیاس‌پذیری مدل‌های Generalist مانند OpenAI و Deepgram در بازارهای غیرانگلیسی غلبه کند یا خیر.

گام بعدی شما

  • توسعه‌دهندگانی که از نسخه v3 استفاده می‌کنند، تنها با تغییر یک خط کد در API می‌توانند بهبود دقت در زبان‌های هندی را تست کنند.
  • اگر با اصطلاحات تخصصی یا نام برندهای خاص در صوت‌ها سر و کار دارید، قابلیت Keyterm Prompting را برای کاهش توهمات مدل امتحان کنید.
  • برای کاهش هزینه‌ها، ابتدا از حالت Transcribe استفاده کنید و تنها در صورت نیاز به تفکیک گوینده، هزینه اضافی Diarization را بپذیرید.

اما تأثیر این معماری جدید بر مصرف حافظه در لبه (Edge) حتی جذاب‌تر است — به تحلیل ما درباره‌ی مدل‌های کوچک زبانی (SLM) مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش چشم‌گیر نرخ خطا در محیط‌های نویزی، استانداردهای بازشناسی گفتار در بازارهای غیرانگلیسی را جابه‌جا می‌کند. تکیه بر اعتبار داده‌های بومی هند نشان می‌دهد که مدل‌های تخصصی می‌توانند در حوزه‌های خاص، مدل‌های غول‌پیکر جهانی را شکست دهند.

تأثیر برای ایران

به‌دلیل تمرکز شدید بر زبان‌های هندی و انگلیسی، این مدل اثر مستقیمی بر پردازش زبان فارسی ندارد؛ اما معماری فضای حالت آن برای پژوهشگران مدل‌های صوتی در ایران الگوبرداری‌پذیر است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی ترنسفورمر با معماری فضای حالت (State-Space) در رمزگشای صوتی، نشان‌دهنده یک چرخش استراتژیک برای مدیریت توالی‌های طولانی بدون انفجار محاسباتی است. این رویکرد ثابت می‌کند که برای بازارهای خاص، بهینه‌سازی معماری بر روی داده‌های بومی، بسیار مؤثرتر از افزایش صرفِ پارامترها در مدل‌های جهانی است. در واقع، Saaras V4 مدلِ «تخصص‌گرایی» را در برابر «عموم‌گرایی» OpenAI قرار می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.