شما احتمالاً تصور میکنید برای انتخاب بهترین مدل بازشناسی گفتار (ASR)، کافی است به جدول ردهبندی (Leaderboard) نگاه کنید و مدلی با کمترین نرخ خطا را بردارید. اما حقیقت این است که در سال ۲۰۲۶، نمرات این جدول دیگر پیشبینیکننده موفقیت مدل در محیط عملیاتی نیستند.
طبق تحلیل فنی Marktechpost، تفاوت بین مدلهای پیشتاز در جدول Open ASR متعلق به Hugging Face، در ژوئیه ۲۰۲۶ به کمتر از یک نقطه در نرخ خطای کلمه (Word Error Rate - WER) رسیده است. این یعنی رقابت از سطح «صحت مطلق» به سطح «بهینگی عملیاتی» منتقل شده است.
همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، گذار از مدلهای غولپیکر به مدلهای تخصصی، باعث میشود معیارهای ارزیابی تغییر کند. طی ۱۲ ماه گذشته، انحصار مدل Whisper شکسته شد. در مارس ۲۰۲۶، شرکت Cohere مدل Transcribe را (یک مدل ۲ میلیارد پارامتری با لایسنس Apache 2.0) معرفی کرد که با نرخ خطای ۵.۴۲٪ صدر جدول را گرفت. تنها پنج هفته بعد، IBM مدل Granite Speech 4.1 2B را با نرخ ۵.۳۳٪ عرضه کرد و پس از آن مدلهای ARK-ASR-3B و MOSS-Transcribe-preview-2B اعداد پایینتری را ثبت کردند.
این همگرایی یعنی «بهترین» مدل دیگر آن نیست که کمترین امتیاز خطا را دارد، بلکه تصمیمگیری به متغیرهای تدارکاتی منتقل شده است: نوع لایسنس، پوشش زبانی و شکاف معماری بین پردازش دستهای (Batch) و استریمینگ در لحظه (Real-time). رتبه دیگر متغیر تعیینکننده نیست؛ بلکه لایسنس و هزینه به ازای هر ساعت صوت، تصمیمگیرنده است.
توهم جدول ردهبندی
به گزارش منابع فنی، بسیاری از توسعهدهندگان فریب اعداد جدول را میخورند؛ چراکه میانگین جدول یک مقدار ثابت و واحد نیست و مدلهایی که در کنار هم لیست شدهاند، همگی به روش یکسانی امتیاز نگرفتهاند.
برای مثال، مدل Cohere Transcribe (2B) ادعای میانگین ۵.۴۲٪ WER را در ۸ مجموعه داده تست انگلیسی دارد. جزئیات این تفکیک به شرح زیر است:
- LibriSpeech clean: ۱.۲۵٪
- TED-LIUM: ۲.۴۹٪
- SPGISpeech: ۳.۰۸٪
- VoxPopuli: ۵.۸۷٪
- AMI: ۸.۱۳٪
- GigaSpeech: ۹.۳۴٪
- Earnings-22: ۱۰.۸۶٪
- LibriSpeech other: ۲.۳۷٪
اما مدلهای جدیدتر مانند ARK-ASR-3B و MOSS-Transcribe-preview-2B اغلب مجموعه داده سادهتر TED-LIUM را از میانگینهای خود حذف کردهاند. در کارت مدل MOSS-Transcribe-preview-2B صراحتاً ذکر شده است که TED-LIUM در حال حاضر بخشی از اجرای ردهبندی نیست. حذف این مجموعه ساده، میانگین سایر مدلها را بالا میبرد اما باعث میشود این مدلهای خاص قویتر به نظر برسند. اگر امتیازهای Cohere را با همان هفت مجموعه ARK دوباره محاسبه کنیم، نرخ خطای آن از ۵.۴۲٪ به ۵.۸۴٪ افزایش مییابد. به همین ترتیب، مدل Granite Speech 4.1 2B از ۵.۳۳٪ به ۵.۶۵٪ تغییر میکند. این نشان میدهد که در یک مقایسه برابر (Like-for-like)، برتری ARK بیشتر از اعداد تیتروار است، اما در عین حال ثابت میکند که تفریق یک عدد منتشر شده از عدد دیگر، پاسخ معناداری نمیدهد.
علاوه بر این، پدیدهی «برازش روی بنچمارک» (Leaderboard-fitting) رایج شده است. طبق مستندات MOSS-Transcribe-preview-2B، این مدل با استفاده از یادگیری تقویتی (Reinforcement Learning) روی دادههای آموزشی خودِ جدول Open ASR تنظیم شده است؛ این یعنی امتیاز بهدستآمده بیشتر اندازهگیریِ بنچمارک است تا توانایی واقعی مدل.
دادههای شرکت Appen این پیچیدگی را بیشتر میکند. Appen مجموعههای ارزیابی محرمانهای را فراهم کرد که لهجههای استرالیایی، کانادایی، هندی و آمریکایی را در هر دو شرایط «متنخوانده» و «محاورهای» پوشش میداد. وقتی این مجموعههای خصوصی فعال میشوند، مدل zoom/scribe_v1 از رتبه چهارم به رتبه اول صعود میکند، در حالی که پیشتاز جدول عمومی سقوط میکند. مدلهایی که برای گفتار پاک و خواندهشده تنظیم شدهاند، در مواجهه با صوتهای محاورهای و خودجوش به شدت افت میکنند. این تضاد میان بنچمارکهای آزمایشگاهی و محیطهای واقعی، یادآور چالشهای محیطهای Far-field است که در آن نرخ خطای مدلها در شرایط نویز زیاد به شدت افزایش مییابد. بنابراین، از جدول ردهبندی برای ساخت یک لیست کوتاه استفاده کنید، نه برای انتخاب برنده نهایی.
لایهی صحت و پایداری
برای کسانی که به دنبال پایداری در تولید (Production-ready) هستند، Cohere Transcribe (لایسنس Apache 2.0، پشتیبانی از ۱۴ زبان) با بیش از ۶۲۰ هزار دانلود در ماه گذشته، به یک نیروی مسلط تبدیل شده است. این مدل از یک رمزگذار Conformer با یک رمزگشای Transformer سبک استفاده میکند که از ابتدا آموزش دیده است. Cohere پشتیبانی اجرای گستردهای را در transformers، vLLM، mlx-audio برای اپل سیلیکون، یک پورت Rust و یک بیلد WebGPU ایجاد کرده است.
شرکت Cohere ارزیابیهای ترجیح انسانی را اجرا کرد که در آن ارزیابان آموزشدیده، متنها را از نظر موجودات نامدار (Named Entities)، توهمات (Hallucinations) و حفظ معنا امتیاز دادند. این مدل به نرخ پیروزی میانگین ۶۱٪ دست یافت، که شامل ۷۸٪ پیروزی در برابر IBM Granite 4.0 1B Speech و ۶۴٪ در برابر Whisper large-v3 بود. با این حال، این مدل فاقد تشخیص خودکار زبان، برچسبهای زمانی (Timestamps) و تفکیک گوینده (Diarization) است. به دلیل اینکه مدل تمایل دارد سکوتها را هم ترنسکریب کند، Cohere توصیه میکند که قبل از آن یک VAD یا Noise Gate قرار دهید. توجه داشته باشید که اگرچه لایسنس آن Apache 2.0 است، اما مخزن کد همچنان پشت یک توافقنامه اطلاعات تماس (Gated) قرار دارد.
مدل IBM Granite Speech 4.1 2B (Apache 2.0) برای کسانی که «قابلیت» را به «امتیاز خام» ترجیح میدهند، انتخاب بهتری است. این مدل از ۶ زبان برای ASR علاوه بر ترجمه گفتار دوطرفه پشتیبانی میکند و شامل قابلیت Keyword-list biasing برای نامها و اصطلاحات تخصصی است. این مدل علائم نگارشی و Truecasing (به ویژه حروف بزرگ اسامی در زبان آلمانی) را مدیریت میکند. این مدل روی ۱۷۴ هزار ساعت صوت آموزش دیده و به RTFx (ضریب زمان واقعی) ۲۳۱.۲۹ میرسد. IBM همچنین دو مدل خواهر عرضه کرده است: نسخه «-plus» که برچسبهای زمانی در سطح کلمه و ASR با attributing گوینده را اضافه میکند، و نسخه «-nar» برای سرعت بیشتر.
سایر رقبای سطح بالای دقت عبارتند از:
- Canary-Qwen-2.5B (لایسنس CC-BY-4.0، انگلیسی): این مدل یک رمزگذار FastConformer را با رمزگشای Qwen3-1.7B جفت میکند. دارای دو حالت است: ترنسکریب خالص و حالت LLM برای خلاصهسازی یا پاسخ به سوالات درباره صوت. این مدل WER ۵.۶۳٪ را در RTFx ۴۱۸ ثبت کرده است. چون دادههای AMI به طور بیشنمونهبرداری (حدود ۱۵٪ دادههای آموزشی) وارد شدهاند، این مدل متنهای دقیقی شامل «ناپیوستگیهای گفتاری» (Disfluency) تولید میکند؛ ویژگیای که برای کارهای حقوقی مفید است اما برای یادداشتهای جلسات آزاردهنده است.
- Qwen3-ASR-1.7B (Apache 2.0): انتخاب اصلی برای ماندارین و گفتار منطقهای چین. این مدل ۵۲ زبان و گویش را پوشش میدهد (۳۰ زبان بهعلاوه ۲۲ گویش چینی) با WER ۵.۷۶٪. این مدل با یک ابزار کامل استنتاج و یک مدل جداگانه برای تراز اجباری (Forced-alignment) جهت ایجاد برچسبهای زمانی در ۱۱ زبان عرضه میشود.
توان عملیاتی و بهرهوری
در حالی که دقت مدلها تنها در حد یک نقطه تفاوت دارد، توان عملیاتی (Throughput) بیش از یک مرتبه بزرگی (Order of magnitude) تفاوت میکند. در بسیاری از موارد، توان عملیاتی است که مبلغ فاکتور نهایی را تعیین میکند.
مدل Parakeet TDT 0.6B v3 (CC-BY-4.0) با RTFx خیرهکننده ۳۳۳۲.۷۴ در ۲۵ زبان اروپایی، در میدان مدلهای چندزبانه پیشتاز است. این مدل میتواند تا ۲۴ دقیقه صوت را در یک پاس روی یک کارت A100 80GB پردازش کند. این مدل مقدار کمی از دقت (۶.۳۲٪ WER) را فدا میکند تا تقریباً ۱۴ برابر بیشتر از Granite 4.1 2B، صوت را در هر ثانیه GPU پردازش کند.
مدل IBM's Granite Speech 4.1 2B-NAR نتیجه یک مهندسی غیرخودبازگشتی (Non-autoregressive) است. این مدل یک فرضیه CTC را در یک پاس پیشرو با استفاده از یک LLM دوطرفه ویرایش میکند و به RTFx حدود ۱۸۲۰ روی یک H100 با Batch size 128 میرسد. برای دستیابی به این سرعت، پشتیبانی از زبان ژاپنی، ترجمه گفتار و Keyword biasing را کنار گذاشته است.
مدل Qwen3-ASR-0.6B تمامی ۵۲ زبان برادر بزرگتر خود را حفظ کرده و در عین حال به توان عملیاتی ۲۰۰۰ برابری در Concurrency 128 میرسد.
استریم و پوشش زبانی
برای عاملهای صوتی (Voice Agents)، تأخیر در ترنسکریب و مدیریت نوبتهای گفتگو (Turn-taking) معیارهای حیاتی هستند. WER دستهای (Batch) اغلب یک تست بیربط برای این مدلهاست. مدلهای Voxtral Realtime (۷.۶۸٪) و Kyutai STT 2.6B (۶.۴۰٪) هر دو نمراتی پایینتر از Whisper دارند، اما این اعداد بازتابدهنده کاربرد مورد نظر آنها نیستند.
مدل Voxtral Mini 4B Realtime 2602 (Apache 2.0، ۱۳ زبان) شامل یک مدل زبانی ۳.۴ میلیارد پارامتری و یک رمزگذار صوتی علی (Causal) ۹۷۰ میلیون پارامتری است. هر دو از «توجه با پنجره لغزان» (Sliding-window attention) برای استریمینگ عملاً نامحدود استفاده میکنند. تأخیر ترنسکریب در گامهای ۸۰ میلیثانیهای از ۸۰ تا ۱۲۰۰ میلیثانیه قابل تنظیم است و یک گزینه مجزای ۲۴۰۰ میلیثانیهای نیز دارد. Mistral مقدار ۴۸۰ میلیثانیه را به عنوان نقطه بهینه توصیه میکند و ادعا میکند که با مدلهای باز آفلاین پیشرو برابری میکند. این مدل روی یک GPU ۱۶ گیگابایتی اجرا شده و از روز اول از vLLM Realtime API پشتیبانی میکند.
مدل Kyutai STT (CC-BY-4.0) در دو نسخه عرضه شده است:
- یک مدل حدود ۱ میلیارد پارامتری انگلیسی/فرانسوی با تأخیر ۰.۵ ثانیه و یک تشخیصدهنده فعالیت صوتی (VAD) معنایی داخلی.
- یک مدل ۲.۶ میلیارد پارامتری فقط انگلیسی با تأخیر ۲.۵ ثانیه.
برای عاملها، VAD معنایی از میزان تأخیر مهمتر است، زیرا پیشبینی میکند چه زمانی گوینده واقعاً صحبتش را تمام کرده است. یک H100 میتواند ۴۰۰ استریم همزمان را در زمان واقعی سرو کند.
در نهایت، در طیف افراطی پوشش زبانی، Omnilingual ASR متا (Apache 2.0، کورپوس CC-BY) به جای WER روی وسعت تمرکز کرده است. این مدل بیش از ۱۶۰۰ زبان را بهطور بومی پوشش میدهد و از طریق یادگیری در بستر (Zero-shot in-context learning) این عدد را به بیش از ۵۴۰۰ زبان میرساند. این مدل بر پایه یک رمزگذار wav2vec 2.0 مقیاسبندی شده به ۷ میلیارد پارامتر ساخته شده و روی حدود ۴.۳ میلیون ساعت صوت پیشآموزش دیده است. مدل ۷ میلیاردی LLM-ASR آن به نرخ خطای نویسه (CER) زیر ۱۰٪ در ۷۸٪ از زبانهای پشتیبانی شده دست مییابد، از جمله بیش از ۵۰۰ زبانی که هرگز توسط هیچ سیستم ASR دیگری پشتیبانی نمیشدند. اندازه رمزگذارها از ۳۰۰ میلیون تا ۷ میلیارد متغیر است. متا همچنین Omnilingual ASR Corpus را منتشر کرد که بیش از ۳۵۰ زبان کمتر دیده شده را پوشش میدهد.
مدل Whisper large-v3 (۱.۵۵ میلیارد پارامتر، لایسنس MIT، ۹۹ زبان) در دقت توسط حدود ۱۰ مدل باز شکست خورده است، اما همچنان یک انتخاب پیشفرض است. لایسنس MIT بازترین لایسنس ممکن است و اکوسیستم آن - شامل whisper.cpp، faster-whisper و WhisperX - بیرقیب است. اگر نیاز شما این است که «هر زبانی باشد، روی هر سختافزاری اجرا شود و نیازی به وکیل لایسنس نباشد»، Whisper همچنان پاسخ است.
لبه پژوهشی و لایسنسها
شرکت Interfaze یک مدل با معماری خلاقانه به نام diffusion-gemma-asr-small معرفی کرد. این مدل ترنسکریبها را از طریق «پالایش نویز انتشاری موازی» (Parallel diffusion denoising) روی یک بوم ۲۵۶ توکنی در ۸ تا ۱۶ گام تولید میکند؛ به این معنی که هزینه رمزگشایی با طول متن افزایش نمییابد. تنها حدود ۴۲ میلیون پارامتر (۰.۱۶٪ وزنها) روی یک DiffusionGemma ۲۶ میلیاردی منجمد و یک رمزگذار whisper-small منجمد آموزش دیدهاند. این مدل به WER ۶.۶٪ روی LibriSpeech test-clean با سرعت ۱۱ تا ۱۷ برابر زمان واقعی میرسد، اما روی FLEURS انگلیسی به ۱۵.۷٪ و روی FLEURS ماندارین به ۲۹.۶٪ CER سقوط میکند. اگرچه برای استقرار عملی مناسب نیست، اما برای پژوهشگران ASR متنی ضروری است.
برای کسانی که به برچسبهای یکپارچه گوینده نیاز دارند، MOSS-Transcribe-Diarize 0.9B (Apache 2.0، ۵۰+ زبان) یک مشکل بزرگ را حل میکند. این مدل برچسب گوینده، زمانبندی کلمات و متن را در یک تولید (Generation) واحد ارسال میکند و نیاز به یک پشته جداگانه برای Diarization را از بین میبرد. این مدل دارای کانتکست ۱۲۸ هزار توکنی است، تقریباً ۹۰ دقیقه صوت را در یک پاس مدیریت میکند و به RTF حدود ۰.۰۱۷ روی یک RTX 4090 با Hotword biasing میرسد.
لایسنس همچنان مانع نهایی برای عرضه محصول است و میدان به سه اردوگاه تقسیم میشود:
- Apache 2.0: شامل Cohere Transcribe، تمام نسخههای Granite Speech 4.1، Qwen3-ASR، Voxtral Mini Realtime، مدلهای Omnilingual ASR، ARK-ASR و MOSS-Transcribe. این لایسنس اجازه استفاده تجاری بدون محدودیت و بدون الزام به ذکر منبع را میدهد (هرچند Cohere توافقنامه تماس میخواهد).
- MIT: مدل Whisper large-v3. بازترین گزینه ممکن.
- CC-BY-4.0: شامل Canary-Qwen-2.5B، Parakeet TDT 0.6B v3 و Kyutai STT. اینها تجاری هستند اما نیاز به ذکر منبع (Attribution) دارند. برای APIهای White-label یا محصولات جاسازی شده، این یک الزام واقعی برای تطبیق حقوقی است و اغلب دلیل انتخاب یک مدل با دقت کمتر توسط تیمهاست.
تحلیل: گذار از پژوهش به تدارکات
این چشمانداز ثابت میکند که ASR برای اکثر کاربردهای زبان انگلیسی به یک سطح «به اندازه کافی خوب» رسیده است. رقابت از آزمایشگاههای پژوهشی به ترازنامههای مالی منتقل شده است. در سال ۲۰۲۶، مدل برنده آن نیست که دقیقترین باشد، بلکه مدلی است که با بودجه GPU و محدودیتهای حقوقی شرکت سازگار باشد.
برای متخصصان فنی، نکته کلیدی این است که رتبهبندیهای جدول اکنون ابزاری برای «کوتاه کردن لیست» هستند، نه راهنمایی برای «انتخاب نهایی». شکاف بین بنچمارکهای خواندهشدهی پاک و صوتهای نویزی و لهجهدار در دنیای واقعی، اکنون منبع اصلی شکست در استقرار مدلهاست.
اگر در حال ساخت یک سیستم عملیاتی هستید، لایسنس و توان عملیاتی را بر WER ترجیح دهید. مدلی که ۰.۵٪ دقیقتر است اما ۱۰ برابر کندتر عمل میکند، احتمالاً باعث شکست شما در معیارهای تأخیر (Latency) شده و هزینههای استنتاج شما را به شدت افزایش میدهد.
برای انتخاب مدل مناسب، این ترتیب را دنبال کنید:
۱. لایسنس: اگر ذکر منبع یک مانع است، مدلهای CC-BY-4.0 را حذف کنید.
۲. پوشش زبانی: بر اساس محدودیتهای سخت فیلتر کنید (مثلاً ۱۴ زبان Cohere در مقابل ۵۲ زبان Qwen). به یاد داشته باشید که Cohere تشخیص خودکار زبان ندارد.
۳. معماری: تعیین کنید که به استریمینگ نیاز دارید یا Batch. رمزگذارهای آفلاین را نمیتوان به مدلهای استریمینگ با تأخیر کم تبدیل کرد.
۴. WER دامنه: مدل را روی صوتهای نویزی و لهجهدار خودتان تست کنید؛ رتبه احتمالاً با جدول عمومی متفاوت خواهد بود.
۵. هزینه: هزینه هر ساعت صوت را روی GPUهای خودتان محاسبه کنید، زیرا اعداد RTFx سختافزارهای دیتاسنتر مستقیماً منتقل نمیشوند.
خلاصه مفید سال ۲۰۲۶ این نیست که یک مدل خاص پیروز شد. بلکه این است که یک مدل ۲ میلیارد پارامتری با لایسنس باز، اکنون عملکردی بهتر از APIهای بستهای دارد که ۱۸ ماه پیش برای آنها هزینه پرداخت میشد. تصمیم باقیمانده، یک پرسش تدارکاتی است نه یک پرسش پژوهشی.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو