تصور کنید یک ساعت ضبطشده از جلسه کاری شما، تنها در ۱۰ ثانیه به متن تبدیل شود. مایکروسافت ایآی (Microsoft AI) در ۳ سپتامبر ۲۰۲۶ مدل MAI-Transcribe-2 را منتشر کرد تا کفِ قیمت و سرعت را برای سامانههای حرفهای تبدیل گفتار به متن بازتعریف کند.
این عرضه در حالی رخ میدهد که سازمانها از چتباتهای ساده عبور کرده و به سمت پردازش حجیم دادههای صوتی میروند. همانطور که در تحلیل قبلی ما دربارهی بهینهسازی الگوهای چندعاملی در مایکروسافت اتوژن (Microsoft AutoGen) اشاره کردیم، این شرکت اکنون روی لایهی ورودی حسی تمرکز کرده است تا حجم عظیمی از دادههای گفتاری را با کمترین تأخیر (Latency) — شبیه به واکنش سریع یک دستیار خبره که بدون مکث یادداشت برمیدارد — به متن ساختاریافته تبدیل کند.
تکامل مدل و بستر عملیاتی
به نقل از مستندات مایکروسافت، MAI-Transcribe-2 توانمندترین سامانه تبدیل صوت به متن این شرکت تا به امروز است. این مدل بهبودهای قابلتوجهی نسبت به نسخههای پیشین، از جمله MAI-Transcribe-1.5 و نسخه اولیه MAI-Transcribe-1 دارد؛ نسخهای که در نهایت در ۲۰ اوت ۲۰۲۶ بازنشسته گردید.
این مدل بهطور خاص برای حفظ کیفیت تبدیل صوت به متن در شرایط نویزی و محیطهایی خارج از استودیوهای ضبط کنترلشده طراحی شده است. این استواری (Robustness) باعث میشود مدل در دنیای واقعی، جایی که نویز پسزمینه رایج است، عملکردی پایدار و قابلاتکا داشته باشد.
طبق اعلام مایکروسافت، این مدل در محک (Benchmark) چندزبانه FLEURS در ۶۰ زبان مختلف رتبه اول را کسب کرده است. نرخ خطای کلمه (Word Error Rate) — که مثل شمارش غلطهای املایی در یک دیکته است — در این مدل بهطور میانگین ۵.۲ درصد است، هرچند در برخی بخشهای خاص و با عملکرد بالا، این نرخ به عدد بسیار پایین ۲ درصد رسیده است. این رقابت بر سر کاهش خطا در سطح جهانی است، بهطوری که گوگل نیز اخیراً موفق شد نرخ خطای تبدیل گفتار به متن خود را به ۲.۶٪ برساند.
عملکرد فنی و ساختار قیمتگذاری
بر اساس گزارش Artificial Analysis، این مدل مرز جدیدی از دقت و سرعت (Pareto frontier) را تعریف کرده و در حال حاضر رتبه دوم جدول نرخ خطای کلمه در این پلتفرم را در اختیار دارد. شاخصهای کلیدی عملکرد عبارتاند از:
- سرعت: ۱۰ برابر سریعتر از GPT-Transcribe شرکت OpenAI، ۷ برابر سریعتر از Scribe v2 شرکت ElevenLabs و ۵ برابر سریعتر از Gemini 3.5 Transcribe.
- توان عملیاتی (Throughput): ضریب سرعت ۴۰۳.۶ که اجازه میدهد یک ساعت صوت در حدود ۱۰ ثانیه پردازش شود. در این زمینه، رقابت شدیدی میان غولهای فناوری وجود دارد و برای مثال مدل Granite Speech 5.0 آیبیام قادر است ۳.۵ ساعت صوت را در تنها یک ثانیه تبدیل به متن کند.
- هزینه: نرخ تشویقی و محدود برای شروع، ۰.۱۰ دلار به ازای هر ساعت صوت است که تا پایان سال جاری میلادی اعمال میشود.
- مزیت رقابتی: مایکروسافت مدعی است این مدل در طیف گستردهتری از صداهای واقعی، از Gemini 3.5 Transcribe، GPT-Transcribe, Whisper V3-Large و ScribeV2 پیشی میگیرد.
قابلیتهای توسعهدهندگان
این مدل در حال حاضر از طریق Azure Speech در حالت پیشنمایش عمومی در دسترس است. به دلیل نبود توافقنامه سطح خدمات (SLA)، هنوز برای محیطهای عملیاتی حساس و بارهای کاری تولیدی (Production) توصیه نمیشود. این سرویس از فایلهای صوتی زیر ۳۰۰ مگابایت در فرمتهای WAV، MP3 و FLAC پشتیبانی میکند.
توسعهدهندگان میتوانند درخواستهای خود را از طریق حالت پیشرفته API تبدیل سریع (Fast Transcription API) با تنظیم ویژگی مدل روی MAI-Transcribe-2 ارسال کنند. برای استفاده، داشتن اشتراک Azure و منبع Microsoft Foundry برای بخش Speech الزامی است. همچنین، این مدل میتواند تبدیل صوت ورودی را از طریق یک فیلد پیکربندی نشست (Session Configuration) در Voice Live API فراهم کند.
قابلیتهای کاربردی جدید عبارتاند از:
- تفکیک گوینده (Speaker Diarization): بخشبندی ضبطها بر اساس گوینده و بازگرداندن قطعات برچسبگذاری شده به همراه متادیتای مربوط به زمان شروع (Offset) و مدتزمان هر بخش.
- گزینههای زمانبندی: ارائه برچسب زمانی در سطح کلمه (Word-level timestamps) برای هر کلمه، یا گزینه بخشبندی (Segment) برای ارائه زمانبندی به ازای هر قطعه متن.
- پارامتر لیست عبارات (Phrase-list): جهتدهی مدل به سمت اصطلاحات خاص، اختصارات و اسامی خاص ارائه شده توسط کاربر. این پارامتر به عنوان «راهنما» عمل میکند و نه خروجی اجباری.
کاربران میتوانند بین دو سبک تبدیل صوت به متن انتخاب کنند: حالت «عیناً» (Verbatim) که تمام تپقها، کلمات پرکننده و شروعهای اشتباه را برای تحلیلهای دقیق، کنترل کیفیت (QA) و الزامات انطباق ثبت میکند، و حالت «پاکسازی شده» (Clean) که این مزاحمتها را حذف کرده و الگوهای رایج گفتاری را بهطور خودکار فرمت میکند تا زیرنویسها و یادداشتهای خواناتری ایجاد شوند. این رویکرد بهینهسازی متن مشابه قابلیتهای مدل Gemini 3.5 Transcribe است که کلمات زائد و اصطلاحات تخصصی را برای بهبود خوانایی حذف میکند.
جایگاه در بازار
مایکروسافت این مدل را برای کاربردهای حساس مانند یادداشتبرداری بالینی پزشکی، مستندات حقوقی، مستندسازی مراکز تماس، ابزارهای دسترسیپذیری و زیرنویسگذاری هدفگذاری کرده است. این مدل قابلیت تشخیص خودکار «تغییر کد» (Code Switching) — یعنی ترکیب دو زبان در یک جمله مثل اسپنگلیش (ترکیب اسپانیایی و انگلیسی) یا هینگلیش (ترکیب هندی و انگلیسی) — را دارد.
انتخاب زبان اختیاری است و مدل بهطور پیشفرض زبان گفتاری را تشخیص میدهد. مستندات مایکروسافت توصیه میکند تنها در صورتی زبان خاصی را اجبار کنید که سیستم تشخیص خودکار با خطا مواجه شود.
مایکروسافت با ارائه یک مدل واحد که دقت بالا را در ۶۰ زبان حفظ میکند، قصد دارد نیاز توسعهدهندگان به واحد پردازش گرافیکی (GPU) — که مثل اجاره یک آشپزخانه صنعتی گرانقیمت است — را کاهش دهد. این یکپارچهسازی، نیاز به نگهداری چندین مدل زبانی مجزا برای هر زبان را از بین میبرد.
برای کاربران تجاری، این تحول یعنی تبدیل صوت دیگر یک گلوگاه یا هزینه سنگین در بودجه نیست. ترکیب سرعت خیرهکننده و هزینه پایین، تحلیل صوتی در مقیاس بزرگ را برای شرکتهای کوچک و متوسط (SMEs) به امری ممکن و اقتصادی تبدیل میکند.
گام بعدی شما
- اگر از Azure Speech استفاده میکنید، مدل را در MAI Playground تست کنید تا تفاوت سرعت را با مدلهای قبلی بسنجید.
- برای پروژههایی که نیاز به دقت در اسامی خاص دارند، از پارامتر Phrase-list برای کاهش نرخ خطا استفاده کنید.
- در صورت نیاز به تحلیلهای روانشناختی یا حقوقی، از حالت Verbatim برای ثبت دقیق تمام جزئیات گفتار بهره ببرید.
اما دسترسی به این مدل فراتر از اکوسیستم Azure خواهد رفت؛ بهزودی در OpenRouter عرضه میشود که مسیر را برای توسعهدهندگان مستقل AI هموار میکند. در حال حاضر، این مدل از طریق Microsoft Foundry و MAI Playground برای دمو در دسترس است.




گفتگو