پرش به محتوای اصلی
پرش به محتوای مقاله

MAI-Transcribe-2: پردازش یک ساعت صوت در ۱۰ ثانیه

·۱۲ شهریور ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
لوگوی مایکروسافت و نمودار رشد عملکرد مدل MAI-Transcribe-2 در شناسایی گفتار چندزبانه
لوگوی مایکروسافت و نمودار رشد عملکرد مدل MAI-Transcribe-2 در شناسایی گفتار چندزبانه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش چشمگیر هزینه به ۰.۱۰ دلار در ساعت و افزایش سرعت پردازش تا ۱۰ برابر در مقایسه با رقبای اصلی؛ در حالی که دقت در ۶۰ زبان مختلف حفظ شده است.

تصور کنید یک ساعت ضبط‌شده از جلسه کاری شما، تنها در ۱۰ ثانیه به متن تبدیل شود. مایکروسافت ای‌آی (Microsoft AI) در ۳ سپتامبر ۲۰۲۶ مدل MAI-Transcribe-2 را منتشر کرد تا کفِ قیمت و سرعت را برای سامانه‌های حرفه‌ای تبدیل گفتار به متن بازتعریف کند.

این عرضه در حالی رخ می‌دهد که سازمان‌ها از چت‌بات‌های ساده عبور کرده و به سمت پردازش حجیم داده‌های صوتی می‌روند. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی الگوهای چندعاملی در مایکروسافت اتوژن (Microsoft AutoGen) اشاره کردیم، این شرکت اکنون روی لایه‌ی ورودی حسی تمرکز کرده است تا حجم عظیمی از داده‌های گفتاری را با کمترین تأخیر (Latency) — شبیه به واکنش سریع یک دستیار خبره که بدون مکث یادداشت برمی‌دارد — به متن ساختاریافته تبدیل کند.

تکامل مدل و بستر عملیاتی

به نقل از مستندات مایکروسافت، MAI-Transcribe-2 توانمندترین سامانه تبدیل صوت به متن این شرکت تا به امروز است. این مدل بهبودهای قابل‌توجهی نسبت به نسخه‌های پیشین، از جمله MAI-Transcribe-1.5 و نسخه اولیه MAI-Transcribe-1 دارد؛ نسخه‌ای که در نهایت در ۲۰ اوت ۲۰۲۶ بازنشسته گردید.

این مدل به‌طور خاص برای حفظ کیفیت تبدیل صوت به متن در شرایط نویزی و محیط‌هایی خارج از استودیوهای ضبط کنترل‌شده طراحی شده است. این استواری (Robustness) باعث می‌شود مدل در دنیای واقعی، جایی که نویز پس‌زمینه رایج است، عملکردی پایدار و قابل‌اتکا داشته باشد.

طبق اعلام مایکروسافت، این مدل در محک (Benchmark) چندزبانه FLEURS در ۶۰ زبان مختلف رتبه اول را کسب کرده است. نرخ خطای کلمه (Word Error Rate) — که مثل شمارش غلط‌های املایی در یک دیکته است — در این مدل به‌طور میانگین ۵.۲ درصد است، هرچند در برخی بخش‌های خاص و با عملکرد بالا، این نرخ به عدد بسیار پایین ۲ درصد رسیده است. این رقابت بر سر کاهش خطا در سطح جهانی است، به‌طوری که گوگل نیز اخیراً موفق شد نرخ خطای تبدیل گفتار به متن خود را به ۲.۶٪ برساند.

عملکرد فنی و ساختار قیمت‌گذاری

بر اساس گزارش Artificial Analysis، این مدل مرز جدیدی از دقت و سرعت (Pareto frontier) را تعریف کرده و در حال حاضر رتبه دوم جدول نرخ خطای کلمه در این پلتفرم را در اختیار دارد. شاخص‌های کلیدی عملکرد عبارت‌اند از:

  • سرعت: ۱۰ برابر سریع‌تر از GPT-Transcribe شرکت OpenAI، ۷ برابر سریع‌تر از Scribe v2 شرکت ElevenLabs و ۵ برابر سریع‌تر از Gemini 3.5 Transcribe.
  • توان عملیاتی (Throughput): ضریب سرعت ۴۰۳.۶ که اجازه می‌دهد یک ساعت صوت در حدود ۱۰ ثانیه پردازش شود. در این زمینه، رقابت شدیدی میان غول‌های فناوری وجود دارد و برای مثال مدل Granite Speech 5.0 آی‌بی‌ام قادر است ۳.۵ ساعت صوت را در تنها یک ثانیه تبدیل به متن کند.
  • هزینه: نرخ تشویقی و محدود برای شروع، ۰.۱۰ دلار به ازای هر ساعت صوت است که تا پایان سال جاری میلادی اعمال می‌شود.
  • مزیت رقابتی: مایکروسافت مدعی است این مدل در طیف گسترده‌تری از صداهای واقعی، از Gemini 3.5 Transcribe، GPT-Transcribe, Whisper V3-Large و ScribeV2 پیشی می‌گیرد.

قابلیت‌های توسعه‌دهندگان

این مدل در حال حاضر از طریق Azure Speech در حالت پیش‌نمایش عمومی در دسترس است. به دلیل نبود توافق‌نامه سطح خدمات (SLA)، هنوز برای محیط‌های عملیاتی حساس و بارهای کاری تولیدی (Production) توصیه نمی‌شود. این سرویس از فایل‌های صوتی زیر ۳۰۰ مگابایت در فرمت‌های WAV، MP3 و FLAC پشتیبانی می‌کند.

توسعه‌دهندگان می‌توانند درخواست‌های خود را از طریق حالت پیشرفته API تبدیل سریع (Fast Transcription API) با تنظیم ویژگی مدل روی MAI-Transcribe-2 ارسال کنند. برای استفاده، داشتن اشتراک Azure و منبع Microsoft Foundry برای بخش Speech الزامی است. همچنین، این مدل می‌تواند تبدیل صوت ورودی را از طریق یک فیلد پیکربندی نشست (Session Configuration) در Voice Live API فراهم کند.

قابلیت‌های کاربردی جدید عبارت‌اند از:

  • تفکیک گوینده (Speaker Diarization): بخش‌بندی ضبط‌ها بر اساس گوینده و بازگرداندن قطعات برچسب‌گذاری شده به همراه متادیتای مربوط به زمان شروع (Offset) و مدت‌زمان هر بخش.
  • گزینه‌های زمان‌بندی: ارائه برچسب زمانی در سطح کلمه (Word-level timestamps) برای هر کلمه، یا گزینه بخش‌بندی (Segment) برای ارائه زمان‌بندی به ازای هر قطعه متن.
  • پارامتر لیست عبارات (Phrase-list): جهت‌دهی مدل به سمت اصطلاحات خاص، اختصارات و اسامی خاص ارائه شده توسط کاربر. این پارامتر به عنوان «راهنما» عمل می‌کند و نه خروجی اجباری.

کاربران می‌توانند بین دو سبک تبدیل صوت به متن انتخاب کنند: حالت «عیناً» (Verbatim) که تمام تپق‌ها، کلمات پرکننده و شروع‌های اشتباه را برای تحلیل‌های دقیق، کنترل کیفیت (QA) و الزامات انطباق ثبت می‌کند، و حالت «پاک‌سازی شده» (Clean) که این مزاحمت‌ها را حذف کرده و الگوهای رایج گفتاری را به‌طور خودکار فرمت می‌کند تا زیرنویس‌ها و یادداشت‌های خواناتری ایجاد شوند. این رویکرد بهینه‌سازی متن مشابه قابلیت‌های مدل Gemini 3.5 Transcribe است که کلمات زائد و اصطلاحات تخصصی را برای بهبود خوانایی حذف می‌کند.

جایگاه در بازار

مایکروسافت این مدل را برای کاربردهای حساس مانند یادداشت‌برداری بالینی پزشکی، مستندات حقوقی، مستندسازی مراکز تماس، ابزارهای دسترسی‌پذیری و زیرنویس‌گذاری هدف‌گذاری کرده است. این مدل قابلیت تشخیص خودکار «تغییر کد» (Code Switching) — یعنی ترکیب دو زبان در یک جمله مثل اسپنگلیش (ترکیب اسپانیایی و انگلیسی) یا هینگلیش (ترکیب هندی و انگلیسی) — را دارد.

انتخاب زبان اختیاری است و مدل به‌طور پیش‌فرض زبان گفتاری را تشخیص می‌دهد. مستندات مایکروسافت توصیه می‌کند تنها در صورتی زبان خاصی را اجبار کنید که سیستم تشخیص خودکار با خطا مواجه شود.

مایکروسافت با ارائه یک مدل واحد که دقت بالا را در ۶۰ زبان حفظ می‌کند، قصد دارد نیاز توسعه‌دهندگان به واحد پردازش گرافیکی (GPU) — که مثل اجاره یک آشپزخانه صنعتی گران‌قیمت است — را کاهش دهد. این یکپارچه‌سازی، نیاز به نگهداری چندین مدل زبانی مجزا برای هر زبان را از بین می‌برد.

برای کاربران تجاری، این تحول یعنی تبدیل صوت دیگر یک گلوگاه یا هزینه سنگین در بودجه نیست. ترکیب سرعت خیره‌کننده و هزینه پایین، تحلیل صوتی در مقیاس بزرگ را برای شرکت‌های کوچک و متوسط (SMEs) به امری ممکن و اقتصادی تبدیل می‌کند.

گام بعدی شما

  • اگر از Azure Speech استفاده می‌کنید، مدل را در MAI Playground تست کنید تا تفاوت سرعت را با مدل‌های قبلی بسنجید.
  • برای پروژه‌هایی که نیاز به دقت در اسامی خاص دارند، از پارامتر Phrase-list برای کاهش نرخ خطا استفاده کنید.
  • در صورت نیاز به تحلیل‌های روان‌شناختی یا حقوقی، از حالت Verbatim برای ثبت دقیق تمام جزئیات گفتار بهره ببرید.

اما دسترسی به این مدل فراتر از اکوسیستم Azure خواهد رفت؛ به‌زودی در OpenRouter عرضه می‌شود که مسیر را برای توسعه‌دهندگان مستقل AI هموار می‌کند. در حال حاضر، این مدل از طریق Microsoft Foundry و MAI Playground برای دمو در دسترس است.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار زیرساختی Azure، هزینه عملیاتی تحلیل داده‌های صوتی را برای سازمان‌ها تقریباً به صفر می‌رساند. این تغییر باعث می‌شود تحلیل بلادرنگ هزاران ساعت تماس یا جلسه در مقیاس سازمانی از نظر اقتصادی توجیه‌پذیر شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌های Azure، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است، اما عرضه احتمالی آن در OpenRouter می‌تواند این محدودیت را دور بزند.

·نگاه ما
تحریریه دات‌هوش

کاهش قیمت به ۱۰ سنت در ساعت، تبدیل صوت به متن را از یک سرویس تخصصی به یک کالای عمومی (Commodity) تبدیل می‌کند. مایکروسافت با این حرکت، مدل‌های تخصصی تک‌زبانه را منسوخ می‌کند و ثابت می‌کند که یک مدل چندزبانه قدرتمند می‌تواند هم ارزان‌تر و هم سریع‌تر از مجموعه‌ای از مدل‌های کوچک باشد. این استراتژی احتمالاً فشار را بر OpenAI برای عرضه نسخه‌های بهینه‌تر از Whisper افزایش خواهد داد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.