پرش به محتوای اصلی
پرش به محتوای مقاله

مدل MAI-Transcribe-2 چگونه پاسخ‌دهی بلادرنگ هوش مصنوعی را ممکن می‌کند؟

·۱۰ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
لوگوی مایکروسافت در کنار نماد هوش مصنوعی و امواج صوتی، نمایانگر معرفی مدل‌های جدید MAI-Transcribe-2-Streaming و MAI-Voice
لوگوی مایکروسافت در کنار نماد هوش مصنوعی و امواج صوتی، نمایانگر معرفی مدل‌های جدید MAI-Transcribe-2-Streaming و MAI-Voice
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدل استریمینگ که اجازه می‌دهد پردازش و استدلال هم‌زمان با صحبت کاربر (و نه پس از سکوت او) آغاز شود؛ این یک تغییر پارادایم از پردازش دسته‌ای به پردازش جریانی در Voice AI است.

تصور کنید با یک دستیار صوتی صحبت می‌کنید که حتی پیش از پایان جمله‌تان، جواب را آماده کرده است. این دیگر یک رویای علمی-تخیلی نیست، بلکه نتیجه‌ی حذف «شکاف سکوت» در تعاملات انسانی و ماشینی است.

بسیاری از سامانه‌های صوتی فعلی منتظر می‌مانند تا کاربر کاملاً ساکت شود و سپس پردازش متن را آغاز کنند؛ این اتفاق جریان طبیعی گفتگو را می‌کشد. مایکروسافت در ۱ اکتبر ۲۰۲۶ مدل MAI-Transcribe-2-Streaming را معرفی کرد تا این گلوگاه را از بین ببرد. این مدل — که شبیه به یک شنونده‌ی فعال است که هم‌زمان با گوش دادن، یادداشت برمی‌دارد — اجازه می‌دهد عامل‌های هوشمند (AI Agents) در میانهٔ جمله‌ی کاربر، استدلال یا فراخوانی ابزارها را شروع کنند. این مدل اکنون ۶۰ زبان مختلف و قابلیت تشخیص مستمر را به‌صورت بلادرنگ در اختیار کاربران قرار می‌دهد. این پیشرفت در ادامه استراتژی مایکروسافت برای گسترش دسترسی جهانی است که پیش‌تر با عرضه مدل MAI-Transcribe-2 برای ۶۰ زبان مختلف محقق شده بود.

همان‌طور که در پوشش پیشین ما از مدل غیر-استریمینگ MAI-Transcribe-2 دیدیم، مایکروسافت این مدل را به عنوان سریع‌ترین، دقیق‌ترین و ارزان‌ترین مدل جهان معرفی کرده بود. این مدل در نسخه‌ی اولیه خود توانسته بود یک ساعت صوت را تنها در ۱۰ ثانیه پردازش کند. حالا نسخهٔ جدید با نرخ خطای کلمه (Word-Error Rate) ۲.۵ درصدی، استانداردهای جدیدی را برای زیرساخت‌های صوتی این شرکت تعریف کرده است.

به گزارش unite.ai، این مدل در محک Artificial Analysis در لبه‌ی بهینگی (Pareto frontier) قرار دارد؛ یعنی دقت بالا را بدون ایجاد تأخیر شدید به دست آورده است. این مدل نخستین فرضیات «جزئی» (partial hypotheses) خود را تنها ۱۰۰ میلی‌ثانیه پس از دریافت صدا تولید می‌کند و با رسیدن داده‌های بیشتر و زمینه‌های جدید، متن را اصلاح می‌کند تا در نهایت به یک نسخهٔ پایدار و نهایی برسد.

زمینه و محک‌های ارزیابی

مایکروسافت برای تأیید ادعاهای خود از شاخص AA-WER Streaming متعلق به Artificial Analysis استفاده کرد. این محک، صحت مدل‌هایی را می‌سنجد که صدا را به‌صورت بلادرنگ و تکه‌تکه (chunk by chunk) دریافت می‌کنند. ارزیابی‌ها بر روی مجموعاً ۸ ساعت داده صوتی در سه مجموعه متمرکز بود:

  • AA-AgentTalk: ۵۰ درصد داده‌ها
  • VoxPopuli: ۲۵ درصد داده‌ها
  • Earnings22: ۲۵ درصد داده‌ها

این مجموعه‌داده‌ها به‌طور خاص برای شبیه‌سازی گفتار در دنیای واقعی طراحی شده‌اند و شامل لهجه‌های متنوع، زبان‌های تخصصی هر حوزه و شرایط صوتی دشوار و چالش‌برانگیز هستند. طبق مستندات، هر دو اندازه‌گیری «زمان رسیدن به متن نهایی» (Time to Final) و «زمان رسیدن به نخستین فرضیه» (Time to First Partial) در پایان گفتار، همان‌طور که توسط تشخیص‌دهنده فعالیت صوتی SileroVAD شناسایی می‌شود، فعال می‌گردند.

عملکرد فنی و قیمت‌گذاری

بر اساس داده‌های لیدربورد استریمینگ Artificial Analysis در ۲۸ سپتامبر ۲۰۲۶، معیارهای فنی مدل به شرح زیر است:

  • نرخ خطای کلمه نهایی (WER): ۲.۵٪
  • نرخ نخستین فرضیه (First-Partial Rate): ۲.۸٪
  • زمان رسیدن به متن نهایی: ۰.۱۳ ثانیه

ارزیابی‌های داخلی نشان می‌دهد کلمات در این مدل، دو برابر سریع‌تر از نزدیک‌ترین رقیب در متن ظاهر می‌شوند. برای توسعه‌دهندگان، این مدل با یک قیمت تشویقی ۰.۵۴ دلار به‌ازای هر ساعت صوت تا پایان سال جاری میلادی در دسترس است.

مجموعه‌ی تولید صدا

در کنار تبدیل گفتار به متن، مایکروسافت دو مدل تبدیل متن به گفتار (TTS) — یعنی سیستمی که متن را به صدای طبیعی تبدیل می‌کند — با نام‌های MAI-Voice-2.1 و MAI-Voice-2.1-Flash عرضه کرد. هر دو مدل از ۲۳ زبان و ۲۶ مکان (locale) پشتیبانی می‌کنند. ویژگی برجسته این است که یک هویت صوتی واحد می‌تواند در میانهٔ یک جمله، زبان را با لهجه‌ای بومی و طبیعی تغییر دهد.

این قابلیت کاربردهای خاصی را ممکن می‌سازد؛ برای مثال، یک اپلیکیشن آموزشی می‌تواند در میانهٔ درس، زبان را تغییر دهد بدون اینکه نیاز باشد مدرس مجازی را عوض کند. یا یک دستیار چندزبانه می‌تواند با حفظ هویت صوتی ثابت، به همان زبانی که مخاطب با او صحبت کرده است، پاسخ دهد. در این رقابت برای طبیعی‌ترین صدای ممکن، رقبایی چون گوگل نیز فعال هستند؛ برای نمونه مدل Gemini 3.8 Flash استانداردهای جدیدی را در مدل‌سازی لهجه‌ها تعریف کرد تا تجربه کاربر در تعاملات صوتی بهبود یابد.

مدل MAI-Voice-2.1-Flash نسخهٔ مخصوص حجم‌های بالای داده است که برای بارهای کاری حساس به تأخیر طراحی شده است. این مدل می‌تواند ۴۵ ثانیه صدا را با تأخیر کل (end-to-end) ۱۵۰ میلی‌ثانیه تولید کند. به نقل از مایکروسافت، مدل Flash حدود ۵۵ درصد استنتاج (Inference) — یعنی لحظه‌ی تولید واقعی جواب توسط مدل — سریع‌تر و تقریباً ۶۰ درصد ارزان‌تر از جایگزین‌های مشابه است.

قیمت‌گذاری برای مدل‌های صوتی به این صورت است: ۲۲ دلار به‌ازای هر یک میلیون کاراکتر برای نسخهٔ استاندارد و ۱۵ دلار به‌ازای هر یک میلیون کاراکتر برای نسخهٔ Flash. هر دو مدل از قابلیت شبیه‌سازی صدا (Voice Cloning) تنها با چند ثانیه نمونه صوتی پشتیبانی می‌کنند که برای جلوگیری از سوءاستفاده، توسط حفاظ‌های امنیتی داخلی (consent guardrails) محافظت می‌شود.

نزدیکی به صدای انسان

مایکروسافت برای سنجش واقع‌گرایی و میزان شباهت به انسان، یک آزمون تورینگ با ۴۰۰۰ شنونده اجرا کرد. نتایج نشان داد ۵۰.۳ درصد شنوندگان، صدای MAI-Voice را برابر یا انسانی‌تر از ضبط‌های واقعی انسانی دانسته‌اند.

این مدل‌ها اکنون از طریق Microsoft Foundry، MAI Playground، Vercel، Azure Voice Live و OpenRouter در دسترس هستند. مایکروسافت برای نمایش کامل این چرخه، دمویی به نام Chatter را در MAI Playground منتشر کرده که تبدیل متن بلادرنگ را با مدل صوتی Flash جفت می‌کند.

برای یک صاحب کسب‌وکار، این یعنی فاصله میان ربات‌های صوتی و انسان (که به آن دره وهم‌آلود یا Uncanny Valley می‌گویند) در حال کم شدن است. وقتی شروع تبدیل متن ۱۰۰ میلی‌ثانیه و پاسخ صوتی ۱۵۰ میلی‌ثانیه باشد، هوش مصنوعی شروع به تقلید از ریتم هم‌پوشانِ گفتگوی انسانی می‌کند. مایکروسافت این را «پس‌گرفتن زمان» در هر دو سر چرخه عامل صوتی می‌نامد؛ یعنی توالی شنیدن، فهمیدن، تصمیم‌گیری و صحبت کردن.

این تحول، تجربه هوش مصنوعی صوتی را از حالت «بی‌سیم» (walkie-talkie) — که کاربر منتظر صدای بوق می‌ماند — به یک گفتگوی سیال تبدیل می‌کند. کاربردهای اصلی برای توسعه‌دهندگان عبارتند از:

  • خدمات مشتریان: عامل‌هایی که درخواست‌ها را هم‌زمان با بیان کاربر می‌نویسند و با گفتاری طبیعی پاسخ می‌دهند.
  • دستیارهای چندزبانه: سامانه‌هایی که زبان spoken را تشخیص داده و به هر یک از ۲۳ زبان پشتیبانی‌شده MAI-Voice پاسخ می‌دهند.
  • رسانه‌های تعاملی: برنامه‌هایی که از گوینده‌های متمایز برای نقش‌آفرینی، شبیه‌سازی، روایتگری و آموزش استفاده می‌کنند.

توسعه‌دهندگان باید منتظر ادغام آتی این مدل‌ها با LiveKit باشند که احتمالاً گزینه‌های استقرار این جریان‌های کم‌تأخیر را به‌طور گسترده‌تری افزایش می‌دهد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، دموی Chatter را در MAI Playground تست کنید تا تأخیر واقعی را بسنجید.
  • برای کاهش هزینه‌های استنتاج صوتی، مدل Flash را جایگزین مدل‌های استاندارد کنید.
  • قابلیت تغییر زبان در میانه جمله را برای محصولات چندزبانه خود بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار بنچمارک‌های Artificial Analysis، شکاف میان تعامل انسانی و ماشینی را می‌شکند. حذف تأخیر در استنتاج صوتی، مسیر را برای استقرار عامل‌های صوتی در مقیاس تجاری و جایگزینی مراکز تماس سنتی هموار می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به Microsoft Foundry دشوار است، اما استفاده از این مدل‌ها از طریق واسطه‌هایی مثل OpenRouter امکان‌پذیر است.

·نگاه ما
تحریریه دات‌هوش

کاهش تأخیر به زیر ۲۰۰ میلی‌ثانیه در کل چرخه صوتی، نقطه عطف تبدیل شدن AI از یک ابزار «پرسش و پاسخ» به یک «هم‌صحبت» است. مایکروسافت با این حرکت، میدان نبرد را از دقت محض (Accuracy) به سرعتِ ادراکی (Perceptual Speed) منتقل کرد. این یعنی در آینده، معیار برتری مدل‌های صوتی نه در کلمات درست، بلکه در ریتم و زمان‌بندی انسانی پاسخ‌ها خواهد بود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.