تصور کنید با یک دستیار صوتی صحبت میکنید که حتی پیش از پایان جملهتان، جواب را آماده کرده است. این دیگر یک رویای علمی-تخیلی نیست، بلکه نتیجهی حذف «شکاف سکوت» در تعاملات انسانی و ماشینی است.
بسیاری از سامانههای صوتی فعلی منتظر میمانند تا کاربر کاملاً ساکت شود و سپس پردازش متن را آغاز کنند؛ این اتفاق جریان طبیعی گفتگو را میکشد. مایکروسافت در ۱ اکتبر ۲۰۲۶ مدل MAI-Transcribe-2-Streaming را معرفی کرد تا این گلوگاه را از بین ببرد. این مدل — که شبیه به یک شنوندهی فعال است که همزمان با گوش دادن، یادداشت برمیدارد — اجازه میدهد عاملهای هوشمند (AI Agents) در میانهٔ جملهی کاربر، استدلال یا فراخوانی ابزارها را شروع کنند. این مدل اکنون ۶۰ زبان مختلف و قابلیت تشخیص مستمر را بهصورت بلادرنگ در اختیار کاربران قرار میدهد. این پیشرفت در ادامه استراتژی مایکروسافت برای گسترش دسترسی جهانی است که پیشتر با عرضه مدل MAI-Transcribe-2 برای ۶۰ زبان مختلف محقق شده بود.
همانطور که در پوشش پیشین ما از مدل غیر-استریمینگ MAI-Transcribe-2 دیدیم، مایکروسافت این مدل را به عنوان سریعترین، دقیقترین و ارزانترین مدل جهان معرفی کرده بود. این مدل در نسخهی اولیه خود توانسته بود یک ساعت صوت را تنها در ۱۰ ثانیه پردازش کند. حالا نسخهٔ جدید با نرخ خطای کلمه (Word-Error Rate) ۲.۵ درصدی، استانداردهای جدیدی را برای زیرساختهای صوتی این شرکت تعریف کرده است.
به گزارش unite.ai، این مدل در محک Artificial Analysis در لبهی بهینگی (Pareto frontier) قرار دارد؛ یعنی دقت بالا را بدون ایجاد تأخیر شدید به دست آورده است. این مدل نخستین فرضیات «جزئی» (partial hypotheses) خود را تنها ۱۰۰ میلیثانیه پس از دریافت صدا تولید میکند و با رسیدن دادههای بیشتر و زمینههای جدید، متن را اصلاح میکند تا در نهایت به یک نسخهٔ پایدار و نهایی برسد.
زمینه و محکهای ارزیابی
مایکروسافت برای تأیید ادعاهای خود از شاخص AA-WER Streaming متعلق به Artificial Analysis استفاده کرد. این محک، صحت مدلهایی را میسنجد که صدا را بهصورت بلادرنگ و تکهتکه (chunk by chunk) دریافت میکنند. ارزیابیها بر روی مجموعاً ۸ ساعت داده صوتی در سه مجموعه متمرکز بود:
- AA-AgentTalk: ۵۰ درصد دادهها
- VoxPopuli: ۲۵ درصد دادهها
- Earnings22: ۲۵ درصد دادهها
این مجموعهدادهها بهطور خاص برای شبیهسازی گفتار در دنیای واقعی طراحی شدهاند و شامل لهجههای متنوع، زبانهای تخصصی هر حوزه و شرایط صوتی دشوار و چالشبرانگیز هستند. طبق مستندات، هر دو اندازهگیری «زمان رسیدن به متن نهایی» (Time to Final) و «زمان رسیدن به نخستین فرضیه» (Time to First Partial) در پایان گفتار، همانطور که توسط تشخیصدهنده فعالیت صوتی SileroVAD شناسایی میشود، فعال میگردند.
عملکرد فنی و قیمتگذاری
بر اساس دادههای لیدربورد استریمینگ Artificial Analysis در ۲۸ سپتامبر ۲۰۲۶، معیارهای فنی مدل به شرح زیر است:
- نرخ خطای کلمه نهایی (WER): ۲.۵٪
- نرخ نخستین فرضیه (First-Partial Rate): ۲.۸٪
- زمان رسیدن به متن نهایی: ۰.۱۳ ثانیه
ارزیابیهای داخلی نشان میدهد کلمات در این مدل، دو برابر سریعتر از نزدیکترین رقیب در متن ظاهر میشوند. برای توسعهدهندگان، این مدل با یک قیمت تشویقی ۰.۵۴ دلار بهازای هر ساعت صوت تا پایان سال جاری میلادی در دسترس است.
مجموعهی تولید صدا
در کنار تبدیل گفتار به متن، مایکروسافت دو مدل تبدیل متن به گفتار (TTS) — یعنی سیستمی که متن را به صدای طبیعی تبدیل میکند — با نامهای MAI-Voice-2.1 و MAI-Voice-2.1-Flash عرضه کرد. هر دو مدل از ۲۳ زبان و ۲۶ مکان (locale) پشتیبانی میکنند. ویژگی برجسته این است که یک هویت صوتی واحد میتواند در میانهٔ یک جمله، زبان را با لهجهای بومی و طبیعی تغییر دهد.
این قابلیت کاربردهای خاصی را ممکن میسازد؛ برای مثال، یک اپلیکیشن آموزشی میتواند در میانهٔ درس، زبان را تغییر دهد بدون اینکه نیاز باشد مدرس مجازی را عوض کند. یا یک دستیار چندزبانه میتواند با حفظ هویت صوتی ثابت، به همان زبانی که مخاطب با او صحبت کرده است، پاسخ دهد. در این رقابت برای طبیعیترین صدای ممکن، رقبایی چون گوگل نیز فعال هستند؛ برای نمونه مدل Gemini 3.8 Flash استانداردهای جدیدی را در مدلسازی لهجهها تعریف کرد تا تجربه کاربر در تعاملات صوتی بهبود یابد.
مدل MAI-Voice-2.1-Flash نسخهٔ مخصوص حجمهای بالای داده است که برای بارهای کاری حساس به تأخیر طراحی شده است. این مدل میتواند ۴۵ ثانیه صدا را با تأخیر کل (end-to-end) ۱۵۰ میلیثانیه تولید کند. به نقل از مایکروسافت، مدل Flash حدود ۵۵ درصد استنتاج (Inference) — یعنی لحظهی تولید واقعی جواب توسط مدل — سریعتر و تقریباً ۶۰ درصد ارزانتر از جایگزینهای مشابه است.
قیمتگذاری برای مدلهای صوتی به این صورت است: ۲۲ دلار بهازای هر یک میلیون کاراکتر برای نسخهٔ استاندارد و ۱۵ دلار بهازای هر یک میلیون کاراکتر برای نسخهٔ Flash. هر دو مدل از قابلیت شبیهسازی صدا (Voice Cloning) تنها با چند ثانیه نمونه صوتی پشتیبانی میکنند که برای جلوگیری از سوءاستفاده، توسط حفاظهای امنیتی داخلی (consent guardrails) محافظت میشود.
نزدیکی به صدای انسان
مایکروسافت برای سنجش واقعگرایی و میزان شباهت به انسان، یک آزمون تورینگ با ۴۰۰۰ شنونده اجرا کرد. نتایج نشان داد ۵۰.۳ درصد شنوندگان، صدای MAI-Voice را برابر یا انسانیتر از ضبطهای واقعی انسانی دانستهاند.
این مدلها اکنون از طریق Microsoft Foundry، MAI Playground، Vercel، Azure Voice Live و OpenRouter در دسترس هستند. مایکروسافت برای نمایش کامل این چرخه، دمویی به نام Chatter را در MAI Playground منتشر کرده که تبدیل متن بلادرنگ را با مدل صوتی Flash جفت میکند.
برای یک صاحب کسبوکار، این یعنی فاصله میان رباتهای صوتی و انسان (که به آن دره وهمآلود یا Uncanny Valley میگویند) در حال کم شدن است. وقتی شروع تبدیل متن ۱۰۰ میلیثانیه و پاسخ صوتی ۱۵۰ میلیثانیه باشد، هوش مصنوعی شروع به تقلید از ریتم همپوشانِ گفتگوی انسانی میکند. مایکروسافت این را «پسگرفتن زمان» در هر دو سر چرخه عامل صوتی مینامد؛ یعنی توالی شنیدن، فهمیدن، تصمیمگیری و صحبت کردن.
این تحول، تجربه هوش مصنوعی صوتی را از حالت «بیسیم» (walkie-talkie) — که کاربر منتظر صدای بوق میماند — به یک گفتگوی سیال تبدیل میکند. کاربردهای اصلی برای توسعهدهندگان عبارتند از:
- خدمات مشتریان: عاملهایی که درخواستها را همزمان با بیان کاربر مینویسند و با گفتاری طبیعی پاسخ میدهند.
- دستیارهای چندزبانه: سامانههایی که زبان spoken را تشخیص داده و به هر یک از ۲۳ زبان پشتیبانیشده MAI-Voice پاسخ میدهند.
- رسانههای تعاملی: برنامههایی که از گویندههای متمایز برای نقشآفرینی، شبیهسازی، روایتگری و آموزش استفاده میکنند.
توسعهدهندگان باید منتظر ادغام آتی این مدلها با LiveKit باشند که احتمالاً گزینههای استقرار این جریانهای کمتأخیر را بهطور گستردهتری افزایش میدهد.
گام بعدی شما
- اگر توسعهدهنده هستید، دموی Chatter را در MAI Playground تست کنید تا تأخیر واقعی را بسنجید.
- برای کاهش هزینههای استنتاج صوتی، مدل Flash را جایگزین مدلهای استاندارد کنید.
- قابلیت تغییر زبان در میانه جمله را برای محصولات چندزبانه خود بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو