پرش به محتوای اصلی
پرش به محتوای مقاله

مایکروسافت مدل MAI-Transcribe-2 را برای ۶۰ زبان عرضه کرد

·۹ مهر ۱۴۰۵۵ دقیقه مطالعه
لوگوی مایکروسافت در کنار نماد هوش مصنوعی گفتار MAI-Transcribe-2 و MAI-Voice-2
لوگوی مایکروسافت در کنار نماد هوش مصنوعی گفتار MAI-Transcribe-2 و MAI-Voice-2
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه یک پشته‌ی کامل صوتی (تبدیل متن به صوت و بالعکس) با پشتیبانی گسترده از ۶۰ زبان و تفکیک گوینده در سطح کلمه، در حالی که صراحتاً قابلیت استریم زنده را از مدل ترنسکرایب حذف کرده است.

اگر مدیر یک مرکز تماس جهانی هستید، حالا می‌توانید هزاران ساعت مکالمه به ۶۰ زبان مختلف را بدون نیاز به نیروی انسانی، به متن‌های ساختاریافته تبدیل کنید. مایکروسافت در ۱ اکتبر ۲۰۲۶ مدل MAI-Transcribe-2 را معرفی کرد تا شرکت‌ها بتوانند فایل‌های صوتی ضبط‌شده را با برچسب‌های دقیق گوینده و زمان‌بندی لحظه‌ای تحلیل کنند. این مدل در واقع تکامل یافته‌ی نسخه‌های پیشین است که سرعت پردازش صوت را به شدت افزایش داده و امکان تبدیل یک ساعت صوت در ۱۰ ثانیه را فراهم کرده بود.

این به‌روزرسانی در حالی رخ می‌دهد که سازمان‌ها از تبدیل ساده‌ی صدا به متن، به سمت گردش‌های کاری پیچیده‌تر حرکت می‌کنند. در حالی که ما پیش‌تر به چالش‌های امنیتی مایکروسافت، مانند بهره‌برداری مهاجمان از نقاط ضعف Zimbra برای سرقت بک‌آپ‌ها اشاره کردیم، این شرکت اکنون تمرکز خود را بر افزایش کاربردی بودن پشته‌ی هوش مصنوعی Azure گذاشته است. برای یک صاحب کسب‌وکار، این تغییر شبیه جابه‌جایی از یک ضبط‌صوت قدیمی به یک سیستم دیجیتال هوشمند است که دقیقاً می‌داند چه کسی، در چه لحظه‌ای و چه چیزی گفته است.

زمینه و جایگاه خانواده مدل‌های MAI

مایکروسافت سه مدل صوتی مستند در خانواده MAI معرفی کرده است تا توسعه‌دهندگان و کسب‌وکارها بلوک‌های سازنده‌ی متمایزی در اختیار داشته باشند. این ابزارها امکان تبدیل صوت به متن، تولید پاسخ‌های صوتی و طراحی تعاملات صوتی پاسخگو را فراهم می‌کنند.

نکته‌ی حیاتی این است که مستندات رسمی مایکروسافت در مورد نام محصولات بسیار دقیق است. این شرکت نام‌هایی مانند MAI-Transcribe-2-Streaming، MAI-Voice-2.1 یا MAI-Voice-2.1-Flash را به عنوان نام‌های رسمی محصول لیست نکرده است. این شفافیت به توسعه‌دهندگان کمک می‌کند تا از استفاده از نقاط اتصال (Endpoints) مستندنشده اجتناب کنند.

طبق گزارش وب‌سایت dev.to، این خط تولید جدید از سه بلوک سازنده‌ی مجزا تشکیل شده است:

جزئیات فنی و مشخصات مدل‌ها

  • MAI-Transcribe-2: یک مدل بازشناسی گفتار (ASR) چندزبانه است که از ۶۰ زبان پشتیبانی می‌کند. این مدل دارای قابلیت تفکیک گوینده (Diarization) است تا بتواند بین گویندگان مختلف تمایز قائل شود. همچنین از زمان‌بندی در سطح کلمه (Word-level timestamps) برای مکان‌یابی نقاط خاص در یک ضبط صوتی استفاده می‌کند.
  • MAI-Voice-2: یک مدل تبدیل متن به گفتار (TTS) با کیفیت بسیار بالا (High-fidelity) و پوشش گسترده‌ی زبانی است. این مدل شامل کنترل‌هایی برای «پروزودی» (Prosody) و احساسات است که مستقیماً بر نحوه‌ی بیان پاسخ توسط صدای تولید شده تأثیر می‌گذارد.
  • MAI-Voice-2-Flash: نسخه‌ای با تأخیر (Latency) کمتر از مدل صوتی است. این مدل به‌طور خاص برای سناریوهای عامل‌های صوتی بلادرنگ بهینه شده است، جایی که کاهش تأخیر پیش از پاسخ، باعث می‌شود مکالمه روان‌تر و طبیعی‌تر به نظر برسد.

لوگوی مایکروسافت در کنار نماد هوش مصنوعی گفتار و موج صدا

محدودیت‌های فنی و مسئله استریم

یک شکاف فنی جدی در این عرضه وجود دارد. مستندات رسمی مایکروسافت هیچ اشاره‌ای به قابلیت استریم زنده بومی (Native real-time streaming) برای مدل MAI-Transcribe-2 نکرده است. این بدان معنای است که مدل برای پردازش فایل‌های صوتی ضبط‌شده یا قطعات صوتی پس از آماده شدن طراحی شده است، نه برای زیرنویس زنده ثانیه به ثانیه.

برای کسب‌وکارهایی که در حال ارزیابی کاربردهای تبدیل تماس به متن یا دستیار زنده اپراتور هستند، این قابلیتِ مفقود یک ملاحظه‌ی اصلی است. تیم‌ها باید از طراحی یک تجربه‌ی تبدیل متن زنده بر اساس فرضِ وجودِ یک نقطه اتصال استریم، تا زمانی که مایکروسافت رسماً چنین پشتیبانی را مستند کند، خودداری نمایند.

کاربردهای عملی برای اتوماسیون

با وجود نبود استریم زنده، ویژگی‌های مستند شده از چندین الگوی کاربردی پشتیبانی می‌کنند:

  • آرشیوهای قابل جست‌وجو: تبدیل تماس‌های ضبط‌شده یا مصاحبه‌ها به متن همراه با انتساب گوینده برای بازرسی و حسابرسی آسان‌تر.
  • یکپارچگی با گردش کار: ارسال متن‌های زمان‌بندی‌شده به جریان‌های کاری بازبینی، مستندسازی یا پیگیری‌های بعدی.
  • رابط‌های طبیعی: تولید پاسخ‌های صوتی برای رابط‌های تلفنی خودکار که در آن‌ها تحویل طبیعی محتوا اولویت دارد.
  • پاسخ سریع: استفاده از مدل Voice-2-Flash در مواقعی که یک عامل صوتی باید بین نوبت‌های گفتگو سریعاً پاسخ دهد.

توسعه‌دهندگان باید مراقب باشند که سرعت مدل MAI-Voice-2-Flash را با سرعت کل پشته (Stack) اشتباه نگیرند. صرفاً چون هوش مصنوعی می‌تواند سریع پاسخ دهد، به این معنا نیست که می‌تواند در لحظه گوش دهد و بنویسد. تجربه‌ی کلی به نحوه‌ی اتصال این اجزای مجزا به یکدیگر بستگی دارد.

برای کاربر نهایی، این به معنای تحلیل‌های پس از تماس بهتر و آرشیوهای صوتی قابل جست‌وجوتر است. یک مدیر اکنون می‌تواند به لطف زمان‌بندی در سطح کلمه، مستقیماً به ثانیه‌ای برود که مشتری از یک مشکل خاص یاد کرده است. قابلیت تفکیک گوینده در اینجا به‌ویژه مفید است، زیرا دقیقاً نشان می‌دهد در یک تعامل پیچیده، چه کسی چه چیزی گفته است.

پیاده‌سازی و هزینه‌ها

مایکروسافت اشاره کرده است که قیمت‌گذاری برای مدت محدودی در کاتالوگ موجود است، هرچند مبالغ دقیق دلاری یا شرایط خاص در تحقیقات افشا نشده است. تیم‌ها باید پیش از متعهد شدن به بودجه‌ی تولید، متریال‌های فعلی Azure را بررسی کنند.

برای پیاده‌سازی مؤثر، کسب‌وکارها باید ابتدا گردش کار خود را ترسیم کنند. یک تماس پشتیبانی ضبط‌شده به ترتیب به تبدیل متن، تفکیک گوینده، بازبینی انسانی و انتقال به پرونده مشتری نیاز دارد. در مقابل، یک عامل صوتی به یک جریان برنامه‌ای مطمئن، یک لایه‌ی تولید پاسخ و خروجی با تأخیر کم نیاز دارد.

از آنجا که نه تفکیک گوینده و نه زمان‌بندی به تنهایی دقت را برای هر مورد استفاده تضمین نمی‌کنند، تیم‌ها باید نمونه‌های صوتی معرف را تست کنند. این شامل تست زبان‌ها، لهجه‌ها، شرایط نویزی مختلف و فرمت‌های گفتگوی گوناگون پیش از استقرار در فرآیندهای مشتری‌محور است.

هوش مصنوعی صوتی تنها زمانی ارزش‌آفرین است که خروجی‌های آن به طور قابل‌اعتماد وارد سیستم‌های موجود شود. اتوماسیون‌های هوشمند می‌توانند متن‌ها را مسیریابی کرده، بستر گوینده را حفظ کنند و خروجی‌های تأیید شده را به ابزارهای عملیاتی متصل کنند تا نیاز به جابه‌جایی‌های دستی کاهش یابد.

منتظر به‌روزرسانی‌های آینده در کاتالوگ MAI باشید که ممکن است نقاط اتصال استریم مفقود شده را معرفی کنند؛ امری که در نهایت تعاملات صوتی کاملاً هم‌گام (Synchronous) با هوش مصنوعی را ممکن می‌سازد.

گام بعدی شما

  • اگر از Azure استفاده می‌کنید، مدل MAI-Transcribe-2 را روی فایل‌های صوتی قدیمی تست کنید تا دقت تفکیک گوینده را بسنجید.
  • برای پیاده‌سازی عامل‌های صوتی، ترکیب MAI-Voice-2-Flash با یک مدل استدلالی را بررسی کنید تا تأخیر پاسخ را به حداقل برسانید.
  • منتظر به‌روزرسانی‌های کاتالوگ MAI برای اضافه شدن نقاط اتصال استریم زنده باشید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزارها با تکیه بر اعتبار زیرساخت Azure، هزینه تحلیل داده‌های صوتی در مقیاس سازمانی را به شدت کاهش می‌دهند. تفکیک دقیق گوینده در ۶۰ زبان، استانداردهای جدیدی برای اتوماسیون مراکز تماس جهانی ایجاد می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌های مایکروسافت، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل‌ها دشوار است و نیاز به زیرساخت‌های واسط دارد.

·نگاه ما
تحریریه دات‌هوش

تمرکز مایکروسافت بر تفکیک دقیق گوینده و زمان‌بندی کلمات نشان می‌دهد که هدف فعلی، جایگزینی استنتاج زنده نیست، بلکه استخراج داده‌های ساختاریافته از حجم عظیم داده‌های صوتی سازمان‌هاست. این رویکرد عملاً مدل‌های صوتی را از یک ابزار «کمکی» به یک ابزار «تحلیلی» تبدیل می‌کند که می‌تواند ورودی‌های ارزشمندی برای مدل‌های استدلالی بزرگ‌تر فراهم کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.