پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Muse Voice متا نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ رساند

·۱۵ شهریور ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
متا به‌صورت مخفیانه چت‌جی‌پی‌تی، جمینای و کاراکتر.ای‌آی را با هزاران پرسش بحران از دیدگاه نوجوانان آزمایش کرد.
متا به‌صورت مخفیانه چت‌جی‌پی‌تی، جمینای و کاراکتر.ای‌آی را با هزاران پرسش بحران از دیدگاه نوجوانان آزمایش کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معماری شنود پویا که به‌جای پنجره‌های زمانی ثابت، بر اساس پیچیدگی کلمه تصمیم می‌گیرد چه زمانی پاسخ دهد و چگونه نرخ خطا را به ۳.۱٪ برساند.

۰.۱۶ ثانیه؛ این تمام زمانی است که مدل Muse Voice Transcribe شرکت متا نیاز دارد تا به نرخ خطای کلمه (Word Error Rate) ۳.۱ درصدی برای زبان انگلیسی برسد. این دستاورد که توسط Superintelligence Labs توسعه یافته، استانداردی جدید برای پردازش بلادرنگ صوت تعریف می‌کند تا دستیارهای هوش مصنوعی بتوانند به‌طور مداوم به گفتگوهای انسانی گوش دهند.

این عرضه در حالی رخ می‌دهد که صنعت به سمت «ابر‌هوش شخصی» حرکت می‌کند؛ چشم‌اندازی که مارک زاکربرگ، مدیرعامل متا، پیش‌بینی کرده است. در این آینده، عامل‌های هوش مصنوعی (AI Agents) — شبیه به دستیاران نامرئی که همیشه در کنار شما هستند و محیط را می‌شناسند — از طریق گجت‌های پوشیدنی مثل عینک‌های هوشمند عمل می‌کنند تا با گوش دادن به گفتگوهای واقعی، کمک‌های لازم را ارائه دهند. این رویکرد در راستای توسعه معماری‌های چندوجهی است که برای بقای پشته‌های فناوری هوش مصنوعی تا سال ۲۰۲۶ ضروری تلقی می‌شوند. همان‌طور که در تحلیل قبلی ما درباره‌ی Meta Muse Spark 1.3 و کارایی آن در کدنویسی عامل‌محور اشاره کردیم، متا اکنون همان استراتژی قیمت‌گذاری تهاجمی و عملکرد بالا را در لایه‌ی صوتی پیاده می‌کند.

برخلاف سیستم‌های سنتی که از پنجره‌های زمانی ثابت استفاده می‌کنند، Muse Voice Transcribe صوت را به تکه‌های ۸۰ میلی‌ثانیه‌ای تقسیم می‌کند. این مدل از یادگیری تقویتی (Reinforcement Learning) استفاده می‌کند تا برای هر کلمه تصمیم بگیرد که متن را فوراً چاپ کند یا برای درک بهتر، بیشتر گوش دهد. طبق مستندات متا، این رفتار با پاداش دادن به مدل در ازای دستیابی هم‌زمان به نرخ خطای پایین و تأخیر کوتاه آموزش دیده است. کلمات ساده فوراً پردازش می‌شوند، اما اصطلاحات پیچیده باعث می‌شوند مدل کمی بیشتر صبر کند تا دقت تضمین شود.

مدل صوتی لحظه‌ای متا؛ پایه دستیارهای هوشمندی که همیشه گوش می‌دهند

قابلیت‌های فنی

  • تشخیص گوینده: مدل می‌تواند تا ۲۰ گوینده مختلف (از A تا Z) را در یک جریان صوتی واحد شناسایی و برچسب‌گذاری کند. این سیستم تغییر گوینده را در متن جاری علامت‌گذاری می‌کند بدون اینکه به سیستم‌های خارجی نیاز داشته باشد.
  • تشخیص جمله: سیستم به‌طور هم‌زمان بازشناسی گفتار (ASR) را با توانایی تعیین دقیق نقطه شروع و پایان هر عبارت (Utterance) آموزش دیده است.
  • پشتیبانی چندزبانه: این مدل روی بیش از ۷۰ زبان آموزش دیده و ۲۵ زبان آن به‌طور عمیق تست شده‌اند. این سیستم می‌تواند «تغییر کد» (Code-switching) — یعنی وقتی گوینده در میان یک جمله بین دو یا چند زبان جابجا می‌شود — به‌خوبی مدیریت کند.
  • تقویت زمینه‌ای: دقت برای اسامی خاص مثل «Meta»، «Muse» یا «Menlo Park» را می‌توان با دادن سرنخ‌هایی درباره کلمات کلیدی و زبان مورد نظر افزایش داد.
  • مقیاس‌پذیری: مدل می‌تواند فایل‌های صوتی بیش از یک ساعت را بدون نیاز به پردازش ثانویه (Post-processing) تحلیل کند. در یک دموی عملی با حضور هشت نفر در یک اتاق، سیستم توانست کلمات را در لحظه به افراد مربوطه نسبت دهد.

در آزمایش‌های مستقلی که توسط Artificial Analysis در ۱ سپتامبر ۲۰۲۶ انجام شد، این مدل از رقبای اصلی خود پیشی گرفت. Muse Voice Transcribe با نرخ خطای ۳.۱٪، مدل‌های ElevenLabs Scribe v2 Realtime (با خطای ۳.۶٪ و تأخیر ۰.۱۴ ثانیه) و AssemblyAI Universal-3.5 Pro Realtime (با خطای ۴.۰٪) را شکست داد. مدل Cartesia Ink-2 نیز بسته به اینکه از یک سیستم خارجی برای تشخیص پایان جملات استفاده کرده باشد یا خیر، نمره‌ای بین ۳.۴ تا ۴.۰ درصد کسب کرد.

مدل صوتی لحظه‌ای متا؛ پایه‌ای برای دستیارهای هوشمند همیشه گوش‌به‌زنگ

متا برای تصاحب سهم بازار، وارد یک جنگ قیمتی شده است. هزینه این سرویس ۰.۱۸ دلار برای هر ساعت (یا ۳ دلار به ازای هر ۱۰۰۰ دقیقه) است که به‌طور قابل‌توجهی ارزان‌تر از Cartesia Ink-2 (۴ دلار) و Deepgram Flux یا ElevenLabs Scribe v2 Realtime (۶.۵۰ دلار) است. این رویکرد دقیقاً مشابه استراتژی مدل‌های Muse Spark 1.1 و 1.2 است که اولویت را بر بهینه‌سازی هزینه برای پذیرش انبوه کاربران گذاشته بود؛ مشابه رویکرد جدید Oxlo.ai که برای کاهش هزینه‌های تصاعدی در پنجره‌های متنی بزرگ طراحی شده است.

برای کاربر نهایی، این یعنی عینک‌های هوشمند می‌توانند به‌زودی مانند یک منشی بی‌نقص عمل کنند و هر کلمه در یک اتاق شلوغ را در لحظه به شخص درست نسبت دهند. با این حال، این قابلیت بحث‌های حریم خصوصی را دوباره داغ کرده است؛ به‌طوری که سازمان شبکه فدرال آلمان اخیراً درباره ممنوعیت عینک‌های دوربین‌دار متا بحث کرد، هرچند در نهایت از پیگیری این ممنوعیت صرف‌نظر کرد.

به گزارش منابع داخلی، متا وزن‌های باز (Open Weights) مدل را منتشر نکرده و جزئیاتی از حجم داده‌های آموزشی، تعداد پارامترها یا منابع صوتی مورد استفاده ارائه نداده است. این پروژه حاصل یک سازماندهی گسترده در تابستان ۲۰۲۵ زیر چتر Superintelligence Labs است. متا برای جذب استعدادها از Google DeepMind، Apple و OpenAI بسته‌های مالی خیره‌کننده تا ۳۰۰ میلیون دلار برای چهار سال پیشنهاد داد، هرچند برخی پژوهشگران پس از چند هفته دوباره به OpenAI بازگشتند.

کاربران در حال حاضر می‌توانند از طریق Meta Model API یا از طریق دیکته صوتی در Meta AI و Muse Code (با نگه داشتن کلید Fn) به این مدل دسترسی داشته باشند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، هزینه استنتاج (Inference) — همان لحظه تولید جواب توسط مدل — را با رقبای فعلی مقایسه کنید تا مدل بهینه‌تر را انتخاب کنید.
  • قابلیت تفکیک گوینده را در جلسات چندنفره تست کنید تا دقت برچسب‌گذاری را بسنجید.
  • برای افزایش دقت در اسامی خاص، از قابلیت Contextual Boosting در API متا استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش نرخ خطا و هزینه، مانع اصلی استقرار دستیارهای صوتی بلادرنگ را از بین می‌برد. اعتبار این ادعا با تست‌های مستقل Artificial Analysis تأیید شده و فشار را بر رقبایی مثل ElevenLabs برای کاهش قیمت افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API متا و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل دشوار است و احتمالاً از طریق واسط‌های شخص ثالث امکان‌پذیر خواهد بود.

·نگاه ما
تحریریه دات‌هوش

متا با این مدل، لایه‌ی شنیداری را به یک کالا (Commodity) تبدیل می‌کند تا اکوسیستم گجت‌های پوشیدنی‌اش را تقویت کند. استراتژی کاهش شدید قیمت نشان می‌دهد که هدف متا فروش API نیست، بلکه ایجاد وابستگی کاربر به عینک‌های هوشمند است. در واقع، دقت بالا در اینجا ابزاری برای جمع‌آوری داده‌های محیطی در مقیاس وسیع است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.