پرش به محتوای اصلی
پرش به محتوای مقاله

تراکنش‌های صوتی اپل نرخ خطای Whisper را ۴ برابر کاهش داد

·۲۲ تیر ۱۴۰۵۶ دقیقه مطالعه۲ بازدید
مقایسه API جدید گفتار اپل با ویسپر: اولین بنچمارک واقعی
مقایسه API جدید گفتار اپل با ویسپر: اولین بنچمارک واقعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۴ برابری نرخ خطای تبدیل صوت در ابزارهای بومی اپل در مقایسه با نسل قبلی و پیشی گرفتن از Whisper Small در استنتاج محلی انگلیسی.

اگر همین حالا برای تبدیل صوت به متن از مدل‌های خارجی استفاده می‌کنید، احتمالاً متوجه شده‌اید که توازن میان حریم خصوصی و دقت همیشه دشوار بوده است. اما حالا اپل این معادله را تغییر داده و ابزاری ارائه کرده که هم سریع‌تر است و هم خطاهای کمتری دارد.

به گزارش Inscribe، ابزار جدید SpeechAnalyzer اپل در بازشناسی گفتار (ASR) انگلیسی، موفق شد مدل Whisper Small شرکت OpenAI را شکست دهد و در محیط‌های صوتی پاک، نرخ خطای کلمه (WER) را به ۲.۱۲٪ برساند. این یعنی دقیق‌ترین سیستم تبدیل صوت به متن روی دستگاه، دیگر یک مدل شخص ثالث نیست، بلکه یک ابزار داخلی است.

برای سال‌ها، توسعه‌دهندگان میان ابزارهای بومی اپل و Whisper مردد بودند، چون اپل هیچ عدد رسمی منتشر نمی‌کرد. همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، شفافیت در بنچمارک‌ها تنها راه سنجش واقعی است. این ابهام زمانی برطرف شد که Inscribe یک آزمون مقایسه‌ای دقیق روی سخت‌افزار M2 Pro (۳۲ گیگابایت) با سیستم‌عامل macOS ۲۶.۵.۱ اجرا کرد.

بسیاری از کاربران با API قدیمی SFSpeechRecognizer آشنا هستند. این ابزار اگرچه کاربردی بود، اما حتی از کوچک‌ترین مدل‌های Whisper هم ضعیف‌تر عمل می‌کرد. داده‌های Inscribe نشان می‌دهد که مهاجرت به APIهای جدید SpeechAnalyzer و SpeechTranscriber برای هر اپلیکیشنی که فراتر از دستورات صوتی ساده عمل می‌کند، یک ارتقای حیاتی است.

کالبدشکافی دقت و خطا

در این محک (Benchmark) از مجموعه داده LibriSpeech استفاده شد که شامل ۲۶۲۰ عبارت صوتی پاک (test-clean) و ۲۹۳۹ عبارت دشوارتر و نویزی (test-other) است. نرخ خطای کلمه (WER) — که درصد کلمات جایگزین‌شده، حذف‌شده یا ساختگی را می‌سنجد — هرچه کمتر باشد، دقت بالاتر است.

بر اساس مستندات منتشر شده در get-inscribe.com، نتایج نهایی به شرح زیر است:

  • Apple SpeechAnalyzer (iOS/macOS 26): نرخ خطای ۲.۱۲٪ (پاک) / ۴.۵۶٪ (نویزی)
  • Whisper Small (WhisperKit CoreML): نرخ خطای ۳.۷۴٪ (پاک) / ۷.۹۵٪ (نویزی)
  • Whisper Base: نرخ خطای ۵.۴۲٪ (پاک) / ۱۲.۵۱٪ (نویزی)
  • Whisper Tiny: نرخ خطای ۷.۸۸٪ (پاک) / ۱۷.۰۴٪ (نویزی)
  • SFSpeechRecognizer (نسخه قدیمی): نرخ خطای ۹.۰۲٪ (پاک) / ۱۶.۲۵٪ (نویزی)

مقایسه API قدیمی با نسخه جدید، کاهش ۳.۵ تا ۴ برابری نرخ خطا را نشان می‌دهد. علاوه بر اعداد، ابزار جدید متنی با علامت‌گذاری درست و حروف بزرگ و کوچک تولید می‌کند، در حالی که خروجی مدل قدیمی بسیار خام بود. برای یک کاربر واقعی، این یعنی یک جلسه یک‌ساعته که با API قدیمی تبدیل می‌شود، تقریباً ۴ برابر بیشتر از نسخه SpeechAnalyzer اشتباه دارد.

سرعت و عملکرد سخت‌افزاری

فراتر از دقت، این موتور جدید بسیار بهینه‌تر است. SpeechAnalyzer در هر ثانیه پردازش صوت، تقریباً ۳ برابر سریع‌تر از Whisper Small عمل می‌کند.

هر پنج موتور تست‌شده، به‌راحتی سریع‌تر از سرعت واقعی (Real-time) عمل کردند و سرعت آن‌ها روی M2 Pro بین ۱۲ تا ۴۰ برابر بود. این بدان معناست که یک ساعت فایل صوتی در حدود ۱.۵ تا ۵ دقیقه روی خودِ دستگاه تبدیل می‌شود.

متدولوژی و اعتبارسنجی

تیم Inscribe برای اطمینان از صحت داده‌ها، نتایج خود را با اعداد منتشرشده توسط OpenAI مقایسه کرد. اندازه‌گیری‌های آن‌ها برای مدل‌های Tiny، Base و Small با داده‌های OpenAI تطابق داشت و تنها تفاوت اندکی (۰.۱۱٪ تا ۰.۴۲٪) دیده شد. این تفاوت به دلیل سخت‌گیرانه‌تر بودن نرمال‌ساز متن و کوانتزاسیون (Quantization) — که شبیه فشرده‌سازی یک عکس باکیفیت برای اشغال فضای کمتر بدون تغییر زیاد در ظاهر است — در CoreML رخ داده است.

نکته کلیدی این است که تمام پردازش‌ها کاملاً روی دستگاه (On-device) انجام شد. از آنجا که SFSpeechRecognizer به‌طور پیش‌فرض صوت را به سرورهای اپل می‌فرستد، سیستم تست طوری طراحی شد که در صورت تلاش برای اتصال به ابر، اجرای برنامه را متوقف کند تا مقایسه عادلانه باقی بماند.

جزئیات فنی بنچمارک

برای اینکه اعداد WER معنای واقعی داشته باشند، Inscribe کنترل‌های دقیقی اعمال کرد:

  • مسیرهای کد تولیدی: هر موتور از همان کدی اجرا شد که کاربران نهایی Inscribe دریافت می‌کنند، نه یک محیط آزمایشگاهی ساده.
  • نرمال‌سازی متن: چون مراجع LibriSpeech بدون علامت‌گذاری بودند، هر دو طرف از یک نرمال‌ساز یکسان برای مدیریت حروف بزرگ و کوچک و تبدیل اعداد به کلمات استفاده کردند.
  • محاسبه مجموع WER: تعداد کل خطاها بر کل کلمات مرجع تقسیم شد تا جملات کوتاه وزن غیرمنطقی نداشته باشند.
  • محاسبه شکست‌ها: هر موتوری که هیچ خروجی تولید نمی‌کرد، ۱۰۰٪ نرخ خطا گرفت. این اتفاق تنها یک بار در ۲۷۷۹۵ تبدیل (در مدل قدیمی) رخ داد.
  • شفافیت عمومی: نسخه‌های خام تمام ۵۵۵۹ عبارت در قالب فایل‌های JSON برای بررسی عموم منتشر شده است.

تأثیر بر محصول و تجربه کاربر

بررسی دقیق این داده‌ها حتی به تیم Inscribe کمک کرد تا یک باگ در کد خود پیدا کنند. آن‌ها متوجه شدند که در بخش وارد کردن فایل، فراخوانی تابع finalizeAndFinishThroughEndOfInput() فراموش شده است. این موضوع باعث می‌شد تحلیل‌گر هرگز نتیجه نهایی را تحویل ندهد و برنامه برای همیشه در حالت انتظار بماند. این باگ پیش از این دیده نشده بود چون تنظیمات «خودکار» برنامه، مدل Whisper را ترجیح می‌داد.

موازنه استراتژیک

با وجود پیروزی در زبان انگلیسی، Whisper همچنان دو مزیت حیاتی دارد. اول، پشتیبانی از زبان‌های بسیار بیشتر است؛ در حالی که SpeechTranscriber تنها به حدود ۳۰ زبان محدود می‌شود. دوم، Whisper چندپلتفرمی است اما SpeechAnalyzer فقط روی iOS 26 یا macOS 26 اجرا می‌شود.

اندازه مدل‌ها نیز متفاوت است. SpeechAnalyzer یک ابزار سیستمی است، اما مدل‌های Whisper از Tiny (حدود ۴۰ مگابایت) تا Small (حدود ۴۶۰ مگابایت) متغیر هستند.

برای توسعه‌دهندگان، مسیر تصمیم‌گیری ساده است: برای زبان‌های پشتیبانی‌شده روی سخت‌افزارهای مدرن اپل از موتور بومی استفاده کنید و Whisper را برای موارد دیگر نگه دارید. Inscribe دقیقاً همین استراتژی را در تنظیمات پیش‌فرض خود اعمال کرده است.

این بنچمارک ثابت می‌کند که تضاد میان حریم خصوصی و عملکرد برای کاربران انگلیسی‌زبان از بین رفته است. دیگر لازم نیست بین تجربه خصوصی روی دستگاه و دقت بالا یکی را انتخاب کنید.

محدودیت‌ها و چشم‌انداز

باید یادآور شد که این نتایج محدود به گفتار خوانده‌شده انگلیسی است. اگرچه LibriSpeech یک استاندارد است، اما پیچیدگی‌های لهجه‌ها یا محیط‌های شلوغ جلسات را منعکس نمی‌کند.

همچنین، در حالی که دقت احتمالاً در تمام تراشه‌های اپل سیلیکون یکسان است، سرعت بسته به نوع تراشه تغییر می‌کند. این تست‌ها از WhisperKit CoreML استفاده کردند که تبدیل‌های کوانتیده روی دستگاه هستند، بنابراین ممکن است با پیاده‌سازی‌های GPU مرجع تفاوت اندک داشته باشند.

منتظر بنچمارک‌های آینده درباره صدای واقعی اتاق‌های جلسات باشید، زیرا این تنها ادامه منطقی برای یافته‌های فعلی است.

گام بعدی شما

  • اگر توسعه‌دهنده اپلیکیشن‌های macOS یا iOS هستید، سریعاً APIهای SpeechAnalyzer را جایگزین SFSpeechRecognizer کنید.
  • در تنظیمات خود، منطق «انتخاب هوشمند» را پیاده کنید: اولویت با موتور بومی اپل برای زبان‌های پشتیبانی‌شده و سپس Whisper برای زبان‌های دیگر.
  • برای کاهش مصرف باتری و افزایش سرعت، استنتاج‌های Whisper را به CoreML منتقل کنید.

اما داستان سخت‌افزاری این تحولات حتی شگفت‌انگیزتر است؛ برای درک چگونگی پردازش این مدل‌ها، تحلیل ما درباره تراشه‌های جدید اپل را بخوانید.

چرا این موضوع مهم است؟

این تحول بر اساس تجربه واقعی در بنچمارک‌های سخت‌افزاری، پایان دوران انتخاب بین «دقت بالا با ابر» و «سرعت پایین روی دستگاه» برای کاربران اپل است. اعتبار این نتایج به دلیل شفافیت در انتشار نسخه‌های خام تبدیل‌ها و تطابق با داده‌های OpenAI تأیید شده است.

تأثیر برای ایران

به دلیل محدودیت‌های دسترسی به APIهای OpenAI، توسعه‌دهندگان ایرانی که روی اکوسیستم اپل کار می‌کنند، اکنون می‌توانند بدون نیاز به پروکسی یا هزینه‌های دلاری، به دقتی بالاتر از Whisper دست یابند.

·نگاه ما
تحریریه دات‌هوش

جایگاه Whisper به عنوان استاندارد طلایی استنتاج محلی در حال تغییر است. اپل با ادغام مدل‌های بازشناسی گفتار در سطح سیستم‌عامل، هزینه استنتاج را برای توسعه‌دهندگان صفر کرده و همزمان دقت را به سطحی رسانده که نیاز به مدل‌های حجیم شخص ثالث را در زبان انگلیسی از بین می‌برد. این رویکرد نشان می‌دهد اپل قصد دارد لایه‌ی پردازش صوت را به بخشی از زیرساخت سخت‌افزاری-نرم‌افزاری خود تبدیل کند تا وابستگی به APIهای ابری کاهش یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.