پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Granite Speech 5.0 آی‌بی‌ام ۳.۵ ساعت صوت را در یک ثانیه تبدیل به متن می‌کند

·۳ شهریور ۱۴۰۵۴ دقیقه مطالعه
آی‌بی‌ام: مدل Granite Speech 5.0، ۳.۵ ساعت گفتار را در یک ثانیه رونویسی می‌کند
آی‌بی‌ام: مدل Granite Speech 5.0، ۳.۵ ساعت گفتار را در یک ثانیه رونویسی می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دستیابی به توان عملیاتی ۱۲,۶۰۰ RTFx از طریق حذف کامل مدل زبانی و استفاده از رمزگشایی حریصانه در یک معماری غیرخودبازگشتی؛ تغییری از مدل‌های استدلالی به موتورهای تبدیل متن خالص.

۳.۵ ساعت گفتار در یک ثانیه پردازش شود؛ این عدد کفِ کارایی مدل‌های متن‌باز تبدیل گفتار به متن را جابه‌جا کرد. در ۲۵ اوت ۲۰۲۶، شرکت آی‌بی‌ام (IBM) از Granite Speech 5.0 پرده‌برداری کرد؛ جفت‌مدلی فشرده که سرعت خام و تأخیر پایین را بر قابلیت‌های استدلال کلی ترجیح می‌دهد.

این عرضه در حالی رخ می‌دهد که صنعت به سمت رایانش لبه (Edge Computing) حرکت می‌کند؛ جایی که هدف انتقال محاسبات سنگین از مراکز داده عظیم به لپ‌تاپ‌ها و سخت‌افزارهای تخصصی است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی بهینه‌سازی مدل‌های محلی اشاره کردیم، کاهش وابستگی به ابر، کلید استقرار گسترده هوش مصنوعی است. در حالی که نسخه‌های قبلی Granite Speech از رویکردی ترکیبی — یعنی ترکیب رمزگذارهای صوتی با مدل‌های زبانی بزرگ (LLM) — استفاده می‌کردند، سری ۵.۰ برای رسیدن به حداکثر سرعت، تمام سربارهای زبانی را حذف کرده است.

به نقل از وب‌سایت unite.ai، این مدل‌ها روی یک واحد پردازش گرافیکی (GPU) مدل NVIDIA H200 به توان عملیاتی (Throughput) مجموع بیش از ۱۲,۶۰۰ RTFx دست یافته‌اند. این بدان معناست که جریان صوتی بیش از ۱۲ هزار برابر سریع‌تر از مدت‌زمان واقعیِ صحبت‌ها، از سیستم عبور می‌کند.

فلسفه طراحی و موازنه استراتژیک

مدل‌های سری ۵.۰ یک موازنه استراتژیک را نمایندگی می‌کنند: breadth یا گستره قابلیت‌ها فدای تمرکز بر تبدیل گفتار به متن شده است. در نسخه‌های پیشین مانند سری ۳.۳ و ۴.x، یک رمزگذار صوتی Conformer از طریق لایه‌های لورا (LoRA) و یک پروژکتور به مدل زبانی Granite متصل شده بود. این ساختار اجازه می‌داد متن به‌صورت خودبازگشتی (Autoregressive) تولید شود، شبیه به نحوه عملکرد مدل‌های چت.

آی‌بی‌ام با حذف کامل مدل زبانی، ساختاری ایجاد کرده که برای کاربردهای سازمانی مناسب است؛ جایی که تأخیر و توان عملیاتی بسیار مهم‌تر از این است که مدل بتواند درباره آنچه شنیده است «استدلال» کند. این تغییر، مدل‌ها را برای استقرار روی لپ‌تاپ‌ها و سخت‌افزارهای لبه ایده‌آل می‌کند.

معماری فنی و مشخصات

این جهش سرعت نتیجه یک تغییر بنیادین در معماری است. برخلاف نسخه‌های قبلی که از تولید خودبازگشتی استفاده می‌کردند، مدل‌های ۵.۰ از یک رمزگذار Conformer ۱۶ لایه بهره می‌برند که با روش CTC (Connectionist Temporal Classification) آموزش دیده است. این معماری به مدل اجازه می‌دهد فریم‌های صوتی را مستقیماً و در یک گذر غیرخودبازگشتی با استفاده از رمزگشایی حریصانه (Greedy decoding) به توکن‌های خروجی تبدیل کند.

مشخصات فنی کلیدی عبارتند از:

  • تعداد پارامترها: ۴۷۰ میلیون پارامتر برای هر دو نسخه.
  • نمونه‌برداری زمانی: سه مرحله نمونه‌برداری ۲ برابر از ورودی log-Mel (۱۰۰ فریم در ثانیه)، که خروجی را از ۵۰ کاراکتر در ثانیه به ۱۲.۵ توکن در ثانیه کاهش می‌دهد.
  • واژگان: تغییر به ۱۶,۳۸۴ واحد زیرکلمه (SentencePiece برای مدل غیرتجاری و BPE برای مدل آپاچی).
  • سخت‌افزار آموزش: ۸ عدد NVIDIA H100 در خوشه Blue Vela طی ۱۰ روز.
  • داده‌های آموزش: مدل Apache 2.0 از حدود ۶۰,۰۰۰ ساعت صوت انگلیسی استفاده کرده است. نسخه غیرتجاری با افزودن مجموعه‌های GigaSpeech و SPGI Speech (حدود ۱۵,۰۰۰ ساعت اضافی)، حجم کل داده‌ها را به نزدیک ۷۵,۰۰۰ ساعت رسانده است که تحت لایسنس CC-BY-NC-SA-4.0 عرضه می‌شود.

بنچمارک‌ها و نقاط ضعف

بر اساس گزارش آی‌بی‌ام، در مجموعه‌های آزمون کوتاه انگلیسی OpenASR، نسخه غیرتجاری به نرخ خطای کلمه (WER) ۴.۸۵٪ و نسخه آپاچی به ۵.۰۰٪ رسیده است. این استنتاج‌ها از طریق زیرساخت Hugging Face اجرا شده‌اند و با ابزارهای لیدربورد امتیازدهی شده‌اند؛ لذا آی‌بی‌ام انتظار دارد پس از به‌روزرسانی جداول رسمی، این اعداد با نتایج تطبیق یابند. این تمرکز بر اعداد بنچمارک در حالی است که اخیراً بحث‌هایی درباره تمایل برخی مدل‌ها به تولید دقت کاذب از طریق بهینه‌سازی بیش از حد برای بنچمارک‌های عمومی مطرح شده است.

در آزمون‌های صوتی میدان‌دور (FFASR) که محیط‌های نویزی، دارای بازگشت صدا و منابع صوتی متحرک را در نسبت‌های مختلف سیگنال به نویز (SNR) می‌سنجند، مدل غیرتجاری رتبه پنجم و مدل آپاچی رتبه نهم را از نظر صحت کسب کردند. نکته حیاتی این است که هر دو مدل، سریع‌ترین ورودی‌های این جدول در زمان اجرا روی یک NVIDIA L4 بودند. این دستاورد در زمینه سرعت، تضاد جالبی با چالش‌های اخیر رقبا دارد؛ برای مثال مدل‌های جدید OpenAI در زمینه نرخ خطای بازشناسی گفتار با انتقاداتی مبنی بر عقب ماندن از رقبایی چون ElevenLabs مواجه شده‌اند.

با این حال، عدد ۱۲,۶۰۰ RTFx مربوط به استنتاج دسته‌ای (Batched Inference) روی GPUهای سطح دیتاسنتر است و کاربر در دموهای WebGPU روی لپ‌تاپ، این سرعت را تجربه نخواهد کرد. همچنین، داده‌های اضافی در مدل غیرتجاری اگرچه یک برتری نسبی در صحت کلی و مزیتی محسوس در مجموعه SPGI Speech ایجاد کرده است، اما در آزمون جدید و تکه‌تکه شده Earnings22 در لیدربورد، ضعف محسوسی نشان می‌دهد.

حذف مدل زبانی باعث شده Granite Speech 5.0 توانایی ترجمه هم‌زمان گفتار یا اعمال سوگیری کلمات کلیدی (Keyword Biasing) را از دست بدهد. این مدل دیگر نمی‌تواند درباره صوت «فکر» کند یا استدلال نماید، بلکه صرفاً یک موتور تبدیل متن فوق‌سریع و اختصاصی است.

داده‌ها و استقرار

این چرخش برای جامعه فنی سیگنالی است مبنی بر فاصله گرفتن از فلسفه «یک مدل برای همه کارها» و حرکت به سمت رمزگذارهای بسیار تخصصی و سبک برای خطوط تولید (Production Pipelines). آموزش این مدل‌ها بر باز بودن داده‌ها تأکید دارد، زیرا هر مجموعه‌داده در هر دو بدنه داده‌ها به‌صورت عمومی در دسترس است.

برای بهبود صحت، ۲,۷۴۰ ساعت داده مصنوعی به آموزش اضافه شده است، شامل:

  • ۲,۵۰۰ ساعت صوت چند-گوینده که از قطعات تک-گوینده متصل شده‌اند.
  • ۲۴۰ ساعت جملات تولید شده توسط مدل‌های وزن‌های باز (Open Weights) شرکت OpenAI یعنی gpt-oss و سنتز شده با StyleTTS2؛ این بخش به‌طور خاص برای بهبود تشخیص اعداد، ارزها و آدرس‌ها طراحی شده که معمولاً باعث خطا در سیستم‌های تشخیص گفتار می‌شوند.

توسعه‌دهندگان اکنون می‌توانند هر دو مدل را در Hugging Face دریافت کنند. این مدل‌ها دارای پشتیبانی بومی در کتابخانه transformers هستند (که تا انتشار نسخه بعدی باید از سورس نصب شوند). همچنین یک دموی استریمینگ مبتنی بر مرورگر برای کاربران کروم و اج در دسترس است تا تأخیر را به‌صورت زنده آزمایش کنند.

گام بعدی شما

  • اگر در حال توسعه اپلیکیشن‌های تبدیل گفتار به متن هستید، مدل Apache 2.0 را برای کاربردهای تجاری بدون محدودیت لایسنس تست کنید.
  • برای کاهش هزینه‌های استنتاج در مقیاس بالا، معماری غیرخودبازگشتی (Non-autoregressive) این مدل را با مدل‌های Whisper مقایسه کنید.
  • دموی WebGPU را در مرورگر اجرا کنید تا تفاوت تأخیر در سخت‌افزارهای لبه را مشاهده کنید.

اما بهینه‌سازی‌های سخت‌افزاری برای اجرای این مدل‌ها روی تراشه‌های NPU حتی جذاب‌تر است — به تحلیل ما درباره آینده پردازنده‌های عصبی مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار معماری Conformer و حذف لایه‌های زبانی، استانداردهای توان عملیاتی در رایانش لبه را جابه‌جا کرد. شرکت‌هایی که نیاز به پردازش هزاران ساعت صوت در ثانیه دارند، اکنون جایگزینی سریع‌تر و ارزان‌تر برای مدل‌های ابری پیدا کرده‌اند.

تأثیر برای ایران

به‌دلیل وزن‌های باز و لایسنس Apache 2.0، توسعه‌دهندگان ایرانی می‌توانند این مدل را به‌صورت محلی (On-premises) مستقر کنند و از محدودیت‌های APIهای خارجی برای تبدیل گفتار به متن عبور کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های زبانی سنگین با رمزگذارهای تخصصی CTC نشان می‌دهد که در محیط‌های عملیاتی، سرعت و پیش‌بینی‌پذیری تأخیر بر «هوش» مدل اولویت دارد. آی‌بی‌ام با این حرکت، عملاً پذیرفته است که برای تبدیل گفتار به متن در مقیاس سازمانی، نیازی به استدلال زبانی در لحظه استنتاج نیست و می‌توان این بخش را به مراحل پس‌پردازش سپرد. این رویکرد، مدل‌های ASR را از حالت «همه‌کاره» به «ابزارهای تخصصی» در یک خط لوله تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.