۳.۵ ساعت گفتار در یک ثانیه پردازش شود؛ این عدد کفِ کارایی مدلهای متنباز تبدیل گفتار به متن را جابهجا کرد. در ۲۵ اوت ۲۰۲۶، شرکت آیبیام (IBM) از Granite Speech 5.0 پردهبرداری کرد؛ جفتمدلی فشرده که سرعت خام و تأخیر پایین را بر قابلیتهای استدلال کلی ترجیح میدهد.
این عرضه در حالی رخ میدهد که صنعت به سمت رایانش لبه (Edge Computing) حرکت میکند؛ جایی که هدف انتقال محاسبات سنگین از مراکز داده عظیم به لپتاپها و سختافزارهای تخصصی است. همانطور که در تحلیلهای پیشین ما دربارهی بهینهسازی مدلهای محلی اشاره کردیم، کاهش وابستگی به ابر، کلید استقرار گسترده هوش مصنوعی است. در حالی که نسخههای قبلی Granite Speech از رویکردی ترکیبی — یعنی ترکیب رمزگذارهای صوتی با مدلهای زبانی بزرگ (LLM) — استفاده میکردند، سری ۵.۰ برای رسیدن به حداکثر سرعت، تمام سربارهای زبانی را حذف کرده است.
به نقل از وبسایت unite.ai، این مدلها روی یک واحد پردازش گرافیکی (GPU) مدل NVIDIA H200 به توان عملیاتی (Throughput) مجموع بیش از ۱۲,۶۰۰ RTFx دست یافتهاند. این بدان معناست که جریان صوتی بیش از ۱۲ هزار برابر سریعتر از مدتزمان واقعیِ صحبتها، از سیستم عبور میکند.
فلسفه طراحی و موازنه استراتژیک
مدلهای سری ۵.۰ یک موازنه استراتژیک را نمایندگی میکنند: breadth یا گستره قابلیتها فدای تمرکز بر تبدیل گفتار به متن شده است. در نسخههای پیشین مانند سری ۳.۳ و ۴.x، یک رمزگذار صوتی Conformer از طریق لایههای لورا (LoRA) و یک پروژکتور به مدل زبانی Granite متصل شده بود. این ساختار اجازه میداد متن بهصورت خودبازگشتی (Autoregressive) تولید شود، شبیه به نحوه عملکرد مدلهای چت.
آیبیام با حذف کامل مدل زبانی، ساختاری ایجاد کرده که برای کاربردهای سازمانی مناسب است؛ جایی که تأخیر و توان عملیاتی بسیار مهمتر از این است که مدل بتواند درباره آنچه شنیده است «استدلال» کند. این تغییر، مدلها را برای استقرار روی لپتاپها و سختافزارهای لبه ایدهآل میکند.
معماری فنی و مشخصات
این جهش سرعت نتیجه یک تغییر بنیادین در معماری است. برخلاف نسخههای قبلی که از تولید خودبازگشتی استفاده میکردند، مدلهای ۵.۰ از یک رمزگذار Conformer ۱۶ لایه بهره میبرند که با روش CTC (Connectionist Temporal Classification) آموزش دیده است. این معماری به مدل اجازه میدهد فریمهای صوتی را مستقیماً و در یک گذر غیرخودبازگشتی با استفاده از رمزگشایی حریصانه (Greedy decoding) به توکنهای خروجی تبدیل کند.
مشخصات فنی کلیدی عبارتند از:
- تعداد پارامترها: ۴۷۰ میلیون پارامتر برای هر دو نسخه.
- نمونهبرداری زمانی: سه مرحله نمونهبرداری ۲ برابر از ورودی log-Mel (۱۰۰ فریم در ثانیه)، که خروجی را از ۵۰ کاراکتر در ثانیه به ۱۲.۵ توکن در ثانیه کاهش میدهد.
- واژگان: تغییر به ۱۶,۳۸۴ واحد زیرکلمه (SentencePiece برای مدل غیرتجاری و BPE برای مدل آپاچی).
- سختافزار آموزش: ۸ عدد NVIDIA H100 در خوشه Blue Vela طی ۱۰ روز.
- دادههای آموزش: مدل Apache 2.0 از حدود ۶۰,۰۰۰ ساعت صوت انگلیسی استفاده کرده است. نسخه غیرتجاری با افزودن مجموعههای GigaSpeech و SPGI Speech (حدود ۱۵,۰۰۰ ساعت اضافی)، حجم کل دادهها را به نزدیک ۷۵,۰۰۰ ساعت رسانده است که تحت لایسنس CC-BY-NC-SA-4.0 عرضه میشود.
بنچمارکها و نقاط ضعف
بر اساس گزارش آیبیام، در مجموعههای آزمون کوتاه انگلیسی OpenASR، نسخه غیرتجاری به نرخ خطای کلمه (WER) ۴.۸۵٪ و نسخه آپاچی به ۵.۰۰٪ رسیده است. این استنتاجها از طریق زیرساخت Hugging Face اجرا شدهاند و با ابزارهای لیدربورد امتیازدهی شدهاند؛ لذا آیبیام انتظار دارد پس از بهروزرسانی جداول رسمی، این اعداد با نتایج تطبیق یابند. این تمرکز بر اعداد بنچمارک در حالی است که اخیراً بحثهایی درباره تمایل برخی مدلها به تولید دقت کاذب از طریق بهینهسازی بیش از حد برای بنچمارکهای عمومی مطرح شده است.
در آزمونهای صوتی میداندور (FFASR) که محیطهای نویزی، دارای بازگشت صدا و منابع صوتی متحرک را در نسبتهای مختلف سیگنال به نویز (SNR) میسنجند، مدل غیرتجاری رتبه پنجم و مدل آپاچی رتبه نهم را از نظر صحت کسب کردند. نکته حیاتی این است که هر دو مدل، سریعترین ورودیهای این جدول در زمان اجرا روی یک NVIDIA L4 بودند. این دستاورد در زمینه سرعت، تضاد جالبی با چالشهای اخیر رقبا دارد؛ برای مثال مدلهای جدید OpenAI در زمینه نرخ خطای بازشناسی گفتار با انتقاداتی مبنی بر عقب ماندن از رقبایی چون ElevenLabs مواجه شدهاند.
با این حال، عدد ۱۲,۶۰۰ RTFx مربوط به استنتاج دستهای (Batched Inference) روی GPUهای سطح دیتاسنتر است و کاربر در دموهای WebGPU روی لپتاپ، این سرعت را تجربه نخواهد کرد. همچنین، دادههای اضافی در مدل غیرتجاری اگرچه یک برتری نسبی در صحت کلی و مزیتی محسوس در مجموعه SPGI Speech ایجاد کرده است، اما در آزمون جدید و تکهتکه شده Earnings22 در لیدربورد، ضعف محسوسی نشان میدهد.
حذف مدل زبانی باعث شده Granite Speech 5.0 توانایی ترجمه همزمان گفتار یا اعمال سوگیری کلمات کلیدی (Keyword Biasing) را از دست بدهد. این مدل دیگر نمیتواند درباره صوت «فکر» کند یا استدلال نماید، بلکه صرفاً یک موتور تبدیل متن فوقسریع و اختصاصی است.
دادهها و استقرار
این چرخش برای جامعه فنی سیگنالی است مبنی بر فاصله گرفتن از فلسفه «یک مدل برای همه کارها» و حرکت به سمت رمزگذارهای بسیار تخصصی و سبک برای خطوط تولید (Production Pipelines). آموزش این مدلها بر باز بودن دادهها تأکید دارد، زیرا هر مجموعهداده در هر دو بدنه دادهها بهصورت عمومی در دسترس است.
برای بهبود صحت، ۲,۷۴۰ ساعت داده مصنوعی به آموزش اضافه شده است، شامل:
- ۲,۵۰۰ ساعت صوت چند-گوینده که از قطعات تک-گوینده متصل شدهاند.
- ۲۴۰ ساعت جملات تولید شده توسط مدلهای وزنهای باز (Open Weights) شرکت OpenAI یعنی gpt-oss و سنتز شده با StyleTTS2؛ این بخش بهطور خاص برای بهبود تشخیص اعداد، ارزها و آدرسها طراحی شده که معمولاً باعث خطا در سیستمهای تشخیص گفتار میشوند.
توسعهدهندگان اکنون میتوانند هر دو مدل را در Hugging Face دریافت کنند. این مدلها دارای پشتیبانی بومی در کتابخانه transformers هستند (که تا انتشار نسخه بعدی باید از سورس نصب شوند). همچنین یک دموی استریمینگ مبتنی بر مرورگر برای کاربران کروم و اج در دسترس است تا تأخیر را بهصورت زنده آزمایش کنند.
گام بعدی شما
- اگر در حال توسعه اپلیکیشنهای تبدیل گفتار به متن هستید، مدل Apache 2.0 را برای کاربردهای تجاری بدون محدودیت لایسنس تست کنید.
- برای کاهش هزینههای استنتاج در مقیاس بالا، معماری غیرخودبازگشتی (Non-autoregressive) این مدل را با مدلهای Whisper مقایسه کنید.
- دموی WebGPU را در مرورگر اجرا کنید تا تفاوت تأخیر در سختافزارهای لبه را مشاهده کنید.
اما بهینهسازیهای سختافزاری برای اجرای این مدلها روی تراشههای NPU حتی جذابتر است — به تحلیل ما درباره آینده پردازندههای عصبی مراجعه کنید.




گفتگو