پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Grok Voice Transcribe 2.0 دقت تبدیل گفتار به متن را دو برابر کرد

·۲۷ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
لوگوی Grok Voice Transcribe ۲.۰ در کنار نماد موج صدا و میکروفون
لوگوی Grok Voice Transcribe ۲.۰ در کنار نماد موج صدا و میکروفون
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

دوبار شدن دقت در محیط‌های پرنویز بدون تغییر قیمت؛ انتقال تمرکز از بهبود کیفیت کلی به حل چالش‌های محیطی (نویز و لهجه) در مقیاس تجاری.

اگر مدیر یک تیم فنی هستید که ساعت‌ها جلسات ضبط‌شده را برای استخراج تسک‌ها مرور می‌کنید، هزینه زمانی شما به‌شدت کاهش می‌یابد. در ۱۸ سپتامبر ۲۰۲۶، شرکت x.ai از مدل Grok Voice Transcribe 2.0 پرده‌برداری کرد؛ ابزاری که به‌طور خاص برای مدیریت هرج‌ومرج محیط‌های صوتی زنده طراحی شده است.

بسیاری از ابزارهای تبدیل گفتار به متن — شبیه به کسی که در یک مهمانی شلوغ سعی می‌کند صدای یک نفر را بشنود — وقتی با تداخل صداها یا لهجه‌های غلیظ مواجه می‌شوند، شکست می‌خورند. این مدل جدید دقیقاً روی همین نقاط ضعف تمرکز کرده است تا از محیط‌های استریل آزمایشگاهی فاصله بگیرد. این رقابت در حوزه دقت تبدیل صوت به متن شدت یافته است، به‌طوری که مدل Muse Voice متا پیش از این توانسته بود نرخ خطای خود را به ۳.۱٪ برساند. طبق اعلام x.ai، این سیستم بر پایه همان مدل بنیادی (Foundation Model) — یعنی زیرساخت کلی که مثل یک مغز خام برای یادگیری مفاهیم اولیه است — ساخته شده که در خودروهای Tesla و سامانه‌های پشتیبانی مشتری به کار می‌رود.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اکوسیستم x.ai اشاره کردیم، استراتژی این شرکت همواره بر پایه داده‌های واقعی و زنده است. این رویکرد در کنار بهبودهای اخیر در قدرت استدلال مدل Grok 4.6، نشان‌دهنده تلاش x.ai برای تسلط بر بازارهای سازمانی است. بر اساس گزارش x.ai، این مدل در حال حاضر رتبه اول دقت را در میان ۳۲ مدل استریمینگ در جدول Artificial Analysis دارد. ارزیابی‌های داخلی شرکت پیشرفت‌های چشمگیری را در چهار حوزه نشان می‌دهد:

  • تلفنی: برتری مطلق در تحلیل تماس‌های پشتیبانی مشتری.
  • چندزبانه: کاهش نرخ خطای کلمه (Word Error Rate) برای دستورات کوتاه از ۲۰.۶٪ به ۶.۸٪.
  • شناسه‌ها: دقت بالاتر در تشخیص کدهای حساب و آدرس‌های ایمیل.
  • گفتگوها: دقت بیشتر در تعاملات مستقیم با دستیار Grok.

از نظر فنی، این مدل قابلیت تفکیک گوینده (Speaker Diarization) را بدون هزینه اضافی ارائه می‌دهد و می‌تواند تا ۸ کانال صوتی را به‌طور هم‌زمان پردازش کند. همچنین ویژگی «سوگیری اصطلاحات کلیدی» به کاربران اجازه می‌دهد ۱۰۰ عبارت تخصصی را به هر درخواست اضافه کنند تا مدل در تشخیص کلمات فنی دچار خطا نشود. این دقت بالا در پردازش، پاسخی به چالش‌های پیشین است؛ چرا که برخی کاربران پیش‌تر از نقص‌های فنی در مدل Grok Lite و تولید متون نامفهوم گلایه کرده بودند.

پلتفرم Atlassian Loom پیش از این از این فناوری برای تبدیل تمام ویدیوهای خود به متن استفاده کرده است. این ادغام مسیرهای جدیدی را باز می‌کند؛ مثلاً می‌توانید متن یک ویدیو را مستقیماً به محیط Cursor بفرستید تا کدها بر اساس برنامه ضبط‌شده به‌طور خودکار به‌روز شوند.

برای کسب‌وکارها، این تغییر ثابت می‌کند که مرز بعدی هوش مصنوعی صوتی، نه لزوماً کیفیت بالاتر، بلکه مدیریت صداهای «سخت‌تر» است. با حل مشکل نویز و لهجه، x.ai گردش‌کارهای «صوت به کد» را برای مقیاس سازمانی عملی کرد.

قیمت‌گذاری این نسخه با نسخه ۱.۰ یکسان است: تبدیل دسته‌ای (Batch) هر ساعت ۰.۱۰ دلار و استریمینگ ۰.۲۰ دلار. توجه داشته باشید که نسخه ۱.۰ در هفته‌های آینده بازنشسته خواهد شد.

گام بعدی شما

  • اگر از Loom استفاده می‌کنید، قابلیت‌های جدید تبدیل متن را برای اتوماسیون تسک‌ها تست کنید.
  • در صورت استفاده از API، اصطلاحات تخصصی حوزه کاری خود را در بخش Key Term Biasing تعریف کنید.
  • برای کاهش هزینه‌ها، پردازش‌های غیرضروری را از حالت استریمینگ به Batch منتقل کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار داده‌های واقعی تسلا، استانداردهای تبدیل گفتار به متن را از محیط‌های آزمایشگاهی به محیط‌های صنعتی منتقل می‌کند. این موضوع باعث می‌شود اتوماسیون بر اساس صوت در سازمان‌های بزرگ از یک ابزار کمکی به یک زیرساخت قابل اعتماد تبدیل شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این مدل محدود است، اما ادغام آن در ابزارهایی مثل Loom برای کاربران ایرانی که از این پلتفرم استفاده می‌کنند، تجربه کاربری را بهبود می‌بخشد.

·نگاه ما
تحریریه دات‌هوش

تمرکز x.ai بر «صداهای سخت» به‌جای بنچمارک‌های تمیز، نشان می‌دهد که رقابت در حوزه صوت از مرحله اثبات مفهوم به مرحله کاربرد صنعتی رسیده است. این مدل با کاهش نرخ خطای کلمه در دستورات کوتاه، در واقع در حال آماده‌سازی زیرساخت برای عامل‌های صوتی (Voice Agents) است که باید در محیط‌های واقعی و پرنویز (مثل داخل خودرو یا کارخانه) بدون خطا عمل کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.