اگر مدیر یک تیم فنی هستید که ساعتها جلسات ضبطشده را برای استخراج تسکها مرور میکنید، هزینه زمانی شما بهشدت کاهش مییابد. در ۱۸ سپتامبر ۲۰۲۶، شرکت x.ai از مدل Grok Voice Transcribe 2.0 پردهبرداری کرد؛ ابزاری که بهطور خاص برای مدیریت هرجومرج محیطهای صوتی زنده طراحی شده است.
بسیاری از ابزارهای تبدیل گفتار به متن — شبیه به کسی که در یک مهمانی شلوغ سعی میکند صدای یک نفر را بشنود — وقتی با تداخل صداها یا لهجههای غلیظ مواجه میشوند، شکست میخورند. این مدل جدید دقیقاً روی همین نقاط ضعف تمرکز کرده است تا از محیطهای استریل آزمایشگاهی فاصله بگیرد. این رقابت در حوزه دقت تبدیل صوت به متن شدت یافته است، بهطوری که مدل Muse Voice متا پیش از این توانسته بود نرخ خطای خود را به ۳.۱٪ برساند. طبق اعلام x.ai، این سیستم بر پایه همان مدل بنیادی (Foundation Model) — یعنی زیرساخت کلی که مثل یک مغز خام برای یادگیری مفاهیم اولیه است — ساخته شده که در خودروهای Tesla و سامانههای پشتیبانی مشتری به کار میرود.
همانطور که در تحلیلهای قبلی ما دربارهی اکوسیستم x.ai اشاره کردیم، استراتژی این شرکت همواره بر پایه دادههای واقعی و زنده است. این رویکرد در کنار بهبودهای اخیر در قدرت استدلال مدل Grok 4.6، نشاندهنده تلاش x.ai برای تسلط بر بازارهای سازمانی است. بر اساس گزارش x.ai، این مدل در حال حاضر رتبه اول دقت را در میان ۳۲ مدل استریمینگ در جدول Artificial Analysis دارد. ارزیابیهای داخلی شرکت پیشرفتهای چشمگیری را در چهار حوزه نشان میدهد:
- تلفنی: برتری مطلق در تحلیل تماسهای پشتیبانی مشتری.
- چندزبانه: کاهش نرخ خطای کلمه (Word Error Rate) برای دستورات کوتاه از ۲۰.۶٪ به ۶.۸٪.
- شناسهها: دقت بالاتر در تشخیص کدهای حساب و آدرسهای ایمیل.
- گفتگوها: دقت بیشتر در تعاملات مستقیم با دستیار Grok.
از نظر فنی، این مدل قابلیت تفکیک گوینده (Speaker Diarization) را بدون هزینه اضافی ارائه میدهد و میتواند تا ۸ کانال صوتی را بهطور همزمان پردازش کند. همچنین ویژگی «سوگیری اصطلاحات کلیدی» به کاربران اجازه میدهد ۱۰۰ عبارت تخصصی را به هر درخواست اضافه کنند تا مدل در تشخیص کلمات فنی دچار خطا نشود. این دقت بالا در پردازش، پاسخی به چالشهای پیشین است؛ چرا که برخی کاربران پیشتر از نقصهای فنی در مدل Grok Lite و تولید متون نامفهوم گلایه کرده بودند.
پلتفرم Atlassian Loom پیش از این از این فناوری برای تبدیل تمام ویدیوهای خود به متن استفاده کرده است. این ادغام مسیرهای جدیدی را باز میکند؛ مثلاً میتوانید متن یک ویدیو را مستقیماً به محیط Cursor بفرستید تا کدها بر اساس برنامه ضبطشده بهطور خودکار بهروز شوند.
برای کسبوکارها، این تغییر ثابت میکند که مرز بعدی هوش مصنوعی صوتی، نه لزوماً کیفیت بالاتر، بلکه مدیریت صداهای «سختتر» است. با حل مشکل نویز و لهجه، x.ai گردشکارهای «صوت به کد» را برای مقیاس سازمانی عملی کرد.
قیمتگذاری این نسخه با نسخه ۱.۰ یکسان است: تبدیل دستهای (Batch) هر ساعت ۰.۱۰ دلار و استریمینگ ۰.۲۰ دلار. توجه داشته باشید که نسخه ۱.۰ در هفتههای آینده بازنشسته خواهد شد.
گام بعدی شما
- اگر از Loom استفاده میکنید، قابلیتهای جدید تبدیل متن را برای اتوماسیون تسکها تست کنید.
- در صورت استفاده از API، اصطلاحات تخصصی حوزه کاری خود را در بخش Key Term Biasing تعریف کنید.
- برای کاهش هزینهها، پردازشهای غیرضروری را از حالت استریمینگ به Batch منتقل کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو