پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل نرخ خطای تبدیل گفتار به متن را به ۲.۶٪ رساند

·۶ شهریور ۱۴۰۵۴ دقیقه مطالعه۶ بازدید
ربات هوشمند Gemini 3.5 در حال تبدیل گفتار به متن با دقت بالا
ربات هوشمند Gemini 3.5 در حال تبدیل گفتار به متن با دقت بالا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

عبور از تبدیل تحت‌اللفظی به تبدیل «قصد-محور»؛ مدل اکنون به‌طور خودکار اصلاحات گوینده و کلمات زائد را حذف می‌کند و نرخ خطای ۲.۶ درصدی را ثبت کرده است.

اگر امروز برای تبدیل جلسات کاری به متن هزینه می‌کنید، احتمالاً با حذف دستی «اممم»ها و «آآآ»ها ساعت‌ها وقت تلف می‌کنید. گوگل با معرفی مدل جدیدش، این فرآیند را از یک کپی‌برداری ساده به یک بازنویسی هوشمند تبدیل کرد.

در ۲۷ اوت ۲۰۲۶، گوگل از Gemini 3.5 Transcribe پرده‌برداری کرد؛ مدلی که هدفش تبدیل مستقیم صداهای محیطی و نویزی به متنی صیقل‌خورده و قالب‌بندی‌شده است. نرخ خطای کلمه (WER) ۲.۶ درصدی برای حالت‌های غیر استریم، یک کف جدید از دقت را برای قابلیت‌های تبدیل گفتار به متن گوگل تعریف می‌کند.

Text "Gemini 3.5 Transcribe" next to the Gemini spark, all on a blue background

این به‌روزرسانی در حالی رخ می‌دهد که رابط‌های صوتی از دستورات ساده به سمت گفتگوهای طبیعی و سیال حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی ادغام هوش مصنوعی در اکوسیستم گوگل از طریق Gemini Notebook اشاره کردیم، این مدل در واقع «گوش‌های» حیاتی لازم برای عملکرد عامل‌های هوشمند در دنیای واقعی است تا بتوانند به درستی عمل کنند.

تصور کنید در یک جلسه هستید و هوش مصنوعی فقط کلمات را نمی‌نویسد، بلکه می‌فهمد چه زمانی گوینده حرفش را در لحظه اصلاح می‌کند. این یعنی گذار از تبدیل تحت‌اللفظی به تولید متنی که بر اساس «قصد کاربر» و آگاهی از هدف گفتگو است.

زمینه و استقرار

مدل Gemini 3.5 Transcribe برای مدیریت پیچیدگی‌های صوتی دنیای واقعی طراحی شده است؛ مواردی که اغلب مدل‌های متداول را به اشتباه می‌اندازند، مانند نویزهای پس‌زمینه شدید و اصطلاحات تخصصی پیچیده. این مدل اکنون از طریق Gemini API در Google AI Studio و پلتفرم Gemini Enterprise Agent در دسترس توسعه‌دهندگان قرار گرفته است.

برای کاربران عادی، این مدل در حال حاضر در اپلیکیشن Gemini روی macOS (به زبان انگلیسی) و از طریق ویژگی Rambler در اندروید در کشورهای و زبان‌های منتخب فعال شده است. همچنین این مدل در Google Antigravity ادغام شده است، جایی که از محتوای صفحه و تاریخچه چت استفاده می‌کند تا دقت افکار عامل‌های هوشمند و نام فایل‌ها را تضمین کند.

عملکرد فنی و APIها

به نقل از وبلاگ رسمی گوگل، این مدل از دو مسیر متمایز برای پاسخ به نیازهای متفاوت توسعه‌دهندگان ارائه می‌شود:

  • Live API (gemini-3.5-transcribe-live): این مسیر استریم دوطرفه با تأخیر زیر یک ثانیه را فراهم می‌کند که برای اپلیکیشن‌های تعاملی و لحظه‌ای ایده‌آل است.
  • Interactions API (gemini-3.5-transcribe): این مسیر برای مدیریت فایل‌های ضبط‌شده، جلسات و لاگ تماس‌ها طراحی شده است. این API قابلیت تشخیص گوینده (Speaker Attribution) را برای حداکثر ۳ نفر فراهم می‌کند (تشخیص بیش از ۳ گوینده در حال حاضر در حالت آزمایشی است) و برچسب‌های زمانی در سطح کلمه ارائه می‌دهد.

Graph of streaming speech recognition accuracy

Graph of streaming speech recognition accuracy

بر اساس داده‌های Artificial Analysis، این مدل به میانگین نرخ خطای کلمه (Word Error Rate یا WER) — که معیاری برای سنجش تعداد غلط‌های املایی در تبدیل صوت به متن است — ۴.۰٪ برای حالت استریم و ۲.۶٪ برای حالت غیر استریم رسیده است. در مقایسه با مدل قبلی یعنی Chirp 3، زمان رسیدن به متن نهایی ۷۰٪ بهبود یافته است.

در محک FLEURS، این مدل عملکرد چندزبانه دقیقی را در زبان‌ها و مناطق برتر نشان داد. این مدل در حالت استریم به WER ۵.۵۰٪ و در حالت غیر استریم به WER ۵.۰۴٪ رسیده است که پیشرفتی چشمگیر نسبت به مدل Chirp 3 محسوب می‌شود.

ویژگی‌های هوشمند و ادغام

این مدل فراتر از تبدیل ساده صدا به حرف عمل می‌کند و از «تبدیل هوشمند» برای حذف ناهماهنگی‌ها و قالب‌بندی خودکار متن استفاده می‌کند. این قابلیت‌ها به طور خاص روی حذف کلمات زائد و مدیریت اصطلاحات تخصصی تمرکز دارند تا خروجی نهایی کاملاً حرفه‌ای باشد. قابلیت‌های کلیدی عبارتند از:

  • پاک‌سازی ناهماهنگی‌ها: مدیریت بی‌نقص اصلاحات لحظه‌ای (مثلاً «سه شنبه می‌بینمت—نه، چهارشنبه») و حذف کلمات پرکننده مانند «اممم» و «آآآ».
  • دقت در موجودیت‌ها: ثبت دقیق داده‌های الفبایی-عددی، از جمله شناسه‌های سفارش و کدهای پستی، حتی در محیط‌های پر از نویز.
  • واژگان سفارشی: سازگاری با اصطلاحات تخصصی و املای خاصی که توسط کاربر ارائه می‌شود.
  • پوشش جهانی: تشخیص و تبدیل خودکار بیش از ۸۵ زبان، با توانایی مدیریت لهجه‌های متنوع و گویش‌های منطقه‌ای.
  • فراخوانی تابع (Function Calling): مدل می‌تواند وظایف پیچیده مانند تحلیل فایل یا تولید تصویر را به سایر مدل‌های Gemini واگذار کند. این قابلیت در حال حاضر در اپلیکیشن Gemini برای macOS در دسترس است.

vivo testimonial

IntelliTek testimonial

Lingopal testimonial

گوگل این فناوری را سریعاً در تمامی سطوح محصولات خود پیاده کرد. در اندروید، ویژگی جدید Rambler در Gboard از این مدل استفاده می‌کند تا افکار صوتی را به متن قالب‌بندی‌شده تبدیل کند. کاربران همچنین می‌توانند از صدای خود برای اصلاح غلط‌های املایی یا تغییر سبک نوشتاری استفاده کنند.

در اپلیکیشن Gemini برای macOS، این مدل دستورات صوتی را با محتوای صفحه ترکیب می‌کند تا فایل‌های محلی را خلاصه کرده یا متن‌ها را در اپلیکیشن‌های مختلف بازطراحی کند. در Google AI Studio، توسعه‌دهندگان می‌توانند از حالت Build mode برای Vibe Coding (کدنویسی سریع بر اساس دستورات صوتی در لحظه) استفاده کنند.

Stream testimonial

Agora testimonial

توسعه‌دهندگان در حال حاضر این ابزار را از طریق پلتفرم‌هایی مانند LangChain، Vercel، LiveKit، Agora، Fishjam، Pipecat و Vision Agents ادغام می‌کنند. این پلتفرم‌ها زیرساخت استریم رسانه‌ای در لحظه را مدیریت می‌کنند تا توسعه‌دهندگان بتوانند بر تجربه کاربری تمرکز کنند.

پذیرندگان اولیه شامل شرکت‌های vivo، Intellitek Health و Lingopal، تأخیر کم و پشتیبانی گسترده از بیش از ۸۵ زبان را به عنوان مزایای اصلی این مدل ذکر کرده‌اند.

برای کاربر عادی، این به معنای ناپدید شدن اصطکاک دیکته است. ما به سمتی می‌رویم که صدا به اندازه کیبورد ابزاری دقیق برای ویرایش اسناد باشد و بتواند لهجه‌های منطقه‌ای و اصطلاحات تخصصی صنعتی را بدون نیاز به اصلاح دستی مداوم مدیریت کند.

این تحول بیشترین سود را برای کاربران سازمانی دارد، به‌ویژه کسانی که حجم بالای لاگ تماس‌ها یا زیرنویس‌های لحظه‌ای را مدیریت می‌کنند. با کاهش مرحله «پاک‌سازی» متن، شرکت‌ها می‌توانند تقریباً به‌طور آنی از ضبط صدا به تحلیل‌های عملیاتی برسند.

منتظر عرضه آتی این قابلیت در Chrome باشید که به کاربران اجازه می‌دهد در هر فیلد وب، از قابلیت talk-to-type استفاده کنند. این امر دیکته کردن پاسخ‌ها، پیش‌نویس پست‌ها یا ارسال دستورات به Gemini در کروم را بسیار طبیعی‌تر و ساده‌تر می‌کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مدل gemini-3.5-transcribe-live را برای کاهش تأخیر در اپلیکیشن‌های صوتی تست کنید.
  • در اپلیکیشن Gemini روی macOS، قابلیت تبدیل صوت با توجه به محتوای صفحه را برای خلاصه کردن اسناد امتحان کنید.
  • برای مدیریت جلسات، از قابلیت تشخیص گوینده در Interactions API استفاده کنید تا نیاز به برچسب‌گذاری دستی حذف شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار داده‌های Artificial Analysis، استانداردهای بازشناسی گفتار را جابه‌جا می‌کند. کاهش ۷۰ درصدی تأخیر، امکان تعاملات صوتی در لحظه را برای سازمان‌ها فراهم می‌کند.

تأثیر برای ایران

دسترسی به Gemini API برای توسعه‌دهندگان ایرانی همچنان نیازمند ابزارهای تغییر IP است، اما کاهش تأخیر در مدل‌های استریم، فرصت ساخت دستیارهای صوتی سریع‌تر را برای استارتاپ‌های داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز گوگل بر کاهش WER به ۲.۶٪ نشان می‌دهد که رقابت از «فهم کلی» به «دقت جراحی» منتقل شده است. حذف خودکار کلمات زائد (Disfluency Cleanup) یعنی مدل دیگر فقط یک شنونده نیست، بلکه یک ویراستار است که قصد کاربر را می‌فهمد. این یعنی مدل‌های صوتی در حال تبدیل شدن به لایه‌ای از پیش‌پردازش برای عامل‌های هوشمند هستند تا ورودی‌های انسانی را قبل از پردازش، پالایش کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.