اگر امروز برای تبدیل جلسات کاری به متن هزینه میکنید، احتمالاً با حذف دستی «اممم»ها و «آآآ»ها ساعتها وقت تلف میکنید. گوگل با معرفی مدل جدیدش، این فرآیند را از یک کپیبرداری ساده به یک بازنویسی هوشمند تبدیل کرد.
در ۲۷ اوت ۲۰۲۶، گوگل از Gemini 3.5 Transcribe پردهبرداری کرد؛ مدلی که هدفش تبدیل مستقیم صداهای محیطی و نویزی به متنی صیقلخورده و قالببندیشده است. نرخ خطای کلمه (WER) ۲.۶ درصدی برای حالتهای غیر استریم، یک کف جدید از دقت را برای قابلیتهای تبدیل گفتار به متن گوگل تعریف میکند.

این بهروزرسانی در حالی رخ میدهد که رابطهای صوتی از دستورات ساده به سمت گفتگوهای طبیعی و سیال حرکت میکنند. همانطور که در تحلیل قبلی ما دربارهی ادغام هوش مصنوعی در اکوسیستم گوگل از طریق Gemini Notebook اشاره کردیم، این مدل در واقع «گوشهای» حیاتی لازم برای عملکرد عاملهای هوشمند در دنیای واقعی است تا بتوانند به درستی عمل کنند.
تصور کنید در یک جلسه هستید و هوش مصنوعی فقط کلمات را نمینویسد، بلکه میفهمد چه زمانی گوینده حرفش را در لحظه اصلاح میکند. این یعنی گذار از تبدیل تحتاللفظی به تولید متنی که بر اساس «قصد کاربر» و آگاهی از هدف گفتگو است.
زمینه و استقرار
مدل Gemini 3.5 Transcribe برای مدیریت پیچیدگیهای صوتی دنیای واقعی طراحی شده است؛ مواردی که اغلب مدلهای متداول را به اشتباه میاندازند، مانند نویزهای پسزمینه شدید و اصطلاحات تخصصی پیچیده. این مدل اکنون از طریق Gemini API در Google AI Studio و پلتفرم Gemini Enterprise Agent در دسترس توسعهدهندگان قرار گرفته است.
برای کاربران عادی، این مدل در حال حاضر در اپلیکیشن Gemini روی macOS (به زبان انگلیسی) و از طریق ویژگی Rambler در اندروید در کشورهای و زبانهای منتخب فعال شده است. همچنین این مدل در Google Antigravity ادغام شده است، جایی که از محتوای صفحه و تاریخچه چت استفاده میکند تا دقت افکار عاملهای هوشمند و نام فایلها را تضمین کند.
عملکرد فنی و APIها
به نقل از وبلاگ رسمی گوگل، این مدل از دو مسیر متمایز برای پاسخ به نیازهای متفاوت توسعهدهندگان ارائه میشود:
- Live API (gemini-3.5-transcribe-live): این مسیر استریم دوطرفه با تأخیر زیر یک ثانیه را فراهم میکند که برای اپلیکیشنهای تعاملی و لحظهای ایدهآل است.
- Interactions API (gemini-3.5-transcribe): این مسیر برای مدیریت فایلهای ضبطشده، جلسات و لاگ تماسها طراحی شده است. این API قابلیت تشخیص گوینده (Speaker Attribution) را برای حداکثر ۳ نفر فراهم میکند (تشخیص بیش از ۳ گوینده در حال حاضر در حالت آزمایشی است) و برچسبهای زمانی در سطح کلمه ارائه میدهد.


بر اساس دادههای Artificial Analysis، این مدل به میانگین نرخ خطای کلمه (Word Error Rate یا WER) — که معیاری برای سنجش تعداد غلطهای املایی در تبدیل صوت به متن است — ۴.۰٪ برای حالت استریم و ۲.۶٪ برای حالت غیر استریم رسیده است. در مقایسه با مدل قبلی یعنی Chirp 3، زمان رسیدن به متن نهایی ۷۰٪ بهبود یافته است.
در محک FLEURS، این مدل عملکرد چندزبانه دقیقی را در زبانها و مناطق برتر نشان داد. این مدل در حالت استریم به WER ۵.۵۰٪ و در حالت غیر استریم به WER ۵.۰۴٪ رسیده است که پیشرفتی چشمگیر نسبت به مدل Chirp 3 محسوب میشود.
ویژگیهای هوشمند و ادغام
این مدل فراتر از تبدیل ساده صدا به حرف عمل میکند و از «تبدیل هوشمند» برای حذف ناهماهنگیها و قالببندی خودکار متن استفاده میکند. این قابلیتها به طور خاص روی حذف کلمات زائد و مدیریت اصطلاحات تخصصی تمرکز دارند تا خروجی نهایی کاملاً حرفهای باشد. قابلیتهای کلیدی عبارتند از:
- پاکسازی ناهماهنگیها: مدیریت بینقص اصلاحات لحظهای (مثلاً «سه شنبه میبینمت—نه، چهارشنبه») و حذف کلمات پرکننده مانند «اممم» و «آآآ».
- دقت در موجودیتها: ثبت دقیق دادههای الفبایی-عددی، از جمله شناسههای سفارش و کدهای پستی، حتی در محیطهای پر از نویز.
- واژگان سفارشی: سازگاری با اصطلاحات تخصصی و املای خاصی که توسط کاربر ارائه میشود.
- پوشش جهانی: تشخیص و تبدیل خودکار بیش از ۸۵ زبان، با توانایی مدیریت لهجههای متنوع و گویشهای منطقهای.
- فراخوانی تابع (Function Calling): مدل میتواند وظایف پیچیده مانند تحلیل فایل یا تولید تصویر را به سایر مدلهای Gemini واگذار کند. این قابلیت در حال حاضر در اپلیکیشن Gemini برای macOS در دسترس است.



گوگل این فناوری را سریعاً در تمامی سطوح محصولات خود پیاده کرد. در اندروید، ویژگی جدید Rambler در Gboard از این مدل استفاده میکند تا افکار صوتی را به متن قالببندیشده تبدیل کند. کاربران همچنین میتوانند از صدای خود برای اصلاح غلطهای املایی یا تغییر سبک نوشتاری استفاده کنند.
در اپلیکیشن Gemini برای macOS، این مدل دستورات صوتی را با محتوای صفحه ترکیب میکند تا فایلهای محلی را خلاصه کرده یا متنها را در اپلیکیشنهای مختلف بازطراحی کند. در Google AI Studio، توسعهدهندگان میتوانند از حالت Build mode برای Vibe Coding (کدنویسی سریع بر اساس دستورات صوتی در لحظه) استفاده کنند.


توسعهدهندگان در حال حاضر این ابزار را از طریق پلتفرمهایی مانند LangChain، Vercel، LiveKit، Agora، Fishjam، Pipecat و Vision Agents ادغام میکنند. این پلتفرمها زیرساخت استریم رسانهای در لحظه را مدیریت میکنند تا توسعهدهندگان بتوانند بر تجربه کاربری تمرکز کنند.
پذیرندگان اولیه شامل شرکتهای vivo، Intellitek Health و Lingopal، تأخیر کم و پشتیبانی گسترده از بیش از ۸۵ زبان را به عنوان مزایای اصلی این مدل ذکر کردهاند.
برای کاربر عادی، این به معنای ناپدید شدن اصطکاک دیکته است. ما به سمتی میرویم که صدا به اندازه کیبورد ابزاری دقیق برای ویرایش اسناد باشد و بتواند لهجههای منطقهای و اصطلاحات تخصصی صنعتی را بدون نیاز به اصلاح دستی مداوم مدیریت کند.
این تحول بیشترین سود را برای کاربران سازمانی دارد، بهویژه کسانی که حجم بالای لاگ تماسها یا زیرنویسهای لحظهای را مدیریت میکنند. با کاهش مرحله «پاکسازی» متن، شرکتها میتوانند تقریباً بهطور آنی از ضبط صدا به تحلیلهای عملیاتی برسند.
منتظر عرضه آتی این قابلیت در Chrome باشید که به کاربران اجازه میدهد در هر فیلد وب، از قابلیت talk-to-type استفاده کنند. این امر دیکته کردن پاسخها، پیشنویس پستها یا ارسال دستورات به Gemini در کروم را بسیار طبیعیتر و سادهتر میکند.
گام بعدی شما
- اگر توسعهدهنده هستید، مدل
gemini-3.5-transcribe-liveرا برای کاهش تأخیر در اپلیکیشنهای صوتی تست کنید. - در اپلیکیشن Gemini روی macOS، قابلیت تبدیل صوت با توجه به محتوای صفحه را برای خلاصه کردن اسناد امتحان کنید.
- برای مدیریت جلسات، از قابلیت تشخیص گوینده در Interactions API استفاده کنید تا نیاز به برچسبگذاری دستی حذف شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو