۳۰ ثانیه؛ این تمام چیزی است که فناوری جدید گوگل برای بازسازی کامل و سازگار یک پروفایل صوتی نیاز دارد. در ۲۳ سپتامبر ۲۰۲۶، گوگل مدلهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را از طریق Google AI Studio و Gemini API در دسترس قرار داد.
این بهروزرسانی در حالی رخ میدهد که گوگل تلاش میکند تعاملات هوش مصنوعی را از حالت رباتیک خارج کرده و انسانیتر کند. همانطور که در تحلیل قبلی ما دربارهی شخصیسازی فیدهای هوش مصنوعی اشاره کردیم، تمرکز اکنون از «آنچه مدل میداند» به «چگونه مدل صدا میزند» تغییر کرده است. برای یک صاحب کسبوکار، این یعنی فاصله بین یک صدای مصنوعی و یک گوینده حرفهای عملاً در حال بسته شدن است.
پیشینه و جایگاه مدلها
این خبر توسط لایلاند رچیس (مدیر محصول گروه) و آلن کوئن (مدیر علوم پژوهشی) به نمایندگی از تیم صوتی Gemini منتشر شد. این مدلها در ادامه زنجیرهای از ابزارهای صوتی پیشین عرضه شدهاند که شامل 3.5 Live Translate، 3.5 Transcribe و مدلهای Gemini 3.8 Live و 3.8 Live Extended Thinking میشود. این پیشرفتها در واقع تکامل یافتهی مدلهای صوتی Gemini 3.8 هستند که پیشتر کیفیت گفتار را به امتیاز ۸۲.۶ رسانده بودند و استانداردهای جدیدی را در صنعت تعریف کردند.
به نقل از تیم صوتی Gemini، این دو مدل اهداف تجاری متفاوتی را دنبال میکنند:
- Gemini 3.8 Flash TTS: این مدل برای کارگردانی خلاقانه عمیق، طراحی شخصیت در بازیهای ویدئویی، تولید کتابهای صوتی غوطهورکننده و پادکستهای پیشرفته طراحی شده است.
- Gemini 3.8 Flash-Lite TTS: این نسخه برای وظایفی با حجم بالا و بهینه از نظر هزینه بهینهسازی شده است؛ مواردی مانند دوبله، عاملهای صوتی (Voice Agents) و تولید انبوه محتوای صوتی که نیاز به کنترل دقیق روی لحن، ضربآهنگ و ظرافتهای بیانی دارند.
هر دو مدل بر پایه Gemini 3 Pro ساخته شدهاند. این سیستمها ورودیهای متنی تا ۸ هزار توکن — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — را میپذیرند و خروجیهای صوتی تا ۶۴ هزار توکن تولید میکنند.
طراحی و شبیهسازی صدا
کاربران اکنون میتوانند با استفاده از مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که میداند چطور از یک مشاور باتجربه بهترین جواب را بگیرد — صداهای سفارشی را از صفر بسازند تا نقشها، لهجهها و ویژگیهای خاص صوتی را تعریف کنند. گوگل کتابخانه صوتی خود را از ۳۰ صدا به بیش از ۲ هزار گزینه آماده تولید گسترش داد. این پوشش گسترده شامل لهجههای منطقهای مانند فرانسوی کبک، اسپانیایی مکزیکی و انگلیسی اسکاتلندی در بیش از ۱۰۰ زبان مختلف است.
برای کسانی که به شبیهسازی دقیق نیاز دارند، سیستم اجازه کلون کردن صدا را میدهد، به شرطی که کاربر حقوق قانونی آن صدا را در اختیار داشته باشد. طبق اعلام گوگل، برای جلوگیری از سوءاستفاده، یک سامانه تأیید رضایت پیاده شده است که در آن مالک صدا باید یک ضبط صوتی شفاهی ارائه دهد که با صدای مرجع مطابقت داشته باشد تا اجازه ایجاد صدای شبیهسازی شده صادر شود. هر کلیپ با واترمارک SynthID — که نامرئی است و مستقیماً در لایههای صوتی قرار میگیرد — و گواهینامههای C2PA علامتگذاری میشود تا تشخیص محتوای تولیدشده توسط هوش مصنوعی ممکن باشد و اصالت آن قابل ردیابی باشد.
عملکرد و محکهای ارزیابی
گوگل گزارش داد که Gemini 3.8 Flash TTS با امتیاز ۷۱.۴، جایگاه نخست بنچمارک طراحی صدای Hume AI را به دست آورد. این مدل در مدلسازی لهجه نیز با امتیاز ۶۰.۸ پیشتاز بود. همچنین، هر دو مدل Flash و Flash-Lite رتبههای اول و دوم شاخص کیفیت کلی (Overall Quality Index) در Hume AI را در اختیار دارند.
در تستهای ترجیحی انسانی در Voice Arena، این مدلها در برابر رقبای خود در چندین زبان رتبه اول را کسب کردند، از جمله:
- ژاپنی
- پرتغالی برزیلی
- ویتنامی
- عربی استاندارد مدرن
- اسپانیایی مکزیکی
- هندی
گوگل تأکید کرد که این مدلها نسبت به نسخه 3.1 Flash، بهویژه در کنترل فیلمنامههای دو-نفره و تولید محتواهای طولانی، پیشرفت چشمگیری داشتهاند.
جزئیات فنی و سازوکارها
کنترل فنی اکنون دقیقتر شده است. کاربران میتوانند دستورات صحنه را خطبهخط ارائه دهند یا از نشانههای متنی (Script Cues) برای هدایت نحوه اجرا استفاده کنند. این مدلها از صحنهپردازی بومی برای دو گوینده پشتیبانی میکنند تا گفتگوهای چند-مرحلهای با نوبتگیری طبیعی پیش برود و دو صدای مختلف به طور مجزا حفظ شوند.
برای افزایش واقعگرایی، قابلیتهای زیر اضافه شده است:
- انفجارهای صوتی برنامهریزیشده: نشانههای غیرکلامی که در متن گنجانده میشوند، مثل <خنده>، <آه> و <نفسنفس زدن>.
- پاسخهای کوتاه تأییدی (Backchanneling): تکیهکلامهای طبیعی در حین صحبت طرف مقابل مانند «اوهوم» و «بله».
- پایداری: حفظ کیفیت صدا، ضربآهنگ و طنین شخصیت در تولیدات چندساعته با کمترین میزان انحراف صوتی (Speaker Drift).
ایمنی و محدودیتها
در مورد ایمنی پیشرو، Google DeepMind اعلام کرد که ارزیابیها هیچ قابلیت خطرناک جدید یا افزایش عملکرد مادی در مدلهای صوتی 3.8 نسبت به نسخه 3.7 نشان ندادهاند. بررسیهای آنها نشان داد که این مدلها به هیچیک از سطوح «ردیابی شده» یا «بحرانی» در چارچوب ایمنی پیشرو (Frontier Safety Framework) نرسیدهاند.
با این حال، کارت مدل به برخی محدودیتهای شناخته شده اشاره کرده است، از جمله کندی گاهبهگاه در پاسخدهی، خطاهای زمانبندی (Timeout) و توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که وجود ندارد، مثل دوستی که خاطرهای را اشتباه تعریف میکند. تاریخ قطع دانش این مدلها ژانویه ۲۰۲۵ است.
یکپارچهسازی و دسترسی
علاوه بر API، مدل Flash TTS در Gemini Notebook و مدل Flash-Lite در Google Vids در دسترس است. دسترسی سازمانی از طریق Gemini Enterprise بهزودی فعال میشود.
گوگل AI Studio اکنون یک «زمین بازی صوتی» (Audio Playground) دارد که به عنوان یک فضای کاری برای طراحی صدا طراحی شده است. در اینجا، توسعهدهندگان میتوانند هویتهای صوتی جدید را با پرامپت بسازند، صداها را شبیهسازی کنند و اجرا را در یک ویرایشگر فیلمنامه دو-نفره هدایت کنند. با این حال، گوگل اشاره کرد که شبیهسازی صدا در AI Studio در حال حاضر در بریتانیا، منطقه اقتصادی اروپا (EEA)، سوئیس، هند و ایالتهای تگزاس و ایلینوی در دسترس نیست.
پلتفرمهای توسعهدهنده شامل Vercel، LiveKit، Agora و Pipecat در حال حاضر از این مدلها پشتیبانی میکنند. همچنین گوگل با شرکتهایی مثل HeyGen، Wondercraft، Figma، Linguana، 99.co و Ollang برای یکپارچهسازی این مدلها در دوبله جهانی، بومیسازی رسانهای و عاملهای گفتگو همکاری کرده است.
این چرخش به سمت صدای باکیفیت و تأخیر کم نشان میدهد گوگل برای دنیایی آماده میشود که رابط اصلی با هوش مصنوعی، صداست نه متن. با تفکیک مدلهای «خلاق» (Flash) و «بهینه» (Flash-Lite)، گوگل هم استودیوهای رسانهای سطح بالا و هم مراکز تماس سازمانی در مقیاس وسیع را هدف قرار داده است.
برای کاربر نهایی، این یعنی «دره وهم» (Uncanny Valley) صداهای مصنوعی در حال پر شدن است. وقتی هوش مصنوعی بتواند فیلمنامههای دو-نفره را با نوبتگیری طبیعی و انفجارهای احساسی اجرا کند، هزینه تولید محتوای صوتی باکیفیت تقریباً به صفر میرسد.
گام بعدی شما
- اگر تولیدکننده محتوا هستید، در Google AI Studio محیط Audio Playground را برای طراحی شخصیتهای صوتی تست کنید.
- برای کاهش هزینههای دوبله در مقیاس بالا، مدل Flash-Lite را جایگزین مدلهای سنگینتر کنید.
- بررسی کنید که آیا صدای برند شما با استانداردهای SynthID برای شناسایی محتوای AI سازگار است یا خیر.
اما قابلیت «ریمیکس صوتی» (Voice-Remixing) که بهزودی عرضه میشود و اجازه میدهد کاربران طنین، گام (Pitch)، سرعت و لهجه صداهای کتابخانه را به صورت لحظهای تغییر دهند، تحول بعدی این مسیر است — در گزارشهای آینده به آن خواهیم پرداخت.




گفتگو