پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Gemini 3.8 Flash چگونه استانداردهای مدل‌سازی لهجه را جابه‌جا کرد؟

·۱ مهر ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
مدل‌های گفتاری جمینی ۳.۸ گوگل در API و AI Studio عرضه شد
مدل‌های گفتاری جمینی ۳.۸ گوگل در API و AI Studio عرضه شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مدل‌های تفکیک‌شده Flash و Flash-Lite برای مدیریت توازن بین کیفیت هنری و هزینه استنتاج، در کنار دستیابی به رتبه اول بنچمارک Hume AI.

۳۰ ثانیه؛ این تمام چیزی است که فناوری جدید گوگل برای بازسازی کامل و سازگار یک پروفایل صوتی نیاز دارد. در ۲۳ سپتامبر ۲۰۲۶، گوگل مدل‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را از طریق Google AI Studio و Gemini API در دسترس قرار داد.

این به‌روزرسانی در حالی رخ می‌دهد که گوگل تلاش می‌کند تعاملات هوش مصنوعی را از حالت رباتیک خارج کرده و انسانی‌تر کند. همان‌طور که در تحلیل قبلی ما درباره‌ی شخصی‌سازی فیدهای هوش مصنوعی اشاره کردیم، تمرکز اکنون از «آنچه مدل می‌داند» به «چگونه مدل صدا می‌زند» تغییر کرده است. برای یک صاحب کسب‌وکار، این یعنی فاصله بین یک صدای مصنوعی و یک گوینده حرفه‌ای عملاً در حال بسته شدن است.

پیشینه و جایگاه مدل‌ها

این خبر توسط لایلاند رچیس (مدیر محصول گروه) و آلن کوئن (مدیر علوم پژوهشی) به نمایندگی از تیم صوتی Gemini منتشر شد. این مدل‌ها در ادامه زنجیره‌ای از ابزارهای صوتی پیشین عرضه شده‌اند که شامل 3.5 Live Translate، 3.5 Transcribe و مدل‌های Gemini 3.8 Live و 3.8 Live Extended Thinking می‌شود. این پیشرفت‌ها در واقع تکامل یافته‌ی مدل‌های صوتی Gemini 3.8 هستند که پیش‌تر کیفیت گفتار را به امتیاز ۸۲.۶ رسانده بودند و استانداردهای جدیدی را در صنعت تعریف کردند.

به نقل از تیم صوتی Gemini، این دو مدل اهداف تجاری متفاوتی را دنبال می‌کنند:

  • Gemini 3.8 Flash TTS: این مدل برای کارگردانی خلاقانه عمیق، طراحی شخصیت در بازی‌های ویدئویی، تولید کتاب‌های صوتی غوطه‌ورکننده و پادکست‌های پیشرفته طراحی شده است.
  • Gemini 3.8 Flash-Lite TTS: این نسخه برای وظایفی با حجم بالا و بهینه از نظر هزینه بهینه‌سازی شده است؛ مواردی مانند دوبله، عامل‌های صوتی (Voice Agents) و تولید انبوه محتوای صوتی که نیاز به کنترل دقیق روی لحن، ضرب‌آهنگ و ظرافت‌های بیانی دارند.

هر دو مدل بر پایه Gemini 3 Pro ساخته شده‌اند. این سیستم‌ها ورودی‌های متنی تا ۸ هزار توکن — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — را می‌پذیرند و خروجی‌های صوتی تا ۶۴ هزار توکن تولید می‌کنند.

طراحی و شبیه‌سازی صدا

کاربران اکنون می‌توانند با استفاده از مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که می‌داند چطور از یک مشاور باتجربه بهترین جواب را بگیرد — صداهای سفارشی را از صفر بسازند تا نقش‌ها، لهجه‌ها و ویژگی‌های خاص صوتی را تعریف کنند. گوگل کتابخانه صوتی خود را از ۳۰ صدا به بیش از ۲ هزار گزینه آماده تولید گسترش داد. این پوشش گسترده شامل لهجه‌های منطقه‌ای مانند فرانسوی کبک، اسپانیایی مکزیکی و انگلیسی اسکاتلندی در بیش از ۱۰۰ زبان مختلف است.

برای کسانی که به شبیه‌سازی دقیق نیاز دارند، سیستم اجازه کلون کردن صدا را می‌دهد، به شرطی که کاربر حقوق قانونی آن صدا را در اختیار داشته باشد. طبق اعلام گوگل، برای جلوگیری از سوءاستفاده، یک سامانه تأیید رضایت پیاده شده است که در آن مالک صدا باید یک ضبط صوتی شفاهی ارائه دهد که با صدای مرجع مطابقت داشته باشد تا اجازه ایجاد صدای شبیه‌سازی شده صادر شود. هر کلیپ با واترمارک SynthID — که نامرئی است و مستقیماً در لایه‌های صوتی قرار می‌گیرد — و گواهینامه‌های C2PA علامت‌گذاری می‌شود تا تشخیص محتوای تولیدشده توسط هوش مصنوعی ممکن باشد و اصالت آن قابل ردیابی باشد.

عملکرد و محک‌های ارزیابی

گوگل گزارش داد که Gemini 3.8 Flash TTS با امتیاز ۷۱.۴، جایگاه نخست بنچمارک طراحی صدای Hume AI را به دست آورد. این مدل در مدل‌سازی لهجه نیز با امتیاز ۶۰.۸ پیشتاز بود. همچنین، هر دو مدل Flash و Flash-Lite رتبه‌های اول و دوم شاخص کیفیت کلی (Overall Quality Index) در Hume AI را در اختیار دارند.

در تست‌های ترجیحی انسانی در Voice Arena، این مدل‌ها در برابر رقبای خود در چندین زبان رتبه اول را کسب کردند، از جمله:

  • ژاپنی
  • پرتغالی برزیلی
  • ویتنامی
  • عربی استاندارد مدرن
  • اسپانیایی مکزیکی
  • هندی

گوگل تأکید کرد که این مدل‌ها نسبت به نسخه 3.1 Flash، به‌ویژه در کنترل فیلم‌نامه‌های دو-نفره و تولید محتواهای طولانی، پیشرفت چشمگیری داشته‌اند.

جزئیات فنی و سازوکارها

کنترل فنی اکنون دقیق‌تر شده است. کاربران می‌توانند دستورات صحنه را خط‌به‌خط ارائه دهند یا از نشانه‌های متنی (Script Cues) برای هدایت نحوه اجرا استفاده کنند. این مدل‌ها از صحنه‌پردازی بومی برای دو گوینده پشتیبانی می‌کنند تا گفتگوهای چند-مرحله‌ای با نوبت‌گیری طبیعی پیش برود و دو صدای مختلف به طور مجزا حفظ شوند.

برای افزایش واقع‌گرایی، قابلیت‌های زیر اضافه شده است:

  • انفجارهای صوتی برنامه‌ریزی‌شده: نشانه‌های غیرکلامی که در متن گنجانده می‌شوند، مثل <خنده>، <آه> و <نفس‌نفس زدن>.
  • پاسخ‌های کوتاه تأییدی (Backchanneling): تکیه‌کلام‌های طبیعی در حین صحبت طرف مقابل مانند «اوهوم» و «بله».
  • پایداری: حفظ کیفیت صدا، ضرب‌آهنگ و طنین شخصیت در تولیدات چندساعته با کمترین میزان انحراف صوتی (Speaker Drift).

ایمنی و محدودیت‌ها

در مورد ایمنی پیشرو، Google DeepMind اعلام کرد که ارزیابی‌ها هیچ قابلیت خطرناک جدید یا افزایش عملکرد مادی در مدل‌های صوتی 3.8 نسبت به نسخه 3.7 نشان نداده‌اند. بررسی‌های آن‌ها نشان داد که این مدل‌ها به هیچ‌یک از سطوح «ردیابی شده» یا «بحرانی» در چارچوب ایمنی پیشرو (Frontier Safety Framework) نرسیده‌اند.

با این حال، کارت مدل به برخی محدودیت‌های شناخته شده اشاره کرده است، از جمله کندی گاه‌به‌گاه در پاسخ‌دهی، خطاهای زمان‌بندی (Timeout) و توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد، مثل دوستی که خاطره‌ای را اشتباه تعریف می‌کند. تاریخ قطع دانش این مدل‌ها ژانویه ۲۰۲۵ است.

یکپارچه‌سازی و دسترسی

علاوه بر API، مدل Flash TTS در Gemini Notebook و مدل Flash-Lite در Google Vids در دسترس است. دسترسی سازمانی از طریق Gemini Enterprise به‌زودی فعال می‌شود.

گوگل AI Studio اکنون یک «زمین بازی صوتی» (Audio Playground) دارد که به عنوان یک فضای کاری برای طراحی صدا طراحی شده است. در اینجا، توسعه‌دهندگان می‌توانند هویت‌های صوتی جدید را با پرامپت بسازند، صداها را شبیه‌سازی کنند و اجرا را در یک ویرایشگر فیلم‌نامه دو-نفره هدایت کنند. با این حال، گوگل اشاره کرد که شبیه‌سازی صدا در AI Studio در حال حاضر در بریتانیا، منطقه اقتصادی اروپا (EEA)، سوئیس، هند و ایالت‌های تگزاس و ایلینوی در دسترس نیست.

پلتفرم‌های توسعه‌دهنده شامل Vercel، LiveKit، Agora و Pipecat در حال حاضر از این مدل‌ها پشتیبانی می‌کنند. همچنین گوگل با شرکت‌هایی مثل HeyGen، Wondercraft، Figma، Linguana، 99.co و Ollang برای یکپارچه‌سازی این مدل‌ها در دوبله جهانی، بومی‌سازی رسانه‌ای و عامل‌های گفتگو همکاری کرده است.

این چرخش به سمت صدای باکیفیت و تأخیر کم نشان می‌دهد گوگل برای دنیایی آماده می‌شود که رابط اصلی با هوش مصنوعی، صداست نه متن. با تفکیک مدل‌های «خلاق» (Flash) و «بهینه» (Flash-Lite)، گوگل هم استودیوهای رسانه‌ای سطح بالا و هم مراکز تماس سازمانی در مقیاس وسیع را هدف قرار داده است.

برای کاربر نهایی، این یعنی «دره وهم» (Uncanny Valley) صداهای مصنوعی در حال پر شدن است. وقتی هوش مصنوعی بتواند فیلم‌نامه‌های دو-نفره را با نوبت‌گیری طبیعی و انفجارهای احساسی اجرا کند، هزینه تولید محتوای صوتی باکیفیت تقریباً به صفر می‌رسد.

گام بعدی شما

  • اگر تولیدکننده محتوا هستید، در Google AI Studio محیط Audio Playground را برای طراحی شخصیت‌های صوتی تست کنید.
  • برای کاهش هزینه‌های دوبله در مقیاس بالا، مدل Flash-Lite را جایگزین مدل‌های سنگین‌تر کنید.
  • بررسی کنید که آیا صدای برند شما با استانداردهای SynthID برای شناسایی محتوای AI سازگار است یا خیر.

اما قابلیت «ریمیکس صوتی» (Voice-Remixing) که به‌زودی عرضه می‌شود و اجازه می‌دهد کاربران طنین، گام (Pitch)، سرعت و لهجه صداهای کتابخانه را به صورت لحظه‌ای تغییر دهند، تحول بعدی این مسیر است — در گزارش‌های آینده به آن خواهیم پرداخت.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار تیم پژوهشی Gemini، مرز بین صدای سنتتیک و انسانی را از نظر فنی از بین می‌برد. این موضوع باعث می‌شود تولید محتوای صوتی باکیفیت از یک فرآیند گران‌قیمت به یک کالای ارزان و در دسترس تبدیل شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API گوگل، دسترسی توسعه‌دهندگان ایرانی به این مدل‌ها همچنان نیازمند ابزارهای تغییر آی‌پی است، اما امکان استفاده از این مدل‌ها در پلتفرم‌های واسط مانند Vercel مسیرهای جدیدی برای استارتاپ‌های محتوایی ایران می‌گشاید.

·نگاه ما
تحریریه دات‌هوش

تمرکز گوگل بر تفکیک مدل‌های خلاق و بهینه، نشان می‌دهد که عصر «یک مدل برای همه کارها» در حوزه صوت به پایان رسیده است. این استراتژی اجازه می‌دهد هزینه‌های استنتاج در مقیاس سازمانی به شدت کاهش یابد بدون اینکه کیفیت هنری در پروژه‌های خاص فدا شود. در واقع، گوگل در حال تبدیل کردن صدا از یک «خروجی ساده» به یک «ابزار طراحی» است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.