پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های صوتی Gemini 3.8 کیفیت گفتار را به امتیاز ۸۲.۶ رساندند

·۲۴ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
گوگل مدل‌های صوتی Gemini 3.8 Live و Extended Thinking را راه‌اندازی کرد.
گوگل مدل‌های صوتی Gemini 3.8 Live و Extended Thinking را راه‌اندازی کرد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

قابلیت استدلال و صحبت هم‌زمان در مدل Extended Thinking؛ برخلاف مدل‌های قبلی که ابتدا فکر می‌کردند و سپس پاسخ را تولید می‌کردند، این مدل می‌تواند در حین صحبت کردن، مراحل استدلال را در پس‌زمینه پیش ببرد.

اگر امروز برای مدیریت کارهای پیچیده از چت‌باکس‌های متنی استفاده می‌کنید، باید بدانید که عصر «تایپ کردن» در حال جایگزینی با گفتگوهای بلادرنگ است. گوگل با معرفی مدل‌های جدید خود، سقف عملکرد صوتی را در شاخص کیفیت گفتار به ۸۲.۶ رساند.

به نقل از تیم صوتی Gemini، مدل‌های Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking در ۱۵ سپتامبر ۲۰۲۶ منتشر شدند تا تمرکز را از پرامپت‌های متنی به دیالوگ‌های سیال منتقل کنند. این خبر توسط تام اویانگ (Tom Ouyang)، مهندس ارشد و مالینی جاگاناتان (Malini Jaganathan)، عضو کادر فنی، به نمایندگی از تیم صوتی Gemini اعلام شد.

این تحول در حالی رخ می‌دهد که بسیاری از شرکت‌ها برای تبدیل نمونه‌های اولیه به محصولات نهایی در محیط تولید با مشکل تأخیر در پاسخ‌دهی و صلب بودن رابط‌های صوتی مواجه‌اند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، گذار به رابط‌های صوتی چالش‌های جدیدی در کنترل خروجی ایجاد می‌کند. گوگل اکنون با ادغام این مدل‌ها در Gemini API، Google AI Studio، Gemini Enterprise، Search Live، Gemini Live و Google Workspace، روی این شرط‌بندی کرده است که صدا به رابط اصلی گردش‌کارهای پیچیده تجاری تبدیل شود.

جایگاه مدل‌ها در اکوسیستم

گوگل این دو مدل را پیشرفته‌ترین ابزارهای دیالوگ زنده خود تا به امروز می‌نامد. هدف، ایجاد تجربه‌ای شهودی برای همکاری در انجام وظایف پیچیده از طریق صداست که با بهبود در استدلال موازی (Parallel Reasoning) و افزایش سطح هوش محقق شده است.

مدل Gemini 3.8 Live برای مقیاس‌پذیری و بهینگی هزینه طراحی شده است. این مدل ترکیبی از هوش مکالمه‌ای، دیالوگ‌های سیال و مبنی‌سازی (Grounding) — شبیه به وقتی که یک دستیار، پاسخ‌هایش را بر اساس مدارک واقعی روی میز چک می‌کند — و تعاملات بصری است. در مقابل، مدل Gemini 3.8 Live Extended Thinking برای وظایفی با پیچیدگی بالا که به مدل استدلالی (Reasoning Model) — مثل شطرنج‌بازی که چند حرکت جلوتر را می‌بیند — و تفکر چندمرحله‌ای نیاز دارند، مهندسی شده است. این دو مدل در کنار هم، بلوک‌های سازنده برای ایجاد عامل‌های صوتی قابل‌اتکا و آماده برای محیط تولید (Production-ready) را فراهم می‌کنند.

بنچمارک‌ها و توانمندی‌های فنی

طبق گزارش unite.ai، این دو مدل اهداف متفاوتی را دنبال می‌کنند. Gemini 3.8 Live بر روی مقیاس، هزینه، سیالیت گفتگو و مبنی‌سازی بصری متمرکز است، در حالی که Extended Thinking وظایف پیچیده با استدلال چندمرحله‌ای را مدیریت می‌کند.

گوگل برای مدل Extended Thinking معیارهای عملکردی دقیقی ارائه داده است:

  • شاخص کیفیت گفتار به گفتار (Speech to Speech Quality Index): ۸۲.۶ (کسب رتبه اول کلی).
  • تکمیل وظایف عامل‌محور τ-Voice: ۶۸.۶٪.
  • محک بانکی Sierra’s τ-Voice: ۳۵.۱٪.
  • آزمون Big Bench Audio: ۹۷.۷٪.

در مورد مدل Gemini 3.8 Live، گوگل به کسب رتبه دوم در Arena عامل‌های صوتی Artificial Analysis اشاره کرد که نشان‌دهنده ترجیح بالای کاربران و مقرون‌به‌صرفه بودن است. همچنین در محک EVA-Bench متعلق به ServiceNow — که معیاری برای ارزیابی عامل‌های صوتی است — گوگل اعلام کرد که مدل‌هایش با ایجاد تعادل بین دقت و کیفیت مکالمه، مرز پارتو (Pareto Frontier) را برای گردش‌کارهای پیچیده جابه‌جا کرده‌اند. این ارزیابی خاص روی Live API در پلتفرم Gemini Enterprise Agent انجام شده است.

اجرای بلادرنگ و سازوکارهای عملیاتی

این مدل‌ها ورودی‌های بصری را تقریباً در لحظه پردازش می‌کنند و به هوش مصنوعی اجازه می‌دهند هم‌زمان ببیند و صحبت کند. سیستم به‌طور خودکار بین ۹۷ زبان پشتیبانی‌شده در میانه گفتگو جابه‌جا می‌شود. این پیشرفت در پردازش صوتی، تکامل یافتگانِ مدل‌های پیشین است که نرخ خطای تبدیل گفتار به متن را به ۲.۶٪ رسانده بودند تا دقت درک ورودی‌ها را به حداکثر برسانند.

یک سازوکار کلیدی، اجرای پس‌زمینه فراخوانی‌های API است. مدل می‌تواند درخواست کاربر را تأیید کند و در حالی که گفتگو را پیش می‌برد، وظیفه را در پس‌زمینه تکمیل کند. در مدل Extended Thinking، استدلال و صحبت به‌صورت هم‌زمان رخ می‌دهد. این مدل از نشانه‌های کلامی اولیه برای تأیید طبیعی پرامپت‌ها استفاده می‌کند و با «روایت پیشرفت زنده» (Live Progress Narration)، کاربر را در مراحل اجرای وظایف پس‌زمینه همراه می‌کند بدون آنکه جریان گفتگو قطع شود. این قابلیت در کنار توانایی حذف کلمات زائد و اصطلاحات تخصصی در مدل‌های Transcribe، باعث می‌شود تعاملات صوتی بسیار طبیعی‌تر و حرفه‌ای‌تر به نظر برسند.

نمونه‌های کاربردی نمایش‌داده‌شده شامل موارد زیر است:

  • عملیات تجاری: تدوین کامل طرح‌های کسب‌وکار و ابزارهای بازاریابی سفارشی از طریق گفتار طبیعی.
  • توسعه فنی: تبدیل طرح‌های اولیه (Sketches) و بازخوردهای صوتی بلادرنگ به کامپوننت‌های کاربردی React.
  • لجستیک: هماهنگی رزروهای چندمرحله‌ای رستوران از طریق فراخوانی‌های تابع غیرهم‌گام (Asynchronous function calls).
  • پشتیبانی: راهنمایی کارکنان جدید با استفاده از بستر بصری و ارائه عیب‌یابی گام‌به‌گام در داخل Search Live.

اکوسیستم توسعه‌دهندگان و ایمنی

گوگل برای مدیریت زیرساخت استریم رسانه‌ای بلادرنگ با پلتفرم‌هایی نظیر Vercel، LiveKit، Agora، Fishjam، Pipecat و Vision Agents همکاری می‌کند. همچنین شرکت‌هایی مانند Salesforce، Genspark و Lumeris به دلیل تأخیر پایین و قابلیت‌های فراخوانی ابزار (Tool-calling)، به این مدل‌ها علاقه‌مند شده‌اند.

رابط API زنده از اتصال WebSocket حالت‌دار (Stateful) استفاده می‌کند که جریان‌های مداوم صوت، تصویر و متن را پردازش می‌کند. مشخصات فنی عبارتند از:

  • ورودی صوتی: PCM ۱۶ بیتی خام با فرکانس ۱۶ کیلوهرتز.
  • ورودی بصری: تصاویر JPEG با نرخ حداکثر یک فریم در ثانیه.
  • خروجی صوتی: PCM ۱۶ بیتی خام با فرکانس ۲۴ کیلوهرتز.

توسعه‌دهندگان می‌توانند این سیستم را از طریق یک بک‌اند سرور-به-سرور یا اتصال مستقیم کلاینت-به-سرور WebSocket پیاده‌سازی کنند. موارد استفاده از دستیاران خرید خرده‌فروشی و همراهان سلامت گرفته تا شخصیت‌های تعاملی بازی‌ها و رباتیک یا عینک‌های هوشمند مجهز به صدا را شامل می‌شود.

برای مقابله با جعل عمیق و اطلاعات نادرست، تمام صداهای تولیدشده با SynthID نشان‌گذاری (Watermarking) می‌شوند. این واترمارک نامرئی مستقیماً در خروجی صوتی بافته می‌شود تا محتوای تولیدشده توسط هوش مصنوعی قابل شناسایی باقی بماند.

پیامدهای بازار

برای کاربر تجاری، این یک چرخش به سمت هوش مصنوعی «نامرئی» است. به‌جای مدیریت یک پنجره چت، هوش مصنوعی به یک هماهنگ‌کننده در پس‌زمینه Docs Live، Gmail Live و Keep Live تبدیل می‌شود. توانایی استدلال و صحبت هم‌زمان، فاصله «دره وهمی» (Uncanny Valley) ناشی از مکث‌های مدل را کاهش می‌دهد و عامل‌های صوتی را برای نقش‌های حساس تجربه مشتری قابل‌اتکا می‌کند.

گوگل با جابه‌جایی مرزهای دقت و کیفیت در EVA-Bench، سیگنالی فرستاد که دقت دیگر نباید به قیمت کاهش کیفیت مکالمه تمام شود. این موضوع فشار را بر رقبا افزایش می‌دهد تا از پوشش‌های ساده تبدیل متن به گفتار (TTS) فاصله گرفته و به سمت استدلال چندوجهی بومی (Native Multimodal Reasoning) حرکت کنند.

توسعه‌دهندگان اکنون می‌توانند از طریق Gemini API و Google AI Studio به این مدل‌ها دسترسی داشته باشند. مشتریان سازمانی در پیش‌نمایش خصوصی (Private Preview) می‌توانند آن‌ها را از طریق Gemini Enterprise تست کنند. مدل Gemini 3.8 Live برای همه در Search Live در دسترس است، در حالی که Extended Thinking در Gemini Live برای مشترکین Google AI Pro و Ultra در Docs، و برای همه مشترکین Google AI در Gmail و Keep فعال شده است. پشتیبانی از Gemini Enterprise برای تجربه مشتری و عرضه گسترده‌تر Workspace برای Extended Thinking به‌زودی ارائه خواهد شد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، اتصال WebSocket مدل‌های Live را در Google AI Studio برای کاهش تأخیر در اپلیکیشن‌های خود تست کنید.
  • کاربران Google AI Pro را تشویق کنید تا قابلیت Extended Thinking را در Gemini Live برای تحلیل‌های پیچیده صوتی به کار بگیرند.
  • استراتژی‌های پشتیبانی مشتری خود را از چت‌بات‌های متنی به سمت عامل‌های صوتی با قابلیت استدلال هم‌زمان بازبینی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار بنچمارک‌های صنعتی مانند EVA-Bench، ثابت می‌کند که عامل‌های صوتی اکنون از مرحله دمو به مرحله تولید تجاری رسیده‌اند. این تغییر باعث می‌شود رابط‌های کاربری متنی در محیط‌های سازمانی به سرعت جای خود را به دستیاران صوتی نامرئی بدهند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به Gemini Live API دشوار است، اما استفاده از این مدل‌ها در محیط Workspace برای کاربرانی که از ابزارهای تغییر آی‌پی استفاده می‌کنند، در دسترس است.

·نگاه ما
تحریریه دات‌هوش

تمرکز گوگل بر «استدلال و صحبت هم‌زمان» نشان می‌دهد که گلوگاه فعلی عامل‌های صوتی دیگر فقط سرعت تبدیل متن به گفتار نیست، بلکه مدیریت زمانِ فکر کردن مدل است. با حذف مکث‌های مصنوعی، گوگل در واقع در حال تعریف استانداردی جدید برای «طبیعی بودن» تعاملات انسانی-ماشین است که در آن استدلال، بخشی از جریان مکالمه است نه پیش‌نیازی برای آن.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.