اگر امروز برای مدیریت کارهای پیچیده از چتباکسهای متنی استفاده میکنید، باید بدانید که عصر «تایپ کردن» در حال جایگزینی با گفتگوهای بلادرنگ است. گوگل با معرفی مدلهای جدید خود، سقف عملکرد صوتی را در شاخص کیفیت گفتار به ۸۲.۶ رساند.
به نقل از تیم صوتی Gemini، مدلهای Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking در ۱۵ سپتامبر ۲۰۲۶ منتشر شدند تا تمرکز را از پرامپتهای متنی به دیالوگهای سیال منتقل کنند. این خبر توسط تام اویانگ (Tom Ouyang)، مهندس ارشد و مالینی جاگاناتان (Malini Jaganathan)، عضو کادر فنی، به نمایندگی از تیم صوتی Gemini اعلام شد.
این تحول در حالی رخ میدهد که بسیاری از شرکتها برای تبدیل نمونههای اولیه به محصولات نهایی در محیط تولید با مشکل تأخیر در پاسخدهی و صلب بودن رابطهای صوتی مواجهاند. همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، گذار به رابطهای صوتی چالشهای جدیدی در کنترل خروجی ایجاد میکند. گوگل اکنون با ادغام این مدلها در Gemini API، Google AI Studio، Gemini Enterprise، Search Live، Gemini Live و Google Workspace، روی این شرطبندی کرده است که صدا به رابط اصلی گردشکارهای پیچیده تجاری تبدیل شود.
جایگاه مدلها در اکوسیستم
گوگل این دو مدل را پیشرفتهترین ابزارهای دیالوگ زنده خود تا به امروز مینامد. هدف، ایجاد تجربهای شهودی برای همکاری در انجام وظایف پیچیده از طریق صداست که با بهبود در استدلال موازی (Parallel Reasoning) و افزایش سطح هوش محقق شده است.
مدل Gemini 3.8 Live برای مقیاسپذیری و بهینگی هزینه طراحی شده است. این مدل ترکیبی از هوش مکالمهای، دیالوگهای سیال و مبنیسازی (Grounding) — شبیه به وقتی که یک دستیار، پاسخهایش را بر اساس مدارک واقعی روی میز چک میکند — و تعاملات بصری است. در مقابل، مدل Gemini 3.8 Live Extended Thinking برای وظایفی با پیچیدگی بالا که به مدل استدلالی (Reasoning Model) — مثل شطرنجبازی که چند حرکت جلوتر را میبیند — و تفکر چندمرحلهای نیاز دارند، مهندسی شده است. این دو مدل در کنار هم، بلوکهای سازنده برای ایجاد عاملهای صوتی قابلاتکا و آماده برای محیط تولید (Production-ready) را فراهم میکنند.
بنچمارکها و توانمندیهای فنی
طبق گزارش unite.ai، این دو مدل اهداف متفاوتی را دنبال میکنند. Gemini 3.8 Live بر روی مقیاس، هزینه، سیالیت گفتگو و مبنیسازی بصری متمرکز است، در حالی که Extended Thinking وظایف پیچیده با استدلال چندمرحلهای را مدیریت میکند.
گوگل برای مدل Extended Thinking معیارهای عملکردی دقیقی ارائه داده است:
- شاخص کیفیت گفتار به گفتار (Speech to Speech Quality Index): ۸۲.۶ (کسب رتبه اول کلی).
- تکمیل وظایف عاملمحور τ-Voice: ۶۸.۶٪.
- محک بانکی Sierra’s τ-Voice: ۳۵.۱٪.
- آزمون Big Bench Audio: ۹۷.۷٪.
در مورد مدل Gemini 3.8 Live، گوگل به کسب رتبه دوم در Arena عاملهای صوتی Artificial Analysis اشاره کرد که نشاندهنده ترجیح بالای کاربران و مقرونبهصرفه بودن است. همچنین در محک EVA-Bench متعلق به ServiceNow — که معیاری برای ارزیابی عاملهای صوتی است — گوگل اعلام کرد که مدلهایش با ایجاد تعادل بین دقت و کیفیت مکالمه، مرز پارتو (Pareto Frontier) را برای گردشکارهای پیچیده جابهجا کردهاند. این ارزیابی خاص روی Live API در پلتفرم Gemini Enterprise Agent انجام شده است.
اجرای بلادرنگ و سازوکارهای عملیاتی
این مدلها ورودیهای بصری را تقریباً در لحظه پردازش میکنند و به هوش مصنوعی اجازه میدهند همزمان ببیند و صحبت کند. سیستم بهطور خودکار بین ۹۷ زبان پشتیبانیشده در میانه گفتگو جابهجا میشود. این پیشرفت در پردازش صوتی، تکامل یافتگانِ مدلهای پیشین است که نرخ خطای تبدیل گفتار به متن را به ۲.۶٪ رسانده بودند تا دقت درک ورودیها را به حداکثر برسانند.
یک سازوکار کلیدی، اجرای پسزمینه فراخوانیهای API است. مدل میتواند درخواست کاربر را تأیید کند و در حالی که گفتگو را پیش میبرد، وظیفه را در پسزمینه تکمیل کند. در مدل Extended Thinking، استدلال و صحبت بهصورت همزمان رخ میدهد. این مدل از نشانههای کلامی اولیه برای تأیید طبیعی پرامپتها استفاده میکند و با «روایت پیشرفت زنده» (Live Progress Narration)، کاربر را در مراحل اجرای وظایف پسزمینه همراه میکند بدون آنکه جریان گفتگو قطع شود. این قابلیت در کنار توانایی حذف کلمات زائد و اصطلاحات تخصصی در مدلهای Transcribe، باعث میشود تعاملات صوتی بسیار طبیعیتر و حرفهایتر به نظر برسند.
نمونههای کاربردی نمایشدادهشده شامل موارد زیر است:
- عملیات تجاری: تدوین کامل طرحهای کسبوکار و ابزارهای بازاریابی سفارشی از طریق گفتار طبیعی.
- توسعه فنی: تبدیل طرحهای اولیه (Sketches) و بازخوردهای صوتی بلادرنگ به کامپوننتهای کاربردی React.
- لجستیک: هماهنگی رزروهای چندمرحلهای رستوران از طریق فراخوانیهای تابع غیرهمگام (Asynchronous function calls).
- پشتیبانی: راهنمایی کارکنان جدید با استفاده از بستر بصری و ارائه عیبیابی گامبهگام در داخل Search Live.
اکوسیستم توسعهدهندگان و ایمنی
گوگل برای مدیریت زیرساخت استریم رسانهای بلادرنگ با پلتفرمهایی نظیر Vercel، LiveKit، Agora، Fishjam، Pipecat و Vision Agents همکاری میکند. همچنین شرکتهایی مانند Salesforce، Genspark و Lumeris به دلیل تأخیر پایین و قابلیتهای فراخوانی ابزار (Tool-calling)، به این مدلها علاقهمند شدهاند.
رابط API زنده از اتصال WebSocket حالتدار (Stateful) استفاده میکند که جریانهای مداوم صوت، تصویر و متن را پردازش میکند. مشخصات فنی عبارتند از:
- ورودی صوتی: PCM ۱۶ بیتی خام با فرکانس ۱۶ کیلوهرتز.
- ورودی بصری: تصاویر JPEG با نرخ حداکثر یک فریم در ثانیه.
- خروجی صوتی: PCM ۱۶ بیتی خام با فرکانس ۲۴ کیلوهرتز.
توسعهدهندگان میتوانند این سیستم را از طریق یک بکاند سرور-به-سرور یا اتصال مستقیم کلاینت-به-سرور WebSocket پیادهسازی کنند. موارد استفاده از دستیاران خرید خردهفروشی و همراهان سلامت گرفته تا شخصیتهای تعاملی بازیها و رباتیک یا عینکهای هوشمند مجهز به صدا را شامل میشود.
برای مقابله با جعل عمیق و اطلاعات نادرست، تمام صداهای تولیدشده با SynthID نشانگذاری (Watermarking) میشوند. این واترمارک نامرئی مستقیماً در خروجی صوتی بافته میشود تا محتوای تولیدشده توسط هوش مصنوعی قابل شناسایی باقی بماند.
پیامدهای بازار
برای کاربر تجاری، این یک چرخش به سمت هوش مصنوعی «نامرئی» است. بهجای مدیریت یک پنجره چت، هوش مصنوعی به یک هماهنگکننده در پسزمینه Docs Live، Gmail Live و Keep Live تبدیل میشود. توانایی استدلال و صحبت همزمان، فاصله «دره وهمی» (Uncanny Valley) ناشی از مکثهای مدل را کاهش میدهد و عاملهای صوتی را برای نقشهای حساس تجربه مشتری قابلاتکا میکند.
گوگل با جابهجایی مرزهای دقت و کیفیت در EVA-Bench، سیگنالی فرستاد که دقت دیگر نباید به قیمت کاهش کیفیت مکالمه تمام شود. این موضوع فشار را بر رقبا افزایش میدهد تا از پوششهای ساده تبدیل متن به گفتار (TTS) فاصله گرفته و به سمت استدلال چندوجهی بومی (Native Multimodal Reasoning) حرکت کنند.
توسعهدهندگان اکنون میتوانند از طریق Gemini API و Google AI Studio به این مدلها دسترسی داشته باشند. مشتریان سازمانی در پیشنمایش خصوصی (Private Preview) میتوانند آنها را از طریق Gemini Enterprise تست کنند. مدل Gemini 3.8 Live برای همه در Search Live در دسترس است، در حالی که Extended Thinking در Gemini Live برای مشترکین Google AI Pro و Ultra در Docs، و برای همه مشترکین Google AI در Gmail و Keep فعال شده است. پشتیبانی از Gemini Enterprise برای تجربه مشتری و عرضه گستردهتر Workspace برای Extended Thinking بهزودی ارائه خواهد شد.
گام بعدی شما
- اگر توسعهدهنده هستید، اتصال WebSocket مدلهای Live را در Google AI Studio برای کاهش تأخیر در اپلیکیشنهای خود تست کنید.
- کاربران Google AI Pro را تشویق کنید تا قابلیت Extended Thinking را در Gemini Live برای تحلیلهای پیچیده صوتی به کار بگیرند.
- استراتژیهای پشتیبانی مشتری خود را از چتباتهای متنی به سمت عاملهای صوتی با قابلیت استدلال همزمان بازبینی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو