پرش به محتوای اصلی
پرش به محتوای مقاله

گوگل هزینه API صوتی را ۷۰٪ کاهش داد تا OpenAI را به چالش بکشد

·۲۵ شهریور ۱۴۰۵۱ دقیقه مطالعه۲ بازدید
گوگل سه مدل جدید جمینی فلش عرضه کرد، اما مدل پیشرو ۳.۵ پرو همچنان در حال آموزش است.
گوگل سه مدل جدید جمینی فلش عرضه کرد، اما مدل پیشرو ۳.۵ پرو همچنان در حال آموزش است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش ۷۰ درصدی هزینه API صوتی گوگل در برابر OpenAI و معرفی مدل Extended Thinking با امتیاز ۸۲.۶٪ در محک‌های گفتار-به-گفتار.

اگر امروز برای هر ساعت مکالمه صوتی با هوش مصنوعی ۳ دلار می‌پردازید، گوگل حالا این هزینه را به ۱.۳۸ دلار رسانده است. این کاهش قیمت، هسته اصلی معرفی مدل‌های Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking در ۱۵ سپتامبر ۲۰۲۶ است که اکنون از طریق Gemini API و Google AI Studio در دسترس توسعه‌دهندگان قرار گرفته‌اند. این مدل‌ها در زمان عرضه توانستند کیفیت گفتار را به امتیاز ۸۲.۶ برسانند و استانداردهای جدیدی را در پردازش صوتی تعریف کنند.

این جنگ قیمتی در حالی رخ می‌دهد که عامل‌های صوتی از حالت ساده‌ی «نوبت‌به‌نوبت» به عملیات پیچیده در پس‌زمینه تغییر مسیر می‌دهند. همان‌طور که در تحلیل قبلی ما درباره‌ی جایگزینی مدل‌های توکن‌محور با بودجه‌بندی بر اساس دارایی در تولید تصویر اشاره کردیم، اکنون در حوزه صوت نیز «هزینه هر جلسه» به اهرم اصلی رقابت تبدیل شده است.

به گزارش وب‌سایت the-decoder.com، این مدل‌های جدید قابلیت‌های کلیدی زیر را ارائه می‌دهند:

  • پشتیبانی چندزبانه: پردازش بومی برای بیش از ۹۷ زبان.
  • توانمندی عامل‌محور (Agentic): قابلیت فراخوانی API در پس‌زمینه، هم‌زمان با پردازش ورودی‌های تصویری و صحبت کردن.
  • عملکرد بالا: نسخه Extended Thinking در محک Speech-to-Speech مؤسسه Artificial Analysis امتیاز ۸۲.۶٪ را کسب کرد و از مدل‌های اخیر OpenAI پیشی گرفت.

طبق اعلام گوگل، قیمت‌گذاری این مدل‌ها بسیار تهاجمی است: ۰.۰۰۵ دلار برای هر دقیقه ورودی صوتی و ۰.۰۱۸ دلار برای خروجی. در مقابل، مدل GPT-Live-1 که OpenAI در ۱۰ سپتامبر ۲۰۲۶ عرضه کرد، دقایقی را با قیمت ۰.۰۵ دلار محاسبه می‌کند.

با این حال، این کاهش هزینه با یک افت کیفی همراه است. GPT-Live-1 از یک سامانه دوبلکس کامل (Full-Duplex) — شبیه به تلفن‌های معمولی که هر دو طرف می‌توانند هم‌زمان حرف بزنند و بشنوند — استفاده می‌کند که در محک مربوطه امتیاز ۸۰.۱٪ گرفت. مدل‌های گوگل هنوز عمدتاً ساختار نوبتی دارند؛ این یعنی گوگل یک بار دیگر قیمت را فدای حس طبیعی و روان مکالمات انسانی کرده است.

توسعه‌دهندگان اکنون می‌توانند برای تست این مدل‌ها به نمونه‌های موجود در GitHub مراجعه کنند.

گام بعدی شما

  • اگر هزینه استنتاج (Inference) — یعنی همان لحظه تولید جواب توسط مدل — اولویت شماست، Gemini 3.8 Live را جایگزین کنید.
  • برای اپلیکیشن‌هایی که نیاز به قطع نکردن جریان کلام دارند، همچنان روی GPT-Live-1 بمانید.
  • عملکرد مدل Extended Thinking را در سناریوهای استدلالی پیچیده آزمایش کنید.

اما نبرد واقعی بر سر سخت‌افزارهای بهینه‌شده برای این مدل‌هاست؛ به تحلیل ما درباره تراشه‌های TPU نسل جدید مراجعه کنید.

چرا این موضوع مهم است؟

این رقابت هزینه استنتاج صوتی را برای کسب‌وکارها به شدت کاهش می‌دهد و استقرار عامل‌های صوتی در مقیاس میلیونی را اقتصادی می‌کند. اعتبار گوگل در این میدان با تکیه بر زیرساخت‌های TPU و قیمت تهاجمی به چالش کشیده شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، توسعه‌دهندگان ایرانی برای دسترسی به این مدل‌ها همچنان نیازمند زیرساخت‌های واسط هستند، اما کاهش شدید قیمت، هزینه نگهداری بات‌های صوتی فارسی را برای استارتاپ‌های داخلی به شدت می‌کاهد.

·نگاه ما
تحریریه دات‌هوش

گوگل استراتژی «تخریب قیمت» را برای خنثی کردن برتری فنی OpenAI در تجربه کاربری به کار گرفته است. این رویکرد نشان می‌دهد گوگل ترجیح می‌دهد ابتدا زیرساخت توسعه‌دهندگان را با قیمت پایین تصاحب کند و سپس در نسخه‌های بعدی (احتمالاً ۳.۹) شکاف فنی دوبلکس کامل را پر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.