پرش به محتوای اصلی
پرش به محتوای مقاله

علی‌بابا هزینه API مدل‌های صوتی را تا ۹۵٪ کاهش داد

·۷ مهر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
مدل صوتی تمام‌دوطرفه جدید علی‌بابا با قابلیت تفکر، عمل و تصمیم‌گیری برای زمان صحبت کردن
مدل صوتی تمام‌دوطرفه جدید علی‌بابا با قابلیت تفکر، عمل و تصمیم‌گیری برای زمان صحبت کردن
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کاهش تهاجمی قیمت‌ها (تا ۹۵٪) در کنار معماری Full-duplex؛ علی‌بابا به‌جای رقابت بر سر کمترین تأخیر، بر روی ارزان‌ترین هزینه برای مقیاس‌پذیری تجاری تمرکز کرده است.

هزینهٔ استقرار عامل‌های صوتی بلادرنگ همین حالا به کفِ جدیدی رسید. تیم Qwen در شرکت علی‌بابا (Alibaba)، مدل Qwen-Audio-3.1-Realtime را معرفی کرد؛ یک مدل گفتاری تمام-دوطرفه (Full-duplex) که طراحی شده تا فکر کند، عمل کند و دقیقاً تصمیم بگیرد چه زمانی در یک مکالمه زنده صحبت کند یا گوش دهد. این عرضه بخشی از یک پشته صوتی گسترده‌تر شامل ۵ مدل است که حوزه‌های بازشناسی گفتار (ASR)، تبدیل متن به گفتار (TTS) و تعاملات بلادرنگ را پوشش می‌دهد. این تلاش‌ها در راستای بهینه‌سازی مدل‌های چندوجهی علی‌بابا است، مشابه آنچه در کاهش مصرف توکن‌های ویدیو در مدل Qwen3.8-Omni-Flash مشاهده کردیم.

هوش مصنوعی صوتی مدت‌هاست با مشکل «نوبت‌گیری» (turn-taking) دست‌وپنجه نرم می‌کند؛ همان تداخل‌های صوتی آزاردهنده یا سکوت‌های طولانی وقتی انسان و ماشین هم‌زمان تعامل می‌کنند. اکثر سامانه‌های موجود نیمه‌دوطرفه (half-duplex) هستند، به این معنا که صوت را در تکه‌های مجزا (chunks) پردازش می‌کنند. مدل Qwen-Audio-3.1-Realtime تلاش می‌کند این مشکل را با تبدیل تعامل صوتی به یک جریان پیوسته حل کند. این رویکرد اجازه می‌دهد عامل صوتی توسط کاربر قطع شود یا به‌طور دقیق حس کند که کاربر چه زمانی فکرش تمام شده و نوبت صحبت مدل است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج اشاره کردیم، رقابت اکنون از کیفیت مدل‌ها به سمت کاهش هزینهٔ عملیاتی تغییر مسیر داده است. طبق گزارش Marktechpost در ۲۸ سپتامبر ۲۰۲۶، این مدل از طریق QwenCloud و با نام qwen-audio-3.1-realtime-plus به صورت یک API مدیریت‌شده در دسترس است. تکان‌دهنده‌ترین بخش این عرضه، استراتژی قیمت‌گذاری تهاجمی علی‌بابا است: این شرکت قیمت‌ها را به میزان تقریباً ۸۵٪ برای مدل Realtime، ۷۰٪ برای TTS و تا ۹۵٪ برای ASR کاهش داده است.

مشخصات فنی و قیمت‌گذاری

  • پنجرهٔ زمینه (Context Window): ۲۶۲ هزار توکن (حداکثر ۲۴۵ هزار توکن ورودی و ۱۶ هزار توکن خروجی).
  • هزینه ورودی: ۶.۴ دلار به ازای هر ۱ میلیون توکن صوتی؛ ۰.۸ دلار به ازای هر ۱ میلیون توکن متنی.
  • هزینه خروجی: ۲۴ دلار به ازای هر ۱ میلیون توکن (خروجی متنی رایگان است).
  • قابلیت‌ها: جست‌وجوی داخلی وب، فراخوانی تابع (Function Calling)، خروجی‌های ساختاریافته و ذخیره‌سازی زمینه (Context Caching).
  • محدودیت API: محدودیت‌های پیش‌فرض روی ۶۰ درخواست و ۱۰۰ هزار توکن در دقیقه تنظیم شده است.
  • ASR-Flash-Filetrans: یک مدل مکمل برای تبدیل صوت‌های طولانی آفلاین به متن. این مدل از تفکیک گوینده (speaker separation)، کلمات کلیدی (hot words)، نقطه‌گذاری و شناسایی گویش‌های چینی پشتیبانی می‌کند و قیمت آن ۰.۱۵ دلار برای ورودی و ۰.۴۷ دلار برای خروجی به ازای هر ۱ میلیون توکن است.

معماری «فکر کن-عمل کن-بگو»

این سامانه با استفاده از دو مدل عمل می‌کند که هر دو یک رمزگذار صوتی (Audio Encoder) و طراحی مدل زبانی بزرگ (LLM) مشترک دارند. یک مدل تصمیم‌گیرنده پیش‌بینی می‌کند که آیا باید به گوش دادن ادامه دهد، صحبت کند، متوقف شود یا مکالمه را از سر بگیرد؛ در حالی که یک مدل تبدیل گفتار به متن، محتوای پاسخ را تولید می‌کند. در نهایت، یک رندرکننده صوتیِ آگاه به زمینه، این متن را بر اساس نشانه‌های آکوستیک و تاریخچه مکالمه به گفتار جاری (streaming speech) تبدیل می‌کند.

آموزش این مدل در سه لایه مجزا صورت گرفته است:

۱. فکر کردن (Think): این لایه از متد M²-OPD Core-Cocktail SFT استفاده می‌کند تا مدل صوتی را با استفاده از داده‌های جفت‌شده در مقیاس میلیون-ساعتی، مجدداً به مدل زبانی متنی منبع خود متصل (re-anchor) کند. در اینجا از تقطیر On-policy استفاده شده است که در آن یک «معلم متنی» و یک «مرجع صوتی منجمد»، مسیر حرکت مدل شاگرد را امتیازدهی می‌کنند. همچنین متخصصان حوزه‌های صحنه‌های آکوستیک، قصد کاربر (pragmatic intent) و همدلی از طریق GRPO آموزش دیده و با استفاده از Multi-Teacher OPD ادغام شده‌اند.

۲. عمل کردن (Act): تمرکز این لایه بر محیط‌های قابل اجرا است. هر حوزه شامل یک استخر ابزار (tool pool)، یک سیاست تجاری به زبان طبیعی و یک پایگاه‌داده JSON وضعیت‌مند (stateful) است. وظایف از طریق سرور MCP و تعاریف ابزارهای متن‌باز تغذیه می‌شوند. هر وظیفه باید حتماً به یک запись (Write)، یک رد کردن مستدل یا یک درخواست پشتیبانی‌نشده ختم شود. در امتیازدهی این لایه، وضعیت نهایی (terminal state) و نوشته‌های مجاز بر روانیِ کلام اولویت دارند.

۳. گفتن و هماهنگی (Speak and Coordinate): این لایه زمان‌بندی پاسخ‌ها را مدیریت می‌کند. آموزش جست‌وجو به‌گونه‌ای طراحی شده که پرس‌وجوهای تکراری را جریمه کند؛ بر اساس فرمولی که باعث شد میانگین پرس‌وجوها در هر فراخوانی جست‌وجو از ۴.۳۷ به ۱.۰۵ کاهش یابد، هرچند معیار Trigger F1 اندکی از ۶۰.۸۷٪ به ۵۸.۶۱٪ افت کرد.

محک‌های عملکردی

بر اساس داده‌های Full-Duplex-Bench v1.5، این مدل پاسخ‌های اشتباه به صداهای پس‌زمینه را به‌طور قابل‌توجهی کاهش داده و از ۰.۱۳ به ۰.۰۳ رسانده است. در محک ۱۴ زبانه BBA، امتیاز میانگین از ۸۱.۷٪ به ۸۸.۱٪ رسید. دستاوردهای دیگر شامل افزایش امتیاز Audio MultiChallenge از ۴۷.۱۲ به ۵۲.۲۱ و سقوط نرخ خطای کلمه (WER) در FLEURS از ۹.۰۱ به ۳.۹۸ است. این بهبود در دقت تبدیل گفتار به متن، در حالی رخ می‌دهد که رقبا نیز در حال پیشرفت هستند؛ برای مثال مدل Muse Voice متا توانست نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ برساند.

با این حال، مدل علی‌بابا هنوز در مطالعات تیم قرمز انسانی از GPT-Realtime-2 شرکت OpenAI عقب‌تر است؛ جایی که GPT-Realtime-2 با ۹۶.۰۰٪ در برابر ۹۲.۰۰٪ Qwen پیشتاز بود. علاوه بر این، تأخیر در توقف هنگام قطع شدن صحبت‌ها (interruption stop latency) در Qwen حدود ۱.۱۱۶ ثانیه است که به‌طور محسوسی کندتر از ۰.۳۸۳ ثانیه در مدل OpenAI است. همچنین در بخش هماهنگی، موازناتی وجود دارد؛ به‌طوری که پس از قطع صحبت‌ها، نرخ «از سرگیری ناخواسته» از ۰.۰۳۵ به ۰.۱۳۰ افزایش یافته است.

این تغییر در قیمت‌گذاری و معماری نشان می‌دهد علی‌بابا سهم بازار و دسترسی‌پذیری را بر برتری مطلق در تأخیر (Latency) ترجیح داده است. با کاهش ۹۵ درصدی هزینه‌های ASR، حالا نگه داشتن میکروفون در حالت «همیشه روشن» برای گردش‌های کاری پیچیده و عامل‌محور (agentic workflows)، از نظر اقتصادی توجیه‌پذیر شده است. در همین راستا، تلاش برای ارتقای استدلال در مدل‌های صوتی ادامه دارد، همان‌طور که اخیراً دقت حل مسائل ریاضی صوتی در مدل Kyutai به ۷۷.۱٪ رسید.

برای توسعه‌دهندگان، موازنه روشن است: شما یک پنجره زمینه عظیم و هزینه‌های عملیاتی بسیار پایین به‌دست می‌آورید، اما بخشی از پاسخ‌دهی آنی و فوق‌سریع مدل پرچم‌دار OpenAI را از دست می‌دهید.

گام بعدی شما

  • اگر در حال ساخت ایجنت‌های صوتی هستید، مدل ASR-Flash-Filetrans را برای پردازش ارزان‌قیمت فایل‌های صوتی طولانی تست کنید.
  • در پیاده‌سازی‌های حساس به زمان، تأخیر ۱.۱ ثانیه‌ای Qwen را در تجربه کاربری (UX) لحاظ کنید.
  • برای کاهش هزینه‌های استنتاج، از قابلیت Context Caching در QwenCloud استفاده کنید.

اما واکنش جامعه متن‌باز به این بنچمارک‌ها می‌تواند جالب باشد؛ چرا که نبود وزن‌های باز (Open Weights) برای Qwen-Audio-3.1-Realtime، شکافی را برای ظهور جایگزین‌های محلی و تمام-دوطرفه ایجاد می‌کند.

چرا این موضوع مهم است؟

این اقدام با تکیه بر اعتبار زیرساختی علی‌بابا، سد ورود به بازار عامل‌های صوتی را می‌شکند و امکان ساخت دستیارهای صوتی همیشه‌روشن را فراهم می‌کند. این تغییر، مدل‌های صوتی را از ابزارهای تک‌وظیفه‌ای به سیستم‌های عامل‌محور تبدیل می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به QwenCloud دشوار است، اما کاهش جهانی قیمت‌ها فشار را بر ارائه‌دهندگان واسط کاهش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

علی‌بابا با این حرکت، جنگ مدل‌های صوتی را از میدان «دقت» به میدان «اقتصاد» کشاند. کاهش ۹۵ درصدی هزینه‌ها یعنی مدل‌های صوتی از یک قابلیت لوکس برای دموها، به ابزاری کاربردی برای زیرساخت‌های صنعتی تبدیل می‌شوند. این استراتژی احتمالاً برای فشار آوردن به OpenAI و اجبار او به کاهش قیمت‌های API طراحی شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.