هزینهٔ استقرار عاملهای صوتی بلادرنگ همین حالا به کفِ جدیدی رسید. تیم Qwen در شرکت علیبابا (Alibaba)، مدل Qwen-Audio-3.1-Realtime را معرفی کرد؛ یک مدل گفتاری تمام-دوطرفه (Full-duplex) که طراحی شده تا فکر کند، عمل کند و دقیقاً تصمیم بگیرد چه زمانی در یک مکالمه زنده صحبت کند یا گوش دهد. این عرضه بخشی از یک پشته صوتی گستردهتر شامل ۵ مدل است که حوزههای بازشناسی گفتار (ASR)، تبدیل متن به گفتار (TTS) و تعاملات بلادرنگ را پوشش میدهد. این تلاشها در راستای بهینهسازی مدلهای چندوجهی علیبابا است، مشابه آنچه در کاهش مصرف توکنهای ویدیو در مدل Qwen3.8-Omni-Flash مشاهده کردیم.
هوش مصنوعی صوتی مدتهاست با مشکل «نوبتگیری» (turn-taking) دستوپنجه نرم میکند؛ همان تداخلهای صوتی آزاردهنده یا سکوتهای طولانی وقتی انسان و ماشین همزمان تعامل میکنند. اکثر سامانههای موجود نیمهدوطرفه (half-duplex) هستند، به این معنا که صوت را در تکههای مجزا (chunks) پردازش میکنند. مدل Qwen-Audio-3.1-Realtime تلاش میکند این مشکل را با تبدیل تعامل صوتی به یک جریان پیوسته حل کند. این رویکرد اجازه میدهد عامل صوتی توسط کاربر قطع شود یا بهطور دقیق حس کند که کاربر چه زمانی فکرش تمام شده و نوبت صحبت مدل است.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی هزینههای استنتاج اشاره کردیم، رقابت اکنون از کیفیت مدلها به سمت کاهش هزینهٔ عملیاتی تغییر مسیر داده است. طبق گزارش Marktechpost در ۲۸ سپتامبر ۲۰۲۶، این مدل از طریق QwenCloud و با نام qwen-audio-3.1-realtime-plus به صورت یک API مدیریتشده در دسترس است. تکاندهندهترین بخش این عرضه، استراتژی قیمتگذاری تهاجمی علیبابا است: این شرکت قیمتها را به میزان تقریباً ۸۵٪ برای مدل Realtime، ۷۰٪ برای TTS و تا ۹۵٪ برای ASR کاهش داده است.
مشخصات فنی و قیمتگذاری
- پنجرهٔ زمینه (Context Window): ۲۶۲ هزار توکن (حداکثر ۲۴۵ هزار توکن ورودی و ۱۶ هزار توکن خروجی).
- هزینه ورودی: ۶.۴ دلار به ازای هر ۱ میلیون توکن صوتی؛ ۰.۸ دلار به ازای هر ۱ میلیون توکن متنی.
- هزینه خروجی: ۲۴ دلار به ازای هر ۱ میلیون توکن (خروجی متنی رایگان است).
- قابلیتها: جستوجوی داخلی وب، فراخوانی تابع (Function Calling)، خروجیهای ساختاریافته و ذخیرهسازی زمینه (Context Caching).
- محدودیت API: محدودیتهای پیشفرض روی ۶۰ درخواست و ۱۰۰ هزار توکن در دقیقه تنظیم شده است.
- ASR-Flash-Filetrans: یک مدل مکمل برای تبدیل صوتهای طولانی آفلاین به متن. این مدل از تفکیک گوینده (speaker separation)، کلمات کلیدی (hot words)، نقطهگذاری و شناسایی گویشهای چینی پشتیبانی میکند و قیمت آن ۰.۱۵ دلار برای ورودی و ۰.۴۷ دلار برای خروجی به ازای هر ۱ میلیون توکن است.
معماری «فکر کن-عمل کن-بگو»
این سامانه با استفاده از دو مدل عمل میکند که هر دو یک رمزگذار صوتی (Audio Encoder) و طراحی مدل زبانی بزرگ (LLM) مشترک دارند. یک مدل تصمیمگیرنده پیشبینی میکند که آیا باید به گوش دادن ادامه دهد، صحبت کند، متوقف شود یا مکالمه را از سر بگیرد؛ در حالی که یک مدل تبدیل گفتار به متن، محتوای پاسخ را تولید میکند. در نهایت، یک رندرکننده صوتیِ آگاه به زمینه، این متن را بر اساس نشانههای آکوستیک و تاریخچه مکالمه به گفتار جاری (streaming speech) تبدیل میکند.
آموزش این مدل در سه لایه مجزا صورت گرفته است:
۱. فکر کردن (Think): این لایه از متد M²-OPD Core-Cocktail SFT استفاده میکند تا مدل صوتی را با استفاده از دادههای جفتشده در مقیاس میلیون-ساعتی، مجدداً به مدل زبانی متنی منبع خود متصل (re-anchor) کند. در اینجا از تقطیر On-policy استفاده شده است که در آن یک «معلم متنی» و یک «مرجع صوتی منجمد»، مسیر حرکت مدل شاگرد را امتیازدهی میکنند. همچنین متخصصان حوزههای صحنههای آکوستیک، قصد کاربر (pragmatic intent) و همدلی از طریق GRPO آموزش دیده و با استفاده از Multi-Teacher OPD ادغام شدهاند.
۲. عمل کردن (Act): تمرکز این لایه بر محیطهای قابل اجرا است. هر حوزه شامل یک استخر ابزار (tool pool)، یک سیاست تجاری به زبان طبیعی و یک پایگاهداده JSON وضعیتمند (stateful) است. وظایف از طریق سرور MCP و تعاریف ابزارهای متنباز تغذیه میشوند. هر وظیفه باید حتماً به یک запись (Write)، یک رد کردن مستدل یا یک درخواست پشتیبانینشده ختم شود. در امتیازدهی این لایه، وضعیت نهایی (terminal state) و نوشتههای مجاز بر روانیِ کلام اولویت دارند.
۳. گفتن و هماهنگی (Speak and Coordinate): این لایه زمانبندی پاسخها را مدیریت میکند. آموزش جستوجو بهگونهای طراحی شده که پرسوجوهای تکراری را جریمه کند؛ بر اساس فرمولی که باعث شد میانگین پرسوجوها در هر فراخوانی جستوجو از ۴.۳۷ به ۱.۰۵ کاهش یابد، هرچند معیار Trigger F1 اندکی از ۶۰.۸۷٪ به ۵۸.۶۱٪ افت کرد.
محکهای عملکردی
بر اساس دادههای Full-Duplex-Bench v1.5، این مدل پاسخهای اشتباه به صداهای پسزمینه را بهطور قابلتوجهی کاهش داده و از ۰.۱۳ به ۰.۰۳ رسانده است. در محک ۱۴ زبانه BBA، امتیاز میانگین از ۸۱.۷٪ به ۸۸.۱٪ رسید. دستاوردهای دیگر شامل افزایش امتیاز Audio MultiChallenge از ۴۷.۱۲ به ۵۲.۲۱ و سقوط نرخ خطای کلمه (WER) در FLEURS از ۹.۰۱ به ۳.۹۸ است. این بهبود در دقت تبدیل گفتار به متن، در حالی رخ میدهد که رقبا نیز در حال پیشرفت هستند؛ برای مثال مدل Muse Voice متا توانست نرخ خطای تبدیل گفتار به متن را به ۳.۱٪ برساند.
با این حال، مدل علیبابا هنوز در مطالعات تیم قرمز انسانی از GPT-Realtime-2 شرکت OpenAI عقبتر است؛ جایی که GPT-Realtime-2 با ۹۶.۰۰٪ در برابر ۹۲.۰۰٪ Qwen پیشتاز بود. علاوه بر این، تأخیر در توقف هنگام قطع شدن صحبتها (interruption stop latency) در Qwen حدود ۱.۱۱۶ ثانیه است که بهطور محسوسی کندتر از ۰.۳۸۳ ثانیه در مدل OpenAI است. همچنین در بخش هماهنگی، موازناتی وجود دارد؛ بهطوری که پس از قطع صحبتها، نرخ «از سرگیری ناخواسته» از ۰.۰۳۵ به ۰.۱۳۰ افزایش یافته است.
این تغییر در قیمتگذاری و معماری نشان میدهد علیبابا سهم بازار و دسترسیپذیری را بر برتری مطلق در تأخیر (Latency) ترجیح داده است. با کاهش ۹۵ درصدی هزینههای ASR، حالا نگه داشتن میکروفون در حالت «همیشه روشن» برای گردشهای کاری پیچیده و عاملمحور (agentic workflows)، از نظر اقتصادی توجیهپذیر شده است. در همین راستا، تلاش برای ارتقای استدلال در مدلهای صوتی ادامه دارد، همانطور که اخیراً دقت حل مسائل ریاضی صوتی در مدل Kyutai به ۷۷.۱٪ رسید.
برای توسعهدهندگان، موازنه روشن است: شما یک پنجره زمینه عظیم و هزینههای عملیاتی بسیار پایین بهدست میآورید، اما بخشی از پاسخدهی آنی و فوقسریع مدل پرچمدار OpenAI را از دست میدهید.
گام بعدی شما
- اگر در حال ساخت ایجنتهای صوتی هستید، مدل ASR-Flash-Filetrans را برای پردازش ارزانقیمت فایلهای صوتی طولانی تست کنید.
- در پیادهسازیهای حساس به زمان، تأخیر ۱.۱ ثانیهای Qwen را در تجربه کاربری (UX) لحاظ کنید.
- برای کاهش هزینههای استنتاج، از قابلیت Context Caching در QwenCloud استفاده کنید.
اما واکنش جامعه متنباز به این بنچمارکها میتواند جالب باشد؛ چرا که نبود وزنهای باز (Open Weights) برای Qwen-Audio-3.1-Realtime، شکافی را برای ظهور جایگزینهای محلی و تمام-دوطرفه ایجاد میکند.




گفتگو