اگر برای توسعه برنامههای صوتی هزینه میپردازید، حالا بازی تغییر کرده است؛ علیبابا با یک حرکت تهاجمی، قیمتهای API بازشناسی گفتار را تا ۹۵٪ ارزانتر کرد. طبق اعلام این شرکت در ۲۳ سپتامبر ۲۰۲۶، هدف از این کاهش قیمت، تبدیل فناوریهای صوتی پیشرفته به کالاهایی ارزان و در دسترس برای تمامی توسعهدهندگان است.
این اتفاق در حالی رخ میدهد که صنعت از تبدیل سادهٔ صوت به متن، به سمت تعاملات احساسی و آنی حرکت میکند. هوش مصنوعی زاینده (Generative AI) — مثل هنرمندی که یاد گرفته است نه تنها کلمات، بلکه لحن و احساس را هم بازآفرینی کند — اکنون در حال شکستن سد هزینههاست تا در اپلیکیشنهای انبوه بازار جای بگیرد. همانطور که در تحلیلهای قبلی ما دربارهی رقابت مدلهای بازمتن اشاره کردیم، کاهش هزینه استنتاج (Inference) — یعنی همان لحظهای که مدل واقعاً جواب تولید میکند، شبیه به خودِ آشپزی و نه دورهی آموزش آشپز — کلید ورود به بازار مصرفکننده است. این رویکرد بهینهسازی هزینهها در مدلهای صوتی، یادآور عملکرد خیرهکننده مدلهای متنی این شرکت است که در مقایسه با رقبای قدرتمندی چون کلود، کارایی بالایی در کدنویسی از خود نشان دادند.
مجموعه جدید Qwen-Audio-3.1 شامل پنج مدل تخصصی است. مدل ASR (بازشناسی گفتار) اکنون بهطور خودکار کلمات زائد و تکرارهای بیهوده را حذف میکند. مدل ASR-Next نیز قابلیت شناسایی چندین گوینده با برچسب زمانی و تشخیص احساسات را اضافه کرده است. در بخش تولید صدا، مدل TTS (تبدیل متن به گفتار) به کاربر اجازه میدهد لحن صدا را با پرامپت کنترل کند؛ مثلاً میتوان از مدل خواست لحنی «قاطع و دستوری» داشته باشد.
بر اساس مستندات فنی، ویژگیهای برجسته این بهروزرسانی عبارتند از:
- TTS-Next: استفاده از مدل انتشار (Diffusion Model) برای تولید همزمان صدا، جلوههای صوتی و صدای پسزمینه در یک مرحله.
- مدل آنی (Real-time): پشتیبانی از شنیدن و صحبت کردن همزمان با قابلیت قطع کردن مدل و سرعت پاسخدهی بر اساس همدلی.
- تغییر قیمت: هزینه TTS حدود ۷۰٪، مدل آنی ۸۵٪ و ASR تا ۹۵٪ کاهش یافته است.
به نظر ما، این جنگ قیمتی نشان میدهد که علیبابا از زیرساختهای ابری خود برای حذف رقبا استفاده میکند. آنها با ارزان کردن مدل، ارزش افزوده را از خودِ مدل به سمت یکپارچگی کامل تراشهها و ابر منتقل میکنند.
در همین راستا، ادی وو، مدیرعامل علیبابا، در کنفرانس Apsara در ۲۲ سپتامبر اعلام کرد که هدف شرکت رسیدن به مقیاس ۵ تا ۱۰ تریلیون پارامتر است. این جاهطلبی در راستای استراتژی جدید علیبابا برای دستیابی به هوش مصنوعی فوقبشر (ASI) قرار دارد. باید دید این مقیاس عظیم چگونه با مدلهای صوتی ارزانقیمت ترکیب میشود تا دستیارهای دیجیتالی واقعاً انسانگونه خلق شوند.
گام بعدی شما
- اگر از سرویسهای گرانقیمت تبدیل صوت به متن استفاده میکنید، مدلهای Qwen را برای کاهش هزینههای عملیاتی تست کنید.
- قابلیت کنترل لحن در TTS-Next را برای شخصیسازی تجربه کاربری در اپلیکیشنهای خود به کار بگیرید.
- تغییرات قیمت در مدلهای Real-time را برای پیادهسازی چتباتهای صوتی با تأخیر کم بررسی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو