پرش به محتوای اصلی
پرش به محتوای مقاله

Fish Audio با ۵۰ میلیون دلار سرمایه کنترل دقیق احساسات را به صداهای مصنوعی آورد

·۶ مرداد ۱۴۰۵۴ دقیقه مطالعه۴ بازدید
لوگوی Fish Audio و عنوان مقاله: جذب ۵۰ میلیون دلار سرمایه اولیه برای ساخت مدل‌های صدای هوش مصنوعی
لوگوی Fish Audio و عنوان مقاله: جذب ۵۰ میلیون دلار سرمایه اولیه برای ساخت مدل‌های صدای هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی انتخاب صدای ایستا با سیستم کنترل فعال (بیش از ۱۵ هزار پارامتر) برای هدایت لحن و احساس در لحظه تولید.

تصور کنید به جای انتخاب یک صدای پیش‌فرض، بتوانید دقیقاً مشخص کنید که مدل هوش مصنوعی در کدام کلمه فریاد بزند یا کجا با نجوا صحبت کند. این همان شکافی است که Fish Audio قصد دارد با کنترل جراحی‌گونه روی احساسات و لحن، آن را پر کند.

به گزارش TechCrunch، شرکت Fish Audio مستقر در پالو آلتو، روز سه‌شنبه اعلام کرد که در یک دور جذب سرمایه Seed، مبلغ ۵۰ میلیون دلار از سرمایه‌گذاران پیشرو نظیر Coreline Ventures و Capital Today دریافت کرده است.

اکثر صداهای مصنوعی فعلی در دو تله می‌افتند: یا برای روایت‌های خلاقانه بیش از حد یکنواخت‌اند یا برای استفاده‌های شرکتی غیرقابل‌پیش‌بینی هستند. برای یک استودیوی بازی‌سازی، صدا باید بتواند جیغ بزند یا پچ‌پچ کند؛ اما برای یک بات خدمات مشتری، این صدا باید قابل کنترل و با کمترین تأخیر (Latency) باشد. این تفاوت درست مثل تفاوت بین یک پیانو دیجیتال ساده و اجرای زنده یک ارکستر است. این تمرکز بر کاهش تأخیر در پاسخگویی صوتی، یادآور استراتژی استارتاپ Gradium در جذب سرمایه اخیرش برای حذف تأخیرهای آزاردهنده است که هدفش بهینه‌سازی زیرساخت‌های صوتی است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی تکامل مدل‌های مولد اشاره کردیم، صنعت اکنون از «تولید صرف» به سمت «کنترل دقیق» حرکت می‌کند. هوش مصنوعی زاینده (Generative AI) — که شبیه نقاشی با رنگ‌های جادویی است که هر چه توصیف کنید می‌کشد — در حوزه صوت نیز اکنون به دنبال دستوری است که بتواند احساسات را مدیریت کند.

تقاضای بازار و مقیاس رشد

این شرکت دو نیاز متمایز را هدف قرار داده است: کاربردهای خلاقانه که نیاز به بیانگری بالا دارند و سازمان‌هایی که برای اتوماسیون فروش و پشتیبانی به مدل‌های قابل هدایت نیاز دارند. برای پاسخ به این نیازها، Fish Audio کتابخانه‌ای شامل بیش از ۱۵ هزار کنترل با زبان طبیعی ارائه داده است.

این استارت‌آپ از زمان عرضه در سال گذشته رشد سریعی داشته و طبق اعلام شرکت، بیش از ۸ میلیون کاربر در نسخه‌های متن‌باز و میزبانی‌شده دارد. این رشد سریع منجر به دستیابی به ۲۱ میلیون دلار درآمد سالانه تکرارشونده (ARR) شده است.

اکوسیستم محصول و Traction

زیرساخت فنی شرکت بر پایه چندین عرضه کلیدی در سال گذشته است:

  • Fish Speech: یک پروژه متن‌باز که توسط Shijia Liao، پژوهشگر سابق انویدیا، آغاز شد. او این مدل را روی یک تک GPU آموزش داد تا صدای مصنوعیِ بی‌روح را به چالش بکشد. این مخزن اکنون بیش از ۳۱ هزار ستاره در گیت‌هاب دارد و توسط توسعه‌دهندگان مستقل و طراحان بازی استفاده می‌شود.
  • S2.1 Pro: جدیدترین مدل با عملکرد بالا برای تولید گفتار که منحصراً از طریق API پولی در دسترس است.
  • تنوع مدل‌ها: تاکنون ۵ مدل عرضه شده است: ۴ مدل تولید گفتار و ۱ مدل تبدیل گفتار به متن. ۳ مدل تولیدی همچنان متن‌باز هستند.

پذیرش سازمانی نیز در حال پیشرفت است. سازمان‌هایی مانند HeyGen، Sanas و Plaud از این پلتفرم استفاده می‌کنند. Rissa Cao، مدیرعامل شرکت، اشاره کرد که HeyGen به دنبال واقع‌گرایی برای آواتارهای هوش مصنوعی است، در حالی که شرکت‌های عامل‌های صوتی مانند LiveKit برای تماس‌ها به صداهای طبیعی با تأخیر بسیار کم نیاز دارند. این رویکرد در راستای تبدیل ابزارهای تولید محتوا به سیستم‌های سنجش و تحلیل است، مشابه آنچه شرکت Synthesia با تحلیل داده‌های رفتاری در آموزش‌های سازمانی پیاده کرده است.

در حالی که سازندگان از طرح‌های ماهانه برای شبیه‌سازی صدا (Voice Cloning) استفاده می‌کنند، سازمان‌ها برای تولید انبوه و واقع‌گرایانه از APIها بهره می‌برند.

تضاد در بحث رضایت کاربران

مسیر رشد بدون چالش نبوده است. Fish Audio کتابخانه خود را با درخواست ارسال صدا از کاربران و پرداخت وجه به آن‌ها رشد داد. با این حال، برخی سازندگان ادعا کردند صداهایشان بدون اجازه آپلود شده است. اگرچه فرآیند حذف محتوا (DMCA) وجود داشت، اما بسیار کند بود.

در پاسخ به این انتقادات، Rissa Cao اعلام کرد که اکنون فرآیند حذف محتوا را خودکار کرده‌اند. سازندگان می‌توانند با ارسال یک نمونه صوتی کوتاه یا قرارداد مالکیت، ثابت کنند که صاحب صدا هستند. در این صورت، صدای آن‌ها در کمتر از ۳ دقیقه از پلتفرم حذف خواهد شد.

این تنش‌ها نشان‌دهنده فشار روینده در بازار صدای هوش مصنوعی است. Oskue Honda از Coreline Ventures معتقد است مدل‌های جامعه‌محور تنها زمانی پایدار می‌مانند که سازندگان از طریق مالکیت تأییدشده و اشتراک درآمد شفاف به پلتفرم اعتماد کنند.

چشم‌انداز راهبردی

این شرکت که پیش‌تر به عنوان یک پروژه متن‌باز بهینه عمل می‌کرد، این ۵۰ میلیون دلار را برای توسعه مدل‌های پیشرفته‌تر و پاسخ به تقاضای فزاینده سازمان‌ها جذب کرد. در این دور سرمایه‌گذاری، مجموعه‌هایی چون 359 Capital, Parable و HF0 نیز مشارکت داشتند.

برای کاربر نهایی، این تغییر یعنی هوش مصنوعی صوتی از حالت «کاربردی» به حالت «اجراگر» تبدیل می‌شود. شما دیگر فقط یک صدا را انتخاب نمی‌کنید، بلکه یک اجرا را کارگردانی می‌کنید. Rico Mallozzi از 359 Capital باور دارد که این کنترل‌های ریزدانه و آموزش کم‌هزینه، Fish Audio را قادر می‌سازد تا با آزمایشگاه‌های بزرگ هوش مصنوعی رقابت کند.

Fish Audio قصد دارد تا پایان سال جاری میلادی، یک مدل درک صوتی و یک مدل تبدیل گفتار به گفتار (Speech-to-Speech) عرضه کند. این اقدام آن‌ها را در رقابت مستقیم با رقبایی چون ElevenLabs، WellSaid و Cartesia قرار می‌دهد.

گام بعدی شما

  • اگر توسعه‌دهنده بازی یا محتوا هستید، مدل متن‌باز Fish Speech را در گیت‌هاب بررسی کنید تا تفاوت کنترل احساسات را ببینید.
  • برای کسب‌وکارهای خدماتی، بررسی API مدل S2.1 Pro برای کاهش تأخیر در پاسخگویی صوتی توصیه می‌شود.
  • اگر از شبیه‌سازی صدای خود استفاده می‌کنید، پروتکل جدید حذف سریع محتوا در این پلتفرم را مطالعه کنید.

اما داستان رقابت در لایه زیرساختی و کاهش هزینه استنتاج حتی پیچیده‌تر است — به تحلیل ما درباره رقابت ElevenLabs و مدل‌های بازمتن مراجعه کنید.

چرا این موضوع مهم است؟

این تحول بر اساس تجربه عملی در تولید محتوا، فاصله بین صدای رباتیک و انسانی را از طریق کنترل متغیرهای احساسی می‌پوشاند. اعتبار این رویکرد با جذب سرمایه سنگین و پذیرش توسط شرکت‌های پیشرو مانند HeyGen تأیید شده است.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به نسخه‌های Pro برای توسعه‌دهندگان ایرانی دشوار است، اما مدل‌های متن‌باز این پروژه فرصتی ایده‌آل برای پژوهشگران ایرانی در حوزه پردازش گفتار است.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از «تولید صدا» به «کارگردانی صدا» نشان می‌دهد که اشباع در کیفیت پایه صداها رخ داده و حالا میدان نبرد روی کنترل‌های ریزدانه (Fine-grained controls) است. رقابت واقعی Fish Audio نه با ElevenLabs در کیفیت، بلکه در ارائه ابزارهایی است که سازنده را به جای کاربر، در جایگاه کارگردان قرار دهد. این رویکرد احتمالاً مدل‌های صوتی را از ابزارهای ساده‌ی تبدیل متن به گفتار، به موتورهای اجرای نمایشی تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.