تصور کنید به جای انتخاب یک صدای پیشفرض، بتوانید دقیقاً مشخص کنید که مدل هوش مصنوعی در کدام کلمه فریاد بزند یا کجا با نجوا صحبت کند. این همان شکافی است که Fish Audio قصد دارد با کنترل جراحیگونه روی احساسات و لحن، آن را پر کند.
به گزارش TechCrunch، شرکت Fish Audio مستقر در پالو آلتو، روز سهشنبه اعلام کرد که در یک دور جذب سرمایه Seed، مبلغ ۵۰ میلیون دلار از سرمایهگذاران پیشرو نظیر Coreline Ventures و Capital Today دریافت کرده است.
اکثر صداهای مصنوعی فعلی در دو تله میافتند: یا برای روایتهای خلاقانه بیش از حد یکنواختاند یا برای استفادههای شرکتی غیرقابلپیشبینی هستند. برای یک استودیوی بازیسازی، صدا باید بتواند جیغ بزند یا پچپچ کند؛ اما برای یک بات خدمات مشتری، این صدا باید قابل کنترل و با کمترین تأخیر (Latency) باشد. این تفاوت درست مثل تفاوت بین یک پیانو دیجیتال ساده و اجرای زنده یک ارکستر است. این تمرکز بر کاهش تأخیر در پاسخگویی صوتی، یادآور استراتژی استارتاپ Gradium در جذب سرمایه اخیرش برای حذف تأخیرهای آزاردهنده است که هدفش بهینهسازی زیرساختهای صوتی است.
همانطور که در تحلیلهای پیشین ما دربارهی تکامل مدلهای مولد اشاره کردیم، صنعت اکنون از «تولید صرف» به سمت «کنترل دقیق» حرکت میکند. هوش مصنوعی زاینده (Generative AI) — که شبیه نقاشی با رنگهای جادویی است که هر چه توصیف کنید میکشد — در حوزه صوت نیز اکنون به دنبال دستوری است که بتواند احساسات را مدیریت کند.
تقاضای بازار و مقیاس رشد
این شرکت دو نیاز متمایز را هدف قرار داده است: کاربردهای خلاقانه که نیاز به بیانگری بالا دارند و سازمانهایی که برای اتوماسیون فروش و پشتیبانی به مدلهای قابل هدایت نیاز دارند. برای پاسخ به این نیازها، Fish Audio کتابخانهای شامل بیش از ۱۵ هزار کنترل با زبان طبیعی ارائه داده است.
این استارتآپ از زمان عرضه در سال گذشته رشد سریعی داشته و طبق اعلام شرکت، بیش از ۸ میلیون کاربر در نسخههای متنباز و میزبانیشده دارد. این رشد سریع منجر به دستیابی به ۲۱ میلیون دلار درآمد سالانه تکرارشونده (ARR) شده است.
اکوسیستم محصول و Traction
زیرساخت فنی شرکت بر پایه چندین عرضه کلیدی در سال گذشته است:
- Fish Speech: یک پروژه متنباز که توسط Shijia Liao، پژوهشگر سابق انویدیا، آغاز شد. او این مدل را روی یک تک GPU آموزش داد تا صدای مصنوعیِ بیروح را به چالش بکشد. این مخزن اکنون بیش از ۳۱ هزار ستاره در گیتهاب دارد و توسط توسعهدهندگان مستقل و طراحان بازی استفاده میشود.
- S2.1 Pro: جدیدترین مدل با عملکرد بالا برای تولید گفتار که منحصراً از طریق API پولی در دسترس است.
- تنوع مدلها: تاکنون ۵ مدل عرضه شده است: ۴ مدل تولید گفتار و ۱ مدل تبدیل گفتار به متن. ۳ مدل تولیدی همچنان متنباز هستند.
پذیرش سازمانی نیز در حال پیشرفت است. سازمانهایی مانند HeyGen، Sanas و Plaud از این پلتفرم استفاده میکنند. Rissa Cao، مدیرعامل شرکت، اشاره کرد که HeyGen به دنبال واقعگرایی برای آواتارهای هوش مصنوعی است، در حالی که شرکتهای عاملهای صوتی مانند LiveKit برای تماسها به صداهای طبیعی با تأخیر بسیار کم نیاز دارند. این رویکرد در راستای تبدیل ابزارهای تولید محتوا به سیستمهای سنجش و تحلیل است، مشابه آنچه شرکت Synthesia با تحلیل دادههای رفتاری در آموزشهای سازمانی پیاده کرده است.
در حالی که سازندگان از طرحهای ماهانه برای شبیهسازی صدا (Voice Cloning) استفاده میکنند، سازمانها برای تولید انبوه و واقعگرایانه از APIها بهره میبرند.
تضاد در بحث رضایت کاربران
مسیر رشد بدون چالش نبوده است. Fish Audio کتابخانه خود را با درخواست ارسال صدا از کاربران و پرداخت وجه به آنها رشد داد. با این حال، برخی سازندگان ادعا کردند صداهایشان بدون اجازه آپلود شده است. اگرچه فرآیند حذف محتوا (DMCA) وجود داشت، اما بسیار کند بود.
در پاسخ به این انتقادات، Rissa Cao اعلام کرد که اکنون فرآیند حذف محتوا را خودکار کردهاند. سازندگان میتوانند با ارسال یک نمونه صوتی کوتاه یا قرارداد مالکیت، ثابت کنند که صاحب صدا هستند. در این صورت، صدای آنها در کمتر از ۳ دقیقه از پلتفرم حذف خواهد شد.
این تنشها نشاندهنده فشار روینده در بازار صدای هوش مصنوعی است. Oskue Honda از Coreline Ventures معتقد است مدلهای جامعهمحور تنها زمانی پایدار میمانند که سازندگان از طریق مالکیت تأییدشده و اشتراک درآمد شفاف به پلتفرم اعتماد کنند.
چشمانداز راهبردی
این شرکت که پیشتر به عنوان یک پروژه متنباز بهینه عمل میکرد، این ۵۰ میلیون دلار را برای توسعه مدلهای پیشرفتهتر و پاسخ به تقاضای فزاینده سازمانها جذب کرد. در این دور سرمایهگذاری، مجموعههایی چون 359 Capital, Parable و HF0 نیز مشارکت داشتند.
برای کاربر نهایی، این تغییر یعنی هوش مصنوعی صوتی از حالت «کاربردی» به حالت «اجراگر» تبدیل میشود. شما دیگر فقط یک صدا را انتخاب نمیکنید، بلکه یک اجرا را کارگردانی میکنید. Rico Mallozzi از 359 Capital باور دارد که این کنترلهای ریزدانه و آموزش کمهزینه، Fish Audio را قادر میسازد تا با آزمایشگاههای بزرگ هوش مصنوعی رقابت کند.
Fish Audio قصد دارد تا پایان سال جاری میلادی، یک مدل درک صوتی و یک مدل تبدیل گفتار به گفتار (Speech-to-Speech) عرضه کند. این اقدام آنها را در رقابت مستقیم با رقبایی چون ElevenLabs، WellSaid و Cartesia قرار میدهد.
گام بعدی شما
- اگر توسعهدهنده بازی یا محتوا هستید، مدل متنباز Fish Speech را در گیتهاب بررسی کنید تا تفاوت کنترل احساسات را ببینید.
- برای کسبوکارهای خدماتی، بررسی API مدل S2.1 Pro برای کاهش تأخیر در پاسخگویی صوتی توصیه میشود.
- اگر از شبیهسازی صدای خود استفاده میکنید، پروتکل جدید حذف سریع محتوا در این پلتفرم را مطالعه کنید.
اما داستان رقابت در لایه زیرساختی و کاهش هزینه استنتاج حتی پیچیدهتر است — به تحلیل ما درباره رقابت ElevenLabs و مدلهای بازمتن مراجعه کنید.




گفتگو