تصور کنید تنها با یک دستور متنی، هم صدای گوینده و هم موسیقی متنِ متناسب با آن، در یک برداشتِ واحد خلق شوند. شرکت Suno در ۱ اکتبر ۲۰۲۶ با معرفی مدل Speech (نسخه بتا)، این رویا را به واقعیت تبدیل کرد و از تولید موسیقیِ صرف به سمت یک تجربه صوتی یکپارچه حرکت کرد.
این تحول در زمانی رخ میدهد که هوش مصنوعی زاینده (Generative AI) — شبیه به یک هنرمند همهفنحریف که هم نقاشی میکند و هم میسراید — از ابزارهای تکمنظوره به سمت سامانههای چندوجهی (Multimodal) — مدلی که همزمان متن، عکس و صدا را میفهمد، مثل ما که با چند حس دنیا را میخوانیم — حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی عاملهای Holo4 و کنترل رابطهای گرافیکی و APIها در یک مدل واحد اشاره کردیم، Suno نیز فلسفه «همه-در-یک» را در هنر به کار گرفته است. برای یک کاربر عادی، این تغییر مثل این است که بهجای استفاده از یک ضبطصوت جداگانه و یک نرمافزار تدوین موسیقی، یک کارگردان هوشمند داشته باشید که زمانبندی و حس هر دو را همزمان مدیریت کند.
به نقل از پست وبلاگی جک برودی، مدیر ارشد محصول Suno، این سیستم به کاربران اجازه میدهد متنی مانند یک شعر، یک فیلمنامه یا هر نوشتهای را وارد کرده و سپس صدا و سبک موسیقی مورد نظر خود را توصیف کنند. مدل در نهایت این دو عنصر را در قالب یک قطعه صوتی منسجم ترکیب و سنتز میکند. این نسخه بتا پس از یک ماه آزمایش محدود با گروه کوچکی از کاربران، اکنون برای تمام کاربران در پلتفرمهای وب و موبایل در دسترس است.
چشمانداز سرگرمی خلاق
Suno این محصول را در دستهای به نام «سرگرمی خلاق» قرار میدهد. بر اساس اعلام این شرکت، این حوزه موج بعدی فناوریهای مصرفکننده را تعریف خواهد کرد. برودی اشاره کرد که اگرچه موسیقی هسته اصلی توسعه Suno است، اما چشمانداز آنها فراتر از این است و تمام اشکال بیان انسانی را در بر میگیرد.
مدل Speech به عنوان بوم جدیدی برای خلق آثار شخصی طراحی شده است؛ آثاری که جامعه کاربران Suno پیش از این نیز تولید میکردند. این کاربردها شامل تولید محتوای صوتی برای جشنهای تولد، مراسم عروسی، شوخیهای درونی میان دوستان، محتوای مربوط به ایمان و عبادت، و همچنین محتوای ویژه برای دوستان و کودکان است.
کاربردهای عملی و قابلیتها
طبق گزارش Suno، برخی از کاربردهای پیشنهادی برای این مدل در نسخه بتا عبارتاند از:
- قصههای شب برای کودکان که با موسیقی ملایم پیانو همراه شده است.
- سخنرانیهای انگیزشی و پرانرژی (Hype Speeches) که با صدای طبلهای استادیومی پشتیبانی میشوند.
- لیستهای خرید به سبک ASMR که با صداهای محیطی آرامبخش ترکیب شدهاند.
تیم توسعه در مراحل آزمایشی و غیررسمی، مدل را به روشهای مختلف تست کردند. آنها پیامهای متنی دوستان خود را به خوانشهای دراماتیک تبدیل کردند، برای یادداشتهای صوتی معمولی موسیقیهای حماسی افزودند و قطعاتی برای مدیتیشن، شعرخوانی و سخنرانیهای انگیزشی ساختند. این رویکرد در تبدیل متن به صدا، یادآور تلاشهای شرکت ElevenLabs است که با تمرکز بر صدای برند، توصیفات متنی محصولات را برای ارتقای دسترسیپذیری در تجارت الکترونیک به صدا تبدیل میکند.
تکامل فنی در سال ۲۰۲۶
مدل Speech آخرین حلقه از بهروزرسانیهای سریع سال ۲۰۲۶ است. در ۹ سپتامبر ۲۰۲۶، این شرکت مدل v6 را عرضه کرد؛ نسلی از مدلهای موسیقی که با همکاری شرکای استراتژیکی چون Warner Music Group، BMG و Believe توسعه یافته است.
خانواده v6 شامل مدل پرچمدار v6، نسخه آزمایشی v6-wild (که هر دو مخصوص مشترکین Pro و Premier هستند) و نسخه بهینه v6-mini است که برای همه کاربران در دسترس است. این مدلها امکانات پیشرفتهای را فراهم میکنند:
- ویرایش بخشهای خاص آهنگ با استفاده از زبان ساده و دستورات متنی.
- ساخت مشآپ (Mashup) از چندین منبع مختلف تنها در یک درخواست.
- نمونهبرداری (Sample) و جداسازی صداها برای ساخت یک بیت جدید در یک جریان کاری واحد.
- تولید موسیقی از طریق متن، صدا، تصویر و ویدیو.
- بهروزرسانی یک تکه از متن ترانه بدون نیاز به تولید مجدد کل آهنگ؛ برای مثال، تغییر یک همسرایی به گونهای که توسط یک گروه گاسپل خوانده شود.
برای بهبود این ابزارها، Suno هر هفته کمپهای نویسندگی با ترانهسرایان، تهیهکنندگان و هنرمندان برگزار میکند. همچنین حفاظهای امنیتی برای بررسی متون و صداهای آپلودشده جهت جلوگیری از استفادههای غیرمجاز ایجاد شده است. با گسترش v6، شرکت قصد دارد مدلهای قدیمی را بازنشسته کرده و کل پلتفرم را به نسل v6 منتقل کند. علاوه بر این، Suno در حال توسعه تجربههای «اختیاری» (Opt-in) است که در آن هنرمندان میتوانند تصمیم بگیرند در سیستم مشارکت کنند و در ازای آن دستمزد دریافت نمایند.
پیش از این، در ۲۶ مارس ۲۰۲۶، Suno مدل v5.5 را معرفی کرد که قابلیت Voices (امکان آپلود صدای کاربر) و مدلهای سفارشی (Custom Models) را به ارمغان آورد. مدلهای سفارشی اجازه میدادند کاربر بر اساس حداقل شش قطعه از کاتالوگ صوتی خود، مدل را شخصیسازی کند. همچنین قابلیت My Taste معرفی شد که سلیقه کاربر در مورد مودها و ژانرهای مورد علاقهاش را یاد میگیرد. قابلیت Voices در ۸ اوت ۲۰۲۶ به iOS و اندروید رسید و به کاربران اجازه داد صدای خود را یکبار ضبط کرده و آن را روی هر آهنگی اعمال کنند.
در ۱۳ اوت ۲۰۲۶، محیط کاری مرورگر با معرفی Studio 2.0 بازسازی شد و قابلیتهای ویرایش MIDI، افکتهای صوتی و سینتیسایزرهای داخلی برای مشترکین Premier اضافه گردید. در ۱۷ سپتامبر ۲۰۲۶ نیز بهروزرسانیهای بیشتری برای بهبود سرعت و دقت تبدیل MIDI به صدا (Transcription) ارائه شد.
با این حال، Suno هشدار میدهد که نسخه بتای Speech هنوز نقصهایی دارد. برای مثال، ممکن است یک لهجه بریتانیایی ناگهان به لهجه استرالیایی تغییر کند یا مکثهای دراماتیک گاهی «بیش از حد دراماتیک» شوند. این محدودیتها در ابتدای مسیر تولید صدای زاینده، جایی که حفظ هویت صوتی ثابت در طول زمان یک چالش است، رایج است. Suno اشاره کرد که احتمالاً کاربران کاربردهایی را کشف خواهند کرد که تیم توسعه هرگز تصور نمیکرد، و این هدف اصلی عرضه نسخه بتا است.
برای یک تولیدکننده محتوا، این یعنی دیوار میان «گوینده» و «موسیقی متن» فرو ریخته است. دیگر نیازی به همگامسازی دستی صدا و موسیقی در نرمافزارهای پیچیده (DAW) نیست؛ هوش مصنوعی همزمان ضربآهنگ موسیقی و لحن احساسی گفتار را مدیریت میکند.
این حرکت نشاندهنده قصد Suno برای تسلط بر بازار «سرگرمی خلاق» است. با ادغام گفتار، این شرکت بازار گستردهتری از داستانگویان، پادکسترها و سازندگان شبکههای اجتماعی را هدف قرار داده است؛ کسانی که به محتوای صوتی با کیفیت تولید استودیویی اما بدون بودجههای کلان نیاز دارند.
باید منتظر ماند و دید Suno چگونه مدلهای پرداخت اختیاری هنرمندان را با این خلقهای مبتنی بر گفتار ادغام میکند، زیرا همین موضوع تعیین خواهد کرد که آیا گویندگان حرفهای و موسیقیدانان این ابزار را یک تهدید میبینند یا یک منبع درآمد جدید.
گام بعدی شما
- اگر پادکستر یا تولیدکننده ویدیو هستید، از مدل Speech برای ساخت مقدمههای صوتی (Intro) با موسیقی متنی هماهنگ استفاده کنید.
- قابلیتهای v6-mini را برای تست سریع ایدههای موسیقیایی بدون هزینه زیاد امتحان کنید.
- تغییرات در مدلهای پرداخت هنرمندان را دنبال کنید تا متوجه شوید این ابزار برای متخصصان صدا، منبع درآمد است یا تهدید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو