پرش به محتوای اصلی
پرش به محتوای مقاله

Suno: یک مدل واحد برای تولید موزیک و دیالوگ

·۱۰ مهر ۱۴۰۵۴ دقیقه مطالعه
لوگوی شرکت Suno با عنوان «Speech Beta» و شعار «صدای شما، موسیقی شما»
لوگوی شرکت Suno با عنوان «Speech Beta» و شعار «صدای شما، موسیقی شما»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل تجاری که گفتار و موسیقی را نه به‌صورت دو لایه مجزا، بلکه در یک برداشت واحد و هماهنگ تولید می‌کند؛ این یعنی مدل از ابتدا می‌داند موسیقی باید با لحن صدا هم‌راستا باشد.

تصور کنید تنها با یک دستور متنی، هم صدای گوینده و هم موسیقی متنِ متناسب با آن، در یک برداشتِ واحد خلق شوند. شرکت Suno در ۱ اکتبر ۲۰۲۶ با معرفی مدل Speech (نسخه بتا)، این رویا را به واقعیت تبدیل کرد و از تولید موسیقیِ صرف به سمت یک تجربه صوتی یکپارچه حرکت کرد.

این تحول در زمانی رخ می‌دهد که هوش مصنوعی زاینده (Generative AI) — شبیه به یک هنرمند همه‌فن‌حریف که هم نقاشی می‌کند و هم می‌سراید — از ابزارهای تک‌منظوره به سمت سامانه‌های چندوجهی (Multimodal) — مدلی که هم‌زمان متن، عکس و صدا را می‌فهمد، مثل ما که با چند حس دنیا را می‌خوانیم — حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی عامل‌های Holo4 و کنترل رابط‌های گرافیکی و APIها در یک مدل واحد اشاره کردیم، Suno نیز فلسفه «همه-در-یک» را در هنر به کار گرفته است. برای یک کاربر عادی، این تغییر مثل این است که به‌جای استفاده از یک ضبط‌صوت جداگانه و یک نرم‌افزار تدوین موسیقی، یک کارگردان هوشمند داشته باشید که زمان‌بندی و حس هر دو را هم‌زمان مدیریت کند.

به نقل از پست وبلاگی جک برودی، مدیر ارشد محصول Suno، این سیستم به کاربران اجازه می‌دهد متنی مانند یک شعر، یک فیلم‌نامه یا هر نوشته‌ای را وارد کرده و سپس صدا و سبک موسیقی مورد نظر خود را توصیف کنند. مدل در نهایت این دو عنصر را در قالب یک قطعه صوتی منسجم ترکیب و سنتز می‌کند. این نسخه بتا پس از یک ماه آزمایش محدود با گروه کوچکی از کاربران، اکنون برای تمام کاربران در پلتفرم‌های وب و موبایل در دسترس است.

چشم‌انداز سرگرمی خلاق

Suno این محصول را در دسته‌ای به نام «سرگرمی خلاق» قرار می‌دهد. بر اساس اعلام این شرکت، این حوزه موج بعدی فناوری‌های مصرف‌کننده را تعریف خواهد کرد. برودی اشاره کرد که اگرچه موسیقی هسته اصلی توسعه Suno است، اما چشم‌انداز آن‌ها فراتر از این است و تمام اشکال بیان انسانی را در بر می‌گیرد.

مدل Speech به عنوان بوم جدیدی برای خلق آثار شخصی طراحی شده است؛ آثاری که جامعه کاربران Suno پیش از این نیز تولید می‌کردند. این کاربردها شامل تولید محتوای صوتی برای جشن‌های تولد، مراسم عروسی، شوخی‌های درونی میان دوستان، محتوای مربوط به ایمان و عبادت، و همچنین محتوای ویژه برای دوستان و کودکان است.

کاربردهای عملی و قابلیت‌ها

طبق گزارش Suno، برخی از کاربردهای پیشنهادی برای این مدل در نسخه بتا عبارت‌اند از:

  • قصه‌های شب برای کودکان که با موسیقی ملایم پیانو همراه شده است.
  • سخنرانی‌های انگیزشی و پرانرژی (Hype Speeches) که با صدای طبل‌های استادیومی پشتیبانی می‌شوند.
  • لیست‌های خرید به سبک ASMR که با صداهای محیطی آرام‌بخش ترکیب شده‌اند.

تیم توسعه در مراحل آزمایشی و غیررسمی، مدل را به روش‌های مختلف تست کردند. آن‌ها پیام‌های متنی دوستان خود را به خوانش‌های دراماتیک تبدیل کردند، برای یادداشت‌های صوتی معمولی موسیقی‌های حماسی افزودند و قطعاتی برای مدیتیشن، شعرخوانی و سخنرانی‌های انگیزشی ساختند. این رویکرد در تبدیل متن به صدا، یادآور تلاش‌های شرکت ElevenLabs است که با تمرکز بر صدای برند، توصیفات متنی محصولات را برای ارتقای دسترسی‌پذیری در تجارت الکترونیک به صدا تبدیل می‌کند.

تکامل فنی در سال ۲۰۲۶

مدل Speech آخرین حلقه از به‌روزرسانی‌های سریع سال ۲۰۲۶ است. در ۹ سپتامبر ۲۰۲۶، این شرکت مدل v6 را عرضه کرد؛ نسلی از مدل‌های موسیقی که با همکاری شرکای استراتژیکی چون Warner Music Group، BMG و Believe توسعه یافته است.

خانواده v6 شامل مدل پرچم‌دار v6، نسخه آزمایشی v6-wild (که هر دو مخصوص مشترکین Pro و Premier هستند) و نسخه بهینه v6-mini است که برای همه کاربران در دسترس است. این مدل‌ها امکانات پیشرفته‌ای را فراهم می‌کنند:

  • ویرایش بخش‌های خاص آهنگ با استفاده از زبان ساده و دستورات متنی.
  • ساخت مش‌آپ (Mashup) از چندین منبع مختلف تنها در یک درخواست.
  • نمونه‌برداری (Sample) و جداسازی صداها برای ساخت یک بیت جدید در یک جریان کاری واحد.
  • تولید موسیقی از طریق متن، صدا، تصویر و ویدیو.
  • به‌روزرسانی یک تکه از متن ترانه بدون نیاز به تولید مجدد کل آهنگ؛ برای مثال، تغییر یک هم‌سرایی به گونه‌ای که توسط یک گروه گاسپل خوانده شود.

برای بهبود این ابزارها، Suno هر هفته کمپ‌های نویسندگی با ترانه‌سرایان، تهیه‌کنندگان و هنرمندان برگزار می‌کند. همچنین حفاظ‌های امنیتی برای بررسی متون و صداهای آپلودشده جهت جلوگیری از استفاده‌های غیرمجاز ایجاد شده است. با گسترش v6، شرکت قصد دارد مدل‌های قدیمی را بازنشسته کرده و کل پلتفرم را به نسل v6 منتقل کند. علاوه بر این، Suno در حال توسعه تجربه‌های «اختیاری» (Opt-in) است که در آن هنرمندان می‌توانند تصمیم بگیرند در سیستم مشارکت کنند و در ازای آن دستمزد دریافت نمایند.

پیش از این، در ۲۶ مارس ۲۰۲۶، Suno مدل v5.5 را معرفی کرد که قابلیت Voices (امکان آپلود صدای کاربر) و مدل‌های سفارشی (Custom Models) را به ارمغان آورد. مدل‌های سفارشی اجازه می‌دادند کاربر بر اساس حداقل شش قطعه از کاتالوگ صوتی خود، مدل را شخصی‌سازی کند. همچنین قابلیت My Taste معرفی شد که سلیقه کاربر در مورد مودها و ژانرهای مورد علاقه‌اش را یاد می‌گیرد. قابلیت Voices در ۸ اوت ۲۰۲۶ به iOS و اندروید رسید و به کاربران اجازه داد صدای خود را یک‌بار ضبط کرده و آن را روی هر آهنگی اعمال کنند.

در ۱۳ اوت ۲۰۲۶، محیط کاری مرورگر با معرفی Studio 2.0 بازسازی شد و قابلیت‌های ویرایش MIDI، افکت‌های صوتی و سینتی‌سایزرهای داخلی برای مشترکین Premier اضافه گردید. در ۱۷ سپتامبر ۲۰۲۶ نیز به‌روزرسانی‌های بیشتری برای بهبود سرعت و دقت تبدیل MIDI به صدا (Transcription) ارائه شد.

با این حال، Suno هشدار می‌دهد که نسخه بتای Speech هنوز نقص‌هایی دارد. برای مثال، ممکن است یک لهجه بریتانیایی ناگهان به لهجه استرالیایی تغییر کند یا مکث‌های دراماتیک گاهی «بیش از حد دراماتیک» شوند. این محدودیت‌ها در ابتدای مسیر تولید صدای زاینده، جایی که حفظ هویت صوتی ثابت در طول زمان یک چالش است، رایج است. Suno اشاره کرد که احتمالاً کاربران کاربردهایی را کشف خواهند کرد که تیم توسعه هرگز تصور نمی‌کرد، و این هدف اصلی عرضه نسخه بتا است.

برای یک تولیدکننده محتوا، این یعنی دیوار میان «گوینده» و «موسیقی متن» فرو ریخته است. دیگر نیازی به همگام‌سازی دستی صدا و موسیقی در نرم‌افزارهای پیچیده (DAW) نیست؛ هوش مصنوعی هم‌زمان ضرب‌آهنگ موسیقی و لحن احساسی گفتار را مدیریت می‌کند.

این حرکت نشان‌دهنده قصد Suno برای تسلط بر بازار «سرگرمی خلاق» است. با ادغام گفتار، این شرکت بازار گسترده‌تری از داستان‌گویان، پادکسترها و سازندگان شبکه‌های اجتماعی را هدف قرار داده است؛ کسانی که به محتوای صوتی با کیفیت تولید استودیویی اما بدون بودجه‌های کلان نیاز دارند.

باید منتظر ماند و دید Suno چگونه مدل‌های پرداخت اختیاری هنرمندان را با این خلق‌های مبتنی بر گفتار ادغام می‌کند، زیرا همین موضوع تعیین خواهد کرد که آیا گویندگان حرفه‌ای و موسیقی‌دانان این ابزار را یک تهدید می‌بینند یا یک منبع درآمد جدید.

گام بعدی شما

  • اگر پادکستر یا تولیدکننده ویدیو هستید، از مدل Speech برای ساخت مقدمه‌های صوتی (Intro) با موسیقی متنی هماهنگ استفاده کنید.
  • قابلیت‌های v6-mini را برای تست سریع ایده‌های موسیقیایی بدون هزینه زیاد امتحان کنید.
  • تغییرات در مدل‌های پرداخت هنرمندان را دنبال کنید تا متوجه شوید این ابزار برای متخصصان صدا، منبع درآمد است یا تهدید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف نیاز به مهندسی صدا برای محتواهای کوتاه، هزینه تولید محتوای صوتی باکیفیت را به شدت کاهش می‌دهد. اعتبار این ادعا از همکاری Suno با مجموعه‌هایی چون Warner Music Group تأیید می‌شود که نشان از پذیرش صنعتی این ابزار دارد.

تأثیر برای ایران

این ابزار فرصتی استثنایی برای تولیدکنندگان محتوای فارسی‌زبان در شبکه‌های اجتماعی است تا بدون نیاز به استودیو، پادکست‌ها و ویدیوهای خود را با موسیقی متنی حرفه‌ای و هماهنگ تجهیز کنند.

·نگاه ما
تحریریه دات‌هوش

ادغام گفتار و موسیقی در یک مرحله، پایان عصر «تدوین لایه‌ای» در تولیدات صوتی ساده است. به نظر ما، Suno با این کار در حال تبدیل شدن از یک ابزار تولید موسیقی به یک «استودیوی مجازی» است که در آن مفهوم زمان‌بندی (Timing) از یک عملیات فنی به یک دستور متنی تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.