پرش به محتوای اصلی
پرش به محتوای مقاله

YuE2 در برابر Suno v5؛ برتری برنامه‌ریزی نمادین در بنچمارک WildSongBench

·۲۰ شهریور ۱۴۰۵۳ دقیقه مطالعه۳ بازدید
موزیک‌ساز هوشمند YuE2 با برنامه‌ریزی نمادین: آهنگ‌سازی پیشگامانه با کنترل ساختاری دقیق
موزیک‌ساز هوشمند YuE2 با برنامه‌ریزی نمادین: آهنگ‌سازی پیشگامانه با کنترل ساختاری دقیق
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از تولید مستقیم صوت (Audio Generation) به برنامه‌ریزی نمادین (Symbolic Planning) که امکان ویرایش تک‌تک نت‌ها را بدون نیاز به تولید مجدد کل آهنگ فراهم می‌کند.

تصور کنید به‌جای اینکه برای تغییر یک نت در آهنگ، کل قطعه را دوباره ضبط کنید، مستقیماً روی کاغذ موسیقی آن نت را پاک کرده و عوض کنید. این دقیقاً همان تغییری است که YuE2 در دنیای تولید موسیقی ایجاد کرده است.

طبق گزارش منتشرشده در map-yue2.github.io، مدل YuE2 با کسب امتیاز ۶.۹۶۳۲ در محک SongBench، بالاترین میانگین را در میان ۱۵ تنظیمات مختلف WildSongBench تا تاریخ ۱۱ سپتامبر ۲۰۲۶ ثبت کرد. این عدد نشان می‌دهد که YuE2 توانسته است مدل Suno v5 را که امتیاز ۶.۸۷۲۱ را کسب کرده بود، پشت سر بگذارد. این ارزیابی بر اساس ۱۹۲ پرامپت انجام شد و در حالت «بهترین از ۸» (Bo8)، برترین خروجی بر اساس معیارهایی مثل موسیقایی بودن، کنترل پرامپت و دقت متن ترانه انتخاب شد.

بیشتر مدل‌های موسیقی، صدا را به‌عنوان یک سیگنال خام می‌بینند، اما YuE2 با آن مانند یک نقشه ساختاریافته برخورد می‌کند. تصور کنید تفاوت بین یک فایل صوتی ضبط‌شده و یک صفحه نت چیست؛ در حالت دوم، شما کنترل کاملی روی ملودی، ریتم و آکوردها دارید و می‌توانید بدون ضبط مجدد کل ترک، یک نت واحد را تغییر دهید. همان‌طور که در تحلیل قبلی ما درباره‌ی کاهش تخلفات سیاستی در رباتیک از طریق برنامه‌ریزی عصبی-نمادین اشاره کردیم، YuE2 نیز منطق مشابهی را در هنر پیاده کرده است.

به نقل از مستندات فنی، این سیستم با جداسازی «ترکیب‌بندی» (نمادها) از «اجرا» (صوت)، امکان ویرایش عامل‌محور (Agentic) را فراهم می‌کند. در این حالت، آهنگ از طریق یک گفتگو بین کاربر و هوش مصنوعی تکامل می‌یابد و مدل مانند یک دستیار هوشمند عمل می‌کند. این رویکرد یادآور تلاش‌های شرکت رولند است که با معرفی Melody Flip، تولید لوپ‌های MIDI را به هوش مصنوعی سپرد تا کنترل دقیق‌تری بر اجزای موسیقی فراهم شود.

موتور فنی سیستم

این سامانه برای پر کردن شکاف بین صوت و نت‌نویسی، بر سه رکن اصلی استوار است:

  • YuE2: مدل اصلی با ۳.۵۹ میلیارد پارامتر (Parameters) و ۲۸ لایه که از قابلیت‌های خلق، کاور (Cover) و ویرایش پشتیبانی می‌کند. متخصصان AR (خودبازگشتی) و NAR (غیرخودبازگشتی) در این مدل، محاسبات Attention مشترکی دارند اما از نرمال‌سازی، پروژکشن‌ها و MLPهای مجزا استفاده می‌کنند.
  • MERT2: یک مدل بازنمایی که با استفاده از یک فرانت‌اند ConvNeXt و یک Conformer ۲۴ لایه، کدهای ماسک‌شده را از ویژگی‌های مکمل MuQ و Qwen2-Audio پیش‌بینی می‌کند. این مدل در ۱۴ مورد از ۱۵ معیار MARBLE، از جمله دقت ۹۱.۷۲٪ در تشخیص ژانر (GTZAN) و دقت ۶۷.۰۵٪ در تشخیص کلید موسیقی (GiantSteps)، رکورد جدیدی (SOTA) ثبت کرد.
  • SheetSage2: ابزاری برای تبدیل ضبط‌های صوتی به نت‌های قابل ویرایش (Lead Sheets). این ابزار از یک انکودر MERT2-FS برای کل آهنگ که با LoRA سازگار شده و یک دکودر خودبازگشتی شش لایه استفاده می‌کند. این مدل در ۱۰ مورد از ۱۳ معیار بنچمارک به SOTA رسید، از جمله دقت ۹۰.۰۸٪ در تشخیص آکورد (osu2017) و ۸۲.۵۱٪ برای نت‌های کلاس گام ملودی وکال (RWC-Pop).

معماری و سازوکارها

جریان کاری این سیستم، یک نت قابل ویرایش را به توکن‌های (Tokens) معنایی، نهان‌های صوتی و در نهایت فایل صوتی تبدیل می‌کند. در این میان، MERT2 بازنمایی‌های زیربنایی را فراهم می‌کند و شاخه Causal آن به‌عنوان توکن‌ساز معنایی با فرکانس ۲۵ هرتز برای YuE2 عمل می‌کند.

مدل SheetSage2 شش وظیفه اصلی شامل ضرب‌آهنگ (Beat)، ضرب‌آهنگ ابتدایی (Downbeat)، کلید (Key)، آکورد (Chord)، ساختار (Structure) و ملودی (Melody) را مدیریت می‌کند و صوت را به فرمت ABC تبدیل می‌کند که دارای بخش‌های مجزا برای صدای خواننده و سازها است. این نت‌ها سپس به‌عنوان اهداف آموزشی نمادین برای YuE2 استفاده می‌شوند.

داده‌ها و آموزش

بر اساس بررسی منابع، این مدل‌ها در مقیاسی عظیم با استفاده از موسیقی‌های CC0 و داده‌های سنتتیک لایسنس‌دار از Tokenwave.AI آموزش دیده‌اند. حجم داده‌های آموزشی بسیار قابل توجه است:

  • MERT2: ۷۰۰ هزار ساعت داده (که در آن MERT2-30s از کانتکست ۳۰ ثانیه‌ای و MERT2-FS از کانتکست ۳۰۰ ثانیه‌ای استفاده می‌کند).
  • YuE2: ۳۴۶ هزار ساعت داده.
  • SheetSage2: ۲۸.۴ هزار ساعت داده.

برای یک سازنده موسیقی، این یعنی «جعبه سیاه» هوش مصنوعی در حال باز شدن است. دیگر لازم نیست پرامپت بنویسید و دعا کنید نتیجه خوب شود؛ حالا می‌توانید مستقیماً روی نت‌های نمادین زیربنایی تغییر ایجاد کنید تا یک آکورد خاص را اصلاح یا یک خط ملودی را تغییر دهید.

این گذار از تولید صرفِ صوت به دست‌کاری نمادین، نقش هوش مصنوعی را از یک «دستگاه پخش موسیقی» (Jukebox) به یک «همکار» تغییر می‌دهد. این فناوری صنعت را به ادغام با ایستگاه‌های کاری دیجیتال (DAW) نزدیک‌تر می‌کند؛ جایی که هوش مصنوعی تغییرات ساختاری را پیشنهاد می‌دهد و آهنگساز انسانی می‌تواند آن‌ها را به‌صورت بصری بخواند و اصلاح کند.

چه یک آماتور باشید و چه یک تهیه‌کننده حرفه‌ای، توانایی جابه‌جایی بین یک ضبط صوتی و یک نت قابل ویرایش، بزرگ‌ترین نقطه اصطکاک در موسیقی AI، یعنی نبود کنترل دقیق (Granular Control) را از بین می‌برد.

باید منتظر ماند و دید که این توکن‌های نمادین چگونه با نرم‌افزارهای نت‌نویسی موجود ادغام می‌شوند؛ این امر پتانسیل آن را دارد که تبدیل لحظه‌ای اجراهای زنده به نت‌های حرفه‌ای را خودکار کند.

گام بعدی شما

  • اگر موزیسین هستید، بررسی کنید که چگونه تبدیل صوت به فرمت ABC می‌تواند در آرشیو کردن آثار قدیمی‌تان کمک کند.
  • منتظر ادغام این توکن‌های نمادین با نرم‌افزارهای نت‌نویسی استاندارد باشید تا تبدیل لحظه‌ای اجرای زنده به نت محقق شود.
  • مدل‌های بازنمایی مثل MERT2 را برای تحلیل‌های دقیق‌تر ژانر در پروژه‌های خود به کار بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار بنچمارک SongBench، نشان می‌دهد که کنترل ساختاری بر خروجی‌های مولد، کلید ورود هوش مصنوعی به استودیوهای حرفه‌ای است. این تغییر باعث می‌شود AI از یک ابزار تفننی به یک ابزار تولیدی در صنعت موسیقی تبدیل شود.

تأثیر برای ایران

این مدل برای آهنگسازان و تهیه‌کنندگان ایرانی که به دنبال کنترل دقیق روی ملودی‌ها هستند، فرصتی برای ادغام AI در گردش‌کار حرفه‌ای فراهم می‌کند، هرچند دسترسی به زیرساخت‌های آموزشی آن محدود است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی سیگنال خام با برنامه‌ریزی نمادین، نقطه پایان دوران «شانس» در تولید موسیقی با AI است. این رویکرد در واقع مدل را از یک تقلیدگر صوتی به یک درک‌کننده ساختار تبدیل می‌کند که اجازه می‌دهد کنترل خلاقانه دوباره به دست انسان برگردد. احتمالاً شاهد موجی از ابزارهای ویرایشگر خواهیم بود که لایه صوتی را به لایه نمادین متصل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.