پرش به محتوای اصلی
پرش به محتوای مقاله

مدل MiniMax-Music3 آهنگ‌های پنج‌دقیقه‌ای با وزن‌های باز تولید می‌کند

·۲۷ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
مدل موسیقی متن‌باز MiniMax-Music3: تولید آهنگ کامل پنج‌دقیقه‌ای از متن و توضیح ساختاریافته
مدل موسیقی متن‌باز MiniMax-Music3: تولید آهنگ کامل پنج‌دقیقه‌ای از متن و توضیح ساختاریافته
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توانایی تولید آهنگ‌های کامل ۵ دقیقه‌ای با وزن‌های باز و حذف رمزگشای توکن‌ساز برای دستیابی به صدای پیوسته و طبیعی‌تر، وجه تمایز این مدل با نسخه‌های قبلی است.

تصور کنید یک آهنگساز مستقل باشید که بدون پرداخت هزینه‌های گزاف API، بتواند در چند ثانیه یک قطعه کامل پنج‌دقیقه‌ای با کیفیت استودیویی بسازد. این دیگر یک رویای دور نیست و MiniMax-Music3 دقیقاً همین قدرت را به سیستم‌های محلی می‌آورد. در حالی که اکثر ابزارهای صوتی هوش مصنوعی تنها به کلیپ‌های کوتاه محدود هستند، MiniMax-Music3 به سازندگان اجازه می‌دهد تنها با استفاده از متن ترانه و یک شرح ساختاریافته، آهنگ‌های کامل پنج‌دقیقه‌ای تولید کنند.

به نقل از مستندات منتشر شده در ۱۳ اوت ۲۰۲۶، این مدل با وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده تا هر کسی بتواند آن را روی سخت‌افزار خود اجرا کند — آهنگ‌هایی با فرمت WAV استریو، ۱۶ بیتی و فرکانس ۳۲ کیلوهرتز تولید می‌کند. این رویکرد وزن‌باز در راستای استراتژی کلی شرکت MiniMax است که پیش از این با معرفی مدل H3 به عنوان نخستین مدل وزن‌باز در صدر رتبه‌بندی ویدیوهای AI، استانداردهای جدیدی را در دسترسی‌پذیری مدل‌های پیشرفته تعریف کرد. همان‌طور که در تحلیل قبلی ما درباره‌ی ابزارهای متن‌باز برای گردش‌کارهای عامل‌محور (مانند OpenWork) اشاره کردیم، روند صنعت به سمت استقرار محلی در حال حرکت است. MiniMax-Music3 این روحیه دسترسی‌پذیری را به تولید موسیقی سطح بالا می‌آورد تا سازندگان بتوانند بدون وابستگی به ابر و پرداخت هزینه‌های هر-آهنگ، روی آثار خود کنترل کامل داشته باشند.

زمینه و کاربردهای صنعتی

مدل MiniMax-Music3 به جای اینکه یک پیش‌نمایش تحقیقاتی باشد، برای استقرار فوری طراحی شده است. هدف این مدل، سازندگان مستقل، استودیوهای کوچک و تیم‌های بازار متوسط هستند که می‌توانند مستقیماً با استفاده از وزن‌های ارائه شده و کدهای استنتاج، محصولات خود را عرضه کنند.

صنایع متعددی از این قابلیت بهره‌مند خواهند شد:

  • توسعه بازی: خلق موسیقی‌های تطبیقی برای محیط‌های بازی و مراحل مختلف.
  • تبلیغات: ساخت بسترهای صوتی بومی‌سازی شده و برندینگ صوتی برای آژانس‌های تبلیغاتی.
  • تولید محتوا: موسیقی متن برای ویدیوهای تولید شده توسط کاربر (UGC) و ابزارهای سازندگان محتوای کوتاه.
  • اپلیکیشن‌های تخصصی: آموزش الکترونیکی، پادکست، تناسب اندام، سلامت و موسیقی محیطی فروشگاه‌ها.
  • تکنولوژی موسیقی: ابزارهای SaaS برای تولید پلی‌لیست‌های شرطی بر اساس حال و هوا.

طبق گزارش Marktechpost، قلب تپنده این سیستم یک معماری Hybrid-LM است. این ساختار از یک مدل زبانی بزرگ (LLM) جهانی با ۸ میلیارد پارامتر (که احتمالاً بر پایه Qwen3 یا Qwen3.5 است) برای مدیریت ساختار بلندمدت آهنگ و یک مدل محلی کوچک‌تر ۰.۶ میلیارد پارامتری برای مدیریت جزئیات صوتی در سطح فریم استفاده می‌کند.

جزئیات فنی

جزئیات فنی این مدل نشان‌دهنده یک رویکرد بهینه است:

  • مسیر سنتز: یک ماژول flow-matching ۲.۴ میلیارد پارامتری که با یک Flow-VAE ۱۲۳ میلیون پارامتری (به ارث رسیده از MiniMax Speech) ادغام شده است. این سیستم در مرحله استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند — مستقیماً روی حالت‌های پنهان پیوسته اجرا می‌شود و رمزگشای توکن‌ساز گسسته را به طور کامل حذف می‌کند.
  • توکن‌سازی: استفاده از هشت لایه کوانتش برداری باقی‌مانده (RVQ). لایه اول (کدبوک معنایی) با ۱۶,۳۸۴ ورودی ساختار اصلی موسیقی را می‌سازد و هفت لایه بعدی (کدبوک‌های صوتی) هر کدام با ۱,۰۲۴ ورودی، جزئیات باقی‌مانده را می‌افزایند.
  • ورودی‌های کنترلی: کاربر می‌تواند متن ترانه را با تگ‌های مشخص (مانند [Intro]، [Verse]، [Pre-Chorus]، [Chorus]، [Post-Chorus]، [Bridge]، [Instrumental]، [Solo] یا [Outro]) و یک شرح ساختاریافته شامل متادیتای کلی، جزئیات وکال و آرایش موسیقی وارد کند.

برای تسهیل کار، MiniMax یک عامل بازنویس شرح موسیقی (music-caption-rewriter) نیز ارائه داده است. این ابزار به صورت آفلاین، توصیفات کوتاه کاربر را به فرمت سه بخشی مورد نیاز مدل گسترش می‌دهد.

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

استقرار و سخت‌افزار

استقرار این مدل از طریق سه مسیر مستند شده، در سخت‌افزارهای مختلف منعطف است. سرور مرجع SGLang-Omni به دو GPU CUDA نیاز دارد: GPU 0 تولید خودبازگشتی Qwen3 و RVQ را مدیریت می‌کند، در حالی که GPU 1 مسئول flow matching و رمزگشایی DAV است.

برای کسانی که از خط لوله ماژولار diffusers استفاده می‌کنند، نیاز به حافظه ویدیویی (VRAM) به شرح زیر است:

  • دقت کامل (Full Precision): کمتر از ۲۴ گیگابایت VRAM.
  • انتقال خودکار به CPU (Automatic CPU Offload): تقریباً ۲۲ گیگابایت.
  • انتقال گروهی در سطح برگ (Leaf-level Group Offloading): تا ۸ گیگابایت.

این بهینه‌سازی در مصرف منابع، یادآور دستاوردهای اخیر MiniMax در حوزه بصری است که در آن مدل H3 توانست مصرف VRAM را برای تولید ویدیوهای 2K تا ۶۶٪ کاهش دهد و استقرار محلی را تسهیل کند.

علاوه بر این، ComfyUI از یک قالب بومی Text to Music با استفاده از وزن‌های بازبسته‌بندی شده FP16/INT8 از Comfy-Org پشتیبانی می‌کند.

از نظر حقوقی، استفاده تجاری تحت لایسنس جامعه MiniMax-Music3 مجاز است، به شرطی که نام مدل به طور برجسته در رابط کاربری محصول نمایش داده شود. با این حال، سازمان‌هایی با درآمد سالانه بیش از ۲۰ میلیون دلار آمریکا باید مجوز کتبی جداگانه‌ای از MiniMax دریافت کنند. همچنین کسانی که خدمات تولید شخص ثالث را میزبانی می‌کنند، باید تدابیر حفاظتی در برابر خروجی‌های نقض حق چاپ ایجاد کنند.

این تغییر به سمت تولید موسیقی با وزن‌های باز، مانع ورود توسعه‌دهندگان بازی و آژانس‌های تبلیغاتی را که به موسیقی تطبیقی نیاز دارند، کاهش می‌دهد. این مدل با حذف رمزگشای توکن‌ساز در مرحله استنتاج، صدایی طبیعی‌تر و پیوسته‌تر نسبت به بسیاری از تلاش‌های خودبازگشتی قبلی تولید می‌کند.

برای کاربر نهایی، این یعنی مرحله «پیش‌نویس» (scratch track) در آهنگسازی تقریباً آنی می‌شود. شما می‌توانید بدون تأخیر یا هزینه مدل‌های اختصاصی ابری، روی یک پلی‌لیست شرطی یا یک بستر تبلیغاتی بومی آزمایش کنید.

باید منتظر ماند و دید جامعه کاربران چگونه قالب‌های ComfyUI را برای ایجاد استم‌های چند-ترکه (multi-track stems) تطبیق می‌دهند، زیرا خروجی فعلی یک میکس استریو است. مرز بعدی احتمالاً ادغام این وزن‌های باز در موتورهای بازی تعاملی و بلادرنگ خواهد بود.

گام بعدی شما

  • اگر توسعه‌دهنده بازی هستید، از مدل برای تولید موسیقی‌های تطبیقی (Adaptive) محیطی استفاده کنید.
  • قالب‌های ComfyUI را بررسی کنید تا متوجه شوید چگونه می‌توان خروجی استریو را به لایه‌های مجزا تبدیل کرد.
  • برای کاهش مصرف VRAM، روش Leaf-level Group Offloading را در محیط محلی خود تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با ارائه وزن‌های باز، قدرت تولید موسیقی بلندمدت را از انحصار شرکت‌های ابری خارج کرده و به استودیوهای مستقل می‌بخشد. اعتبار این رویکرد در استفاده از معماری Hybrid-LM است که توازن میان ساختار و جزئیات را به طور تجربی به اثبات رسانده است.

تأثیر برای ایران

به دلیل باز بودن وزن‌های مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به پرداخت ارزی یا درگیری با تحریم‌های API، این مدل را روی سرورهای داخلی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز MiniMax بر حذف رمزگشای توکن‌ساز در مرحله استنتاج، نشان می‌دهد که صنعت از مدل‌های گسسته به سمت بازنمایی‌های پیوسته در صوت حرکت می‌کند. این تغییر باعث می‌شود خروجی‌ها از حالت «تکه تکه» خارج شده و به کیفیت موسیقی واقعی نزدیک‌تر شوند. در واقع، مدل‌های بازوزن اکنون در حال تبدیل شدن به جایگزین‌های جدی برای استودیوهای گران‌قیمت هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.