پرش به محتوای اصلی
پرش به محتوای مقاله

«کنترل‌های ساختاری حرفه‌ای»؛ ویژگی جدید Lyria 3.5 برای توسعه‌دهندگان

·۱۴ شهریور ۱۴۰۵۴ دقیقه مطالعه
موزیک‌ساز هوش مصنوعی لیریا ۳.۵ گوگل به اپلیکیشن جمینای و API اضافه شد
موزیک‌ساز هوش مصنوعی لیریا ۳.۵ گوگل به اپلیکیشن جمینای و API اضافه شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال Lyria از محیط آزمایشگاهی به API عمومی و معرفی قابلیت تبدیل مستقیم تصویر به موسیقی (Image-to-Music) برای آهنگ‌های کامل ۳ دقیقه‌ای.

تصور کنید جهانی را که در آن تنها یک تصویر یا یک دستور متنی کوتاه، تنها فاصله میان کاربر و یک آهنگ کامل، باکیفیت و با وفاداری صوتی بالا باشد. این رویای تولید محتوا با گسترش مدل Lyria 3.5 در ۴ سپتامبر ۲۰۲۶ در اپلیکیشن Gemini به واقعیت تبدیل شد. پیشرفته‌ترین مدل تولید موسیقی گوگل اکنون از محیط آزمایشی ابزار Google Flow Music فراتر رفته و در دسترس تمامی توسعه‌دهندگان و کاربران جهانی قرار گرفته است.

این اقدام نشان‌دهنده قصد گوگل برای انتقال صوت زاینده از یک محیط خلاقانه محدود (Sandbox) به مجموعه ابزارهای بهره‌وری جریان اصلی است. در حالی که این شرکت پیش‌تر بر بهینه‌سازی‌های زیرساختی و بک‌اِند تمرکز داشت — همان‌طور که در پوشش خبری ما درباره‌ی کامپایلر HEIR و تأثیر آن بر استنتاج خصوصی مدل‌های یادگیری ماشین (ML Inference) مشاهده کردیم — مدل Lyria 3.5 اکنون بر تجربه خلاقانه فرانت-اِند برای کاربر نهایی متمرکز شده است.

زمینه و تکامل

مدل Lyria 3.5 نخستین بار در ۲۹ ژوئیه ۲۰۲۶ در محیط Google Flow Music رونمایی شد. در آن زمان، گوگل بر بهبودهای قابل‌توجه در زمینه موسیقی‌دانگی (Musicality)، کیفیت متن ترانه‌ها و کیفیت صدای وکال تأکید کرد. به‌روزرسانی اخیر که در وبلاگ The Keyword اعلام شد، این مدل را به‌صورت جهانی از طریق وب و اپلیکیشن موبایل در دسترس قرار می‌دهد.

گوگل Lyria 3.5 را به عنوان بهترین مدل تولید موسیقی خود تا به امروز توصیف می‌کند. این مدل به‌گونه‌ای طراحی شده است که تنظیمات موسیقی غنی‌تر و صدای انسانی بیانگرتری نسبت به نسخه‌های قبلی تولید کند، که در نهایت منجر به خلق قطعاتی با وفاداری (Fidelity) کلی بالاتر می‌شود.

برای کاربر عادی، اپلیکیشن جمینای اکنون شامل قالب‌های راهنمای خلق اثر است. شما می‌توانید یک ژانر موسیقی را توصیف کنید، بین سبک‌های وکال (با صدای خواننده) یا بی‌کلام (Instrumental) انتخاب کنید و طول آهنگ را برای کاربردهای خاصی مانند آهنگ‌های تبلیغاتی برند (Jingles)، رینگ‌تون‌های شخصی‌سازی شده یا موسیقی‌های پس‌زمینه سفارشی برای ویدئوها تنظیم کنید.

مشخصات فنی و دسترسی توسعه‌دهندگان

توسعه‌دهندگان اکنون می‌توانند از طریق Google AI Studio، Google Vids و Gemini API به این مدل دسترسی داشته باشند. این گام در راستای تقویت اکوسیستم باز گوگل است، مشابه آنچه در پذیرش گسترده مدل‌های وزن‌باز و دستاوردهای اخیر گوگل در جامعه توسعه‌دهندگان مشاهده کردیم. بر اساس مستندات توسعه‌دهندگان گوگل که در ۴ سپتامبر ۲۰۲۶ به‌روزرسانی شد، این سیستم دو مسیر مجزا را از طریق Interactions API ارائه می‌دهد:

  • Lyria 3 Clip (lyria-3-clip-preview): این مدل به‌طور خاص برای تولید کلیپ‌های ۳۰ ثانیه‌ای طراحی شده است که برای لوپ‌ها (تکرار شونده) و پیش‌نمایش‌ها ایده‌آل هستند.
  • Lyria 3.5 (lyria-3.5): این مدل قادر به تولید آهنگ‌های کامل شامل ورس (Verse)، کورس (Chorus) و بریج (Bridge) است که طول آن‌ها چند دقیقه است و حداکثر طول متغیر آن تا سه دقیقه می‌رسد.

هر دو مدل خروجی صوتی استریو با نرخ نمونه‌برداری ۴۴.۱ کیلوهرتز ارائه می‌دهند. در حالی که فرمت MP3 پیش‌فرض است، Lyria 3.5 برای دستیابی به کیفیت حرفه‌ای‌تر، از خروجی WAV نیز پشتیبانی می‌کند. همچنین، توسعه‌دهندگان می‌توانند تا ۱۰ تصویر را در کنار یک دستور متنی ارسال کنند تا به مدل در آهنگ‌سازی الهام ببخشند؛ این قابلیت به مدل اجازه می‌دهد محتوای بصری را به یک قطعه موسیقی تبدیل کند.

کنترل ساختاری و مکانیسم‌های خلاقانه

برخلاف ابزارهای ساده تبدیل متن به صوت، Lyria 3.5 امکان نقشه‌برداری دقیق ساختاری را فراهم می‌کند. مدل پیش از تولید صوت، بر اساس دستور کاربر، درباره ساختار موسیقی استدلال می‌کند. کاربران می‌توانند از کنترل‌های خاصی استفاده کنند:

  • برچسب‌های بخش (Section Tags): استفاده از تگ‌هایی مانند [Verse]، [Chorus] و [Bridge] برای تعریف معماری و استخوان‌بندی آهنگ.
  • برچسب‌های زمانی (Timestamps): تعیین دقیق اینکه در لحظات خاص چه اتفاقی بیفتد، مثلاً چه زمانی سازهای خاصی وارد تنظیم شوند.
  • سفارشی‌سازی متن ترانه: کاربران می‌توانند متن خود را بنویسند یا ترانه‌هایی را حول محور تم‌های خاص تولید کنند. ارسال دستور به یک زبان خاص، منجر به تولید متن به همان زبان می‌شود و مدل تلفظ و سبک وکال را برای مطابقت با آن زبان تطبیق می‌دهد.
  • کنترل مدت‌زمان: مدل می‌تواند قطعات منسجمی تولید کند که با مدت‌زمان درخواستی مطابقت داشته باشد، از یک کلیپ ۶۰ ثانیه‌ای تا یک آهنگ کامل سه دقیقه‌ای.

ایمنی و محدودیت‌ها

برای مقابله با خطرات مربوط به اطلاعات نادرست تولید شده توسط هوش مصنوعی و نقض حقوق کپی‌رایت، گوگل چندین حفاظ (Guardrail) را پیاده‌سازی کرده است. تمام دستورات از فیلترهای ایمنی عبور می‌کنند. مدل به‌طور صریح درخواست‌هایی را که برای شبیه‌سازی صدای هنرمندان خاص یا تولید متن‌های دارای کپی‌رایت باشد، مسدود می‌کند.

گوگل همچنین از برچسب‌گذاری گسترده داده‌ها و فیلترینگ استفاده می‌کند تا احتمال وجود متن‌ها و محتوای مضر در مجموعه‌داده‌های آموزشی را کاهش دهد. هر قطعه موسیقی با یک واترمارک SynthID نشان‌گذاری می‌شود؛ این نشان برای انسان غیرقابل شنیدن است اما توسط پلتفرم‌ها قابل شناسایی است تا محتوای تولید شده توسط هوش مصنوعی را تشخیص دهند.

با این حال، نسخه فعلی همچنان یک فرآیند تک‌مرحله‌ای (Single-turn) است. شما نمی‌توانید یک کلیپ تولید شده را در چندین دستور متوالی به‌صورت تکرار شونده ویرایش کنید، به این معنی که دستور اولیه و تگ‌های ساختاری باید از ابتدا دقیق باشند. علاوه بر این، نتایج ممکن است حتی با استفاده از یک دستور یکسان، در فراخوانی‌های مختلف متفاوت باشد.

ادغام در صنعت

سری مدل‌های Lyria با ورودی‌های مستقیم از تهیه‌کنندگان و موسیقی‌دانان توسعه یافته است. این همکاری‌ها شامل آزمایشاتی مانند کار Wyclef Jean (تهیه‌کننده مشهور) با Music AI Sandbox و استفاده Yung Spielburg از Lyria برای ساخت موسیقی متن انیمیشن کوتاه Dear Upstairs Neighbors است.

این ادغام، جمینای را از یک دستیار متنی و تصویری به یک مرکز تولید چندوجهی (Multimodal) تبدیل می‌کند. این تحول در قابلیت‌های جمینای، در راستای گسترش عاملیت هوشمند است، مشابه توانایی Gemini در کروم برای اجرای مستقل وظایف چندمرحله‌ای وب که پیش‌تر بررسی کردیم. گوگل با فراهم کردن قابلیت تبدیل تصویر به موسیقی، شکاف بین «مود-بوردینگ» بصری و تولید صوتی را پر می‌کند.

برای خلق‌کنندگان، به این معناست که سد ورود به دنیای موسیقی متن سفارشی عملاً از بین رفته است. یک تدوین‌گر ویدئو دیگر نیازی به جست‌وجوی بی‌پایان برای قطعات بدون کپی‌رایت (Royalty-free) ندارد؛ آن‌ها اکنون می‌توانند یک قطعه منسجم ۱۸۰ ثانیه‌ای بسازند که دقیقاً با ریتم و سرعت بصری پروژه آن‌ها همخوانی داشته باشد.

باید منتظر ماند و دید که این ادغام چگونه بر چشم‌انداز حق‌الامتیاز موسیقی‌های پس‌زمینه تأثیر می‌گذارد و آیا گوگل سطح قیمتی خاصی را برای خروجی‌های باکیفیت WAV در Vertex AI معرفی خواهد کرد یا خیر.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، قابلیت تبدیل تصویر به موسیقی را در Google AI Studio تست کنید تا متوجه شوید مدل چگونه مود بصری را به نت تبدیل می‌کند.
  • برای تولید محتوای ویدئویی، از تگ‌های [Bridge] و [Chorus] برای ایجاد تغییرات احساسی در موسیقی پس‌زمینه استفاده کنید.
  • خروجی‌های WAV را برای پروژه‌هایی که نیاز به میکس حرفه‌ای دارند جایگزین MP3 کنید.

اما اثر این ابزار بر اقتصاد حق‌الامتیاز موسیقی‌های پس‌زمینه حتی پیچیده‌تر است — به تحلیل ما درباره‌ی آینده مدل‌های مولد صوتی مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با تکیه بر اعتبار فنی Google DeepMind، دسترسی به تولید موسیقی حرفه‌ای را دموکراتیزه می‌کند. حذف نیاز به تخصص موسیقی برای خلق قطعات ۳ دقیقه‌ای، مدل کسب‌وکار آکازارهای موسیقی استوک را به شدت تحت فشار قرار می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API گوگل، دسترسی توسعه‌دهندگان ایرانی به Lyria 3.5 همچنان نیازمند ابزارهای تغییر آی‌پی است، اما برای تولیدکنندگان محتوای بصری ایرانی، این ابزار جایگزینی رایگان و سریع برای خرید موسیقی‌های لایسنس‌دار خارجی است.

·نگاه ما
تحریریه دات‌هوش

تغییر رویکرد گوگل از ابزارهای آزمایشی به ادغام در API، نشان می‌دهد که تولید موسیقی دیگر یک «دمو» نیست و وارد زنجیره ارزش تولید محتوای تجاری شده است. تبدیل تصویر به موسیقی، گسست بین مود-بوردینگ بصری و تولید صوتی را از بین می‌برد و احتمالاً استانداردهای جدیدی برای سرعت تولید محتوای کوتاه (Short-form) تعریف می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.