تصور کنید جهانی را که در آن تنها یک تصویر یا یک دستور متنی کوتاه، تنها فاصله میان کاربر و یک آهنگ کامل، باکیفیت و با وفاداری صوتی بالا باشد. این رویای تولید محتوا با گسترش مدل Lyria 3.5 در ۴ سپتامبر ۲۰۲۶ در اپلیکیشن Gemini به واقعیت تبدیل شد. پیشرفتهترین مدل تولید موسیقی گوگل اکنون از محیط آزمایشی ابزار Google Flow Music فراتر رفته و در دسترس تمامی توسعهدهندگان و کاربران جهانی قرار گرفته است.
این اقدام نشاندهنده قصد گوگل برای انتقال صوت زاینده از یک محیط خلاقانه محدود (Sandbox) به مجموعه ابزارهای بهرهوری جریان اصلی است. در حالی که این شرکت پیشتر بر بهینهسازیهای زیرساختی و بکاِند تمرکز داشت — همانطور که در پوشش خبری ما دربارهی کامپایلر HEIR و تأثیر آن بر استنتاج خصوصی مدلهای یادگیری ماشین (ML Inference) مشاهده کردیم — مدل Lyria 3.5 اکنون بر تجربه خلاقانه فرانت-اِند برای کاربر نهایی متمرکز شده است.
زمینه و تکامل
مدل Lyria 3.5 نخستین بار در ۲۹ ژوئیه ۲۰۲۶ در محیط Google Flow Music رونمایی شد. در آن زمان، گوگل بر بهبودهای قابلتوجه در زمینه موسیقیدانگی (Musicality)، کیفیت متن ترانهها و کیفیت صدای وکال تأکید کرد. بهروزرسانی اخیر که در وبلاگ The Keyword اعلام شد، این مدل را بهصورت جهانی از طریق وب و اپلیکیشن موبایل در دسترس قرار میدهد.
گوگل Lyria 3.5 را به عنوان بهترین مدل تولید موسیقی خود تا به امروز توصیف میکند. این مدل بهگونهای طراحی شده است که تنظیمات موسیقی غنیتر و صدای انسانی بیانگرتری نسبت به نسخههای قبلی تولید کند، که در نهایت منجر به خلق قطعاتی با وفاداری (Fidelity) کلی بالاتر میشود.
برای کاربر عادی، اپلیکیشن جمینای اکنون شامل قالبهای راهنمای خلق اثر است. شما میتوانید یک ژانر موسیقی را توصیف کنید، بین سبکهای وکال (با صدای خواننده) یا بیکلام (Instrumental) انتخاب کنید و طول آهنگ را برای کاربردهای خاصی مانند آهنگهای تبلیغاتی برند (Jingles)، رینگتونهای شخصیسازی شده یا موسیقیهای پسزمینه سفارشی برای ویدئوها تنظیم کنید.
مشخصات فنی و دسترسی توسعهدهندگان
توسعهدهندگان اکنون میتوانند از طریق Google AI Studio، Google Vids و Gemini API به این مدل دسترسی داشته باشند. این گام در راستای تقویت اکوسیستم باز گوگل است، مشابه آنچه در پذیرش گسترده مدلهای وزنباز و دستاوردهای اخیر گوگل در جامعه توسعهدهندگان مشاهده کردیم. بر اساس مستندات توسعهدهندگان گوگل که در ۴ سپتامبر ۲۰۲۶ بهروزرسانی شد، این سیستم دو مسیر مجزا را از طریق Interactions API ارائه میدهد:
- Lyria 3 Clip (lyria-3-clip-preview): این مدل بهطور خاص برای تولید کلیپهای ۳۰ ثانیهای طراحی شده است که برای لوپها (تکرار شونده) و پیشنمایشها ایدهآل هستند.
- Lyria 3.5 (lyria-3.5): این مدل قادر به تولید آهنگهای کامل شامل ورس (Verse)، کورس (Chorus) و بریج (Bridge) است که طول آنها چند دقیقه است و حداکثر طول متغیر آن تا سه دقیقه میرسد.
هر دو مدل خروجی صوتی استریو با نرخ نمونهبرداری ۴۴.۱ کیلوهرتز ارائه میدهند. در حالی که فرمت MP3 پیشفرض است، Lyria 3.5 برای دستیابی به کیفیت حرفهایتر، از خروجی WAV نیز پشتیبانی میکند. همچنین، توسعهدهندگان میتوانند تا ۱۰ تصویر را در کنار یک دستور متنی ارسال کنند تا به مدل در آهنگسازی الهام ببخشند؛ این قابلیت به مدل اجازه میدهد محتوای بصری را به یک قطعه موسیقی تبدیل کند.
کنترل ساختاری و مکانیسمهای خلاقانه
برخلاف ابزارهای ساده تبدیل متن به صوت، Lyria 3.5 امکان نقشهبرداری دقیق ساختاری را فراهم میکند. مدل پیش از تولید صوت، بر اساس دستور کاربر، درباره ساختار موسیقی استدلال میکند. کاربران میتوانند از کنترلهای خاصی استفاده کنند:
- برچسبهای بخش (Section Tags): استفاده از تگهایی مانند [Verse]، [Chorus] و [Bridge] برای تعریف معماری و استخوانبندی آهنگ.
- برچسبهای زمانی (Timestamps): تعیین دقیق اینکه در لحظات خاص چه اتفاقی بیفتد، مثلاً چه زمانی سازهای خاصی وارد تنظیم شوند.
- سفارشیسازی متن ترانه: کاربران میتوانند متن خود را بنویسند یا ترانههایی را حول محور تمهای خاص تولید کنند. ارسال دستور به یک زبان خاص، منجر به تولید متن به همان زبان میشود و مدل تلفظ و سبک وکال را برای مطابقت با آن زبان تطبیق میدهد.
- کنترل مدتزمان: مدل میتواند قطعات منسجمی تولید کند که با مدتزمان درخواستی مطابقت داشته باشد، از یک کلیپ ۶۰ ثانیهای تا یک آهنگ کامل سه دقیقهای.
ایمنی و محدودیتها
برای مقابله با خطرات مربوط به اطلاعات نادرست تولید شده توسط هوش مصنوعی و نقض حقوق کپیرایت، گوگل چندین حفاظ (Guardrail) را پیادهسازی کرده است. تمام دستورات از فیلترهای ایمنی عبور میکنند. مدل بهطور صریح درخواستهایی را که برای شبیهسازی صدای هنرمندان خاص یا تولید متنهای دارای کپیرایت باشد، مسدود میکند.
گوگل همچنین از برچسبگذاری گسترده دادهها و فیلترینگ استفاده میکند تا احتمال وجود متنها و محتوای مضر در مجموعهدادههای آموزشی را کاهش دهد. هر قطعه موسیقی با یک واترمارک SynthID نشانگذاری میشود؛ این نشان برای انسان غیرقابل شنیدن است اما توسط پلتفرمها قابل شناسایی است تا محتوای تولید شده توسط هوش مصنوعی را تشخیص دهند.
با این حال، نسخه فعلی همچنان یک فرآیند تکمرحلهای (Single-turn) است. شما نمیتوانید یک کلیپ تولید شده را در چندین دستور متوالی بهصورت تکرار شونده ویرایش کنید، به این معنی که دستور اولیه و تگهای ساختاری باید از ابتدا دقیق باشند. علاوه بر این، نتایج ممکن است حتی با استفاده از یک دستور یکسان، در فراخوانیهای مختلف متفاوت باشد.
ادغام در صنعت
سری مدلهای Lyria با ورودیهای مستقیم از تهیهکنندگان و موسیقیدانان توسعه یافته است. این همکاریها شامل آزمایشاتی مانند کار Wyclef Jean (تهیهکننده مشهور) با Music AI Sandbox و استفاده Yung Spielburg از Lyria برای ساخت موسیقی متن انیمیشن کوتاه Dear Upstairs Neighbors است.
این ادغام، جمینای را از یک دستیار متنی و تصویری به یک مرکز تولید چندوجهی (Multimodal) تبدیل میکند. این تحول در قابلیتهای جمینای، در راستای گسترش عاملیت هوشمند است، مشابه توانایی Gemini در کروم برای اجرای مستقل وظایف چندمرحلهای وب که پیشتر بررسی کردیم. گوگل با فراهم کردن قابلیت تبدیل تصویر به موسیقی، شکاف بین «مود-بوردینگ» بصری و تولید صوتی را پر میکند.
برای خلقکنندگان، به این معناست که سد ورود به دنیای موسیقی متن سفارشی عملاً از بین رفته است. یک تدوینگر ویدئو دیگر نیازی به جستوجوی بیپایان برای قطعات بدون کپیرایت (Royalty-free) ندارد؛ آنها اکنون میتوانند یک قطعه منسجم ۱۸۰ ثانیهای بسازند که دقیقاً با ریتم و سرعت بصری پروژه آنها همخوانی داشته باشد.
باید منتظر ماند و دید که این ادغام چگونه بر چشمانداز حقالامتیاز موسیقیهای پسزمینه تأثیر میگذارد و آیا گوگل سطح قیمتی خاصی را برای خروجیهای باکیفیت WAV در Vertex AI معرفی خواهد کرد یا خیر.
گام بعدی شما
- اگر توسعهدهنده هستید، قابلیت تبدیل تصویر به موسیقی را در Google AI Studio تست کنید تا متوجه شوید مدل چگونه مود بصری را به نت تبدیل میکند.
- برای تولید محتوای ویدئویی، از تگهای [Bridge] و [Chorus] برای ایجاد تغییرات احساسی در موسیقی پسزمینه استفاده کنید.
- خروجیهای WAV را برای پروژههایی که نیاز به میکس حرفهای دارند جایگزین MP3 کنید.
اما اثر این ابزار بر اقتصاد حقالامتیاز موسیقیهای پسزمینه حتی پیچیدهتر است — به تحلیل ما دربارهی آینده مدلهای مولد صوتی مراجعه کنید.




گفتگو