اگر امروز برای تولید یک کلیپ کوتاه باکیفیت هزینههای گزاف پرداخت میکنید، باید بدانید که هزینه تولید ویدیوهای حرفهای با هوش مصنوعی اکنون ۵ برابر ارزانتر شده است. در ۷ اکتبر ۲۰۲۶، شرکت ShengShu Technology از پیشنمایش مدل Vidu Q4 پردهبرداری کرد؛ مدل پرچمداری از نسل جدید که بهطور خاص برای همگامسازی پیشرفته و بیانگرانه میان صدا و تصویر طراحی شده است.
این پیشنمایش از طریق محصول وب Vidu و پلتفرم API در دسترس است. به نقل از ShengShu Technology، این مدل بهطور مشخص سازندگان مستقل، استودیوهای کوچک و تیمهای تولید را هدف قرار داده است. این کاربران معمولاً در هر دو حوزه آثار روایی (Narrative) و کارهای تجاری فعالیت میکنند و به ابزارهایی نیاز دارند که از نمایشهای ساده (Demonstrations) فراتر رفته و وارد خط تولید واقعی (Production Pipeline) شوند. این رویکرد کاهش هزینهها برای استودیوهای کوچک، یادآور استراتژی مشابه بایتدنس در عرضه ابزار Dramagic برای کاهش هزینههای تولید ویدیو است که هدفش دموکراتیزه کردن تولید محتوای باکیفیت بود.
تولید یک نمای آماده برای پخش معمولاً نیازمند دهها بار تکرار است تا حالت چهره یک شخصیت یا زاویه دوربین دقیقاً مطابق میل سازنده شود. برای کاربران تجاری، این چرخه تکرار اغلب گرانترین بخش کل فرآیند تولید است. Vidu Q4 با ارائه ساختار قیمتی که از ۰.۰۱۴ دلار بهازای هر ثانیه شروع میشود، این مشکل را حل میکند. شرکت ادعا میکند که با همین بودجه، میتوان تا ۵ برابر خروجی بیشتری نسبت به مدلهایی با مشخصات مشابه دریافت کرد.
همانطور که در تحلیلهای قبلی ما دربارهی مدلهای مولد ویدیو اشاره کردیم، چالش اصلی همواره حفظ تداوم بصری بوده است. Vidu Q4 این موضوع را با مکانیزم تولید مبتنی بر مرجع (Reference-based Generation) حل کرده است. کاربران اکنون میتوانند عناصر بصری و صوتی خاصی را در طول یک صحنه ثابت نگه دارند و آنها را «پین» کنند. این کنترلها از طریق ورودیهای زیر اعمال میشوند:
- مراجع بصری: امکان استفاده از حداکثر ۱۵ تصویر مرجع برای حفظ تداوم و ثبات شخصیتها، لباسها، وسایل، محصولات و محیطهای پیرامونی. در این راستا، دقت در بازتولید جزئیات بصری اهمیت دارد، مشابه آنچه در بهبودهای تایپوگرافی مدل GPT-Image-2.5 Flare برای دستیابی به دقت ۹۸.۴ درصدی مشاهده کردیم.
- مراجع صوتی: استفاده از حداکثر ۳ کلیپ صوتی برای اطمینان از اینکه صدای شخصیت و نحوه بیان احساسات در تمام طول ویدیو پایدار و همراستا باقی میماند.
- وضوح و رنگ: گزینههای خروجی شامل رزولوشنهای 540p، 720p، 1080p، 2K و 4K با عمق رنگ ۱۰ بیتی است.
بر اساس مستندات این شرکت، مدل Q4 هماهنگی بسیار بهتری میان حالات چهره، حرکات بدن و صدا ایجاد میکند. این امر منجر به انتقال احساسات ظریفتر و حرکات طبیعیتر در سکانسهای پیچیده میشود. در صحنههایی با سرعت بالا، مانند تعقیب و گریز یا مبارزات، دوربین بهگونهای طراحی شده است که اکشن را بهطور منسجمتری دنبال کند. همچنین جلوههای بصری مانند انفجارها، آتشبازیها و ذرات (Particles) بهطور طبیعیتری با محیط اطراف ترکیب میشوند.
ShengShu Technology اشاره کرد که ارائه طیف گستردهای از رزولوشنها دو هدف اصلی را دنبال میکند: اول، انجام تستهای خلاقانه در مراحل اولیه با هزینه کم، و دوم، تولید خروجی نهایی با کیفیت بالا. این قابلیت به سازندگان اجازه میدهد پیش از متعهد شدن به رندر نهایی 4K، ایدههای خود را در رزولوشنهای پایینتر بهسرعت تکرار و اصلاح کنند. این تفکیک میان پیشنمایش سریع و خروجی نهایی، شباهت زیادی به تفاوت میان تولید Generative و Upscaling در معماری DLSS 5 دارد که در آن بازسازی بصری در لحظه با خروجی نهایی بهینهسازی میشود.
برای توسعهدهندگان، این مدل از طریق نقاط اتصال (Endpoint) مخصوص در API در دسترس است. درخواستها باید به آدرسهای POST https://api.vidu.com/ent/v2/img2video و POST https://api.vidu.com/ent/v2/reference2video ارسال شوند. این سامانه دو حالت اصلی را پشتیبانی میکند:
۱. تبدیل تصویر به ویدیو (Image-to-Video): متحرکسازی یک تصویر واحد (تا ۵۰ مگابایت در فرمتهای png، jpeg، jpg یا webp) بر اساس یک پرامپت متنی تا ۲۰ هزار کاراکتر. این حالت کلیپهایی بین ۳ تا ۱۶ ثانیه (بهطور پیشفرض ۵ ثانیه) با رزولوشنهای ۵۴۰p تا 4K (بهطور پیشفرض 720p) تولید میکند. پارامتر صوتی بهطور پیشفرض روی حالت true است که امکان تولید دیالوگ و افکتهای صوتی را همراه با تغییر خودکار دوربین فراهم میکند.
۲. تبدیل مرجع به ویدیو (Reference-to-Video): ترکیب یک تا ۱۵ تصویر و صفر تا سه مرجع صوتی mp3 (هر کدام بین ۳ تا ۱۲ ثانیه). این حالت از نسبتهای ابعادی ۱:۱، ۹:۱۶، ۱۶:۹، ۳:۴ و ۴:۳ (بهطور پیشفرض ۱۶:۹) پشتیبانی میکند. این مود قابلیتهای پیشرفتهای چون تغییر هوشمند دوربین، حفظ تداوم در موقعیتهای مختلف دوربین و خروجی همزمان صدا و ویدیو را دارد. لازم به ذکر است که URLهای ایجاد شده برای خروجیها تا ۲۴ ساعت معتبر میمانند.
این عرضه نشاندهنده یک چرخش استراتژیک از هوش مصنوعی «دمو-محور» به سمت هوش مصنوعی «تولید-محور» است. ییهانگ لو، همبنیانگذار و مدیرعامل ShengShu Technology در بیانیه انتشار مدل تأکید کرد: «مدلهای پیشرفته ویدیو باید خود را فراتر از دموهای دستچینشده ثابت کنند. هر بهبود در بهرهوری باید در نهایت به سازندگان این آزادی را بدهد که یک نمای بیشتر امتحان کنند یا یک نسخه جدید بسازند.»
با اولویت دادن به بهرهوری هزینه و تداوم مبتنی بر مرجع، ShengShu در حال پر کردن شکاف میان یک «کلیپ جذاب AI» و یک «دارایی تجاری قابل استفاده» است. برای تیمهای تبلیغاتی و تجارت الکترونیک، این به معنای توانایی تست چندین سکانس آغازین یا تغییرات محصول برای مخاطبان مختلف، بدون تمام کردن بودجه تولید است. فیلمسازان نیز میتوانند پیش از ورود به مراحل نهایی تولید، اجراها، استوریبوردها و ریتم اثر را تست کنند.
وقتی هزینه یک نمای «ناموفق» ۸۰٪ کاهش مییابد، سازندگان جسارت بیشتری برای تجربه صحنهپردازیهای پیچیده و اجراهای جسورانه پیدا میکنند. این اتفاق سد ورود استودیوهای کوچک برای تولید محتوای با کیفیت سینمایی را میشکند؛ کارهایی که پیش از این نیازمند مزارع رندر (Render Farms) عظیم یا نیروی انسانی متخصص و گرانقیمت در حوزه VFX بود.
کاربران در حال حاضر میتوانند از طریق محصول وب و پلتفرم API به این پیشنمایش دسترسی داشته باشند تا بازخوردهای خود را درباره عملکرد و کنترلهای خلاقانه ارائه دهند؛ بازخوردهایی که شکل نهایی نسخه Q4 را تعیین خواهد کرد. توصیه میشود نظارهگر باشید که این کنترلهای مبتنی بر مرجع در پروژههای روایی بلندمدت، در مقایسه با مدلهای مبتنی بر پرامپت، چه عملکردی خواهند داشت.
گام بعدی شما
- اگر تولیدکننده محتوا هستید، از حالت Reference-to-Video برای تست تداوم شخصیت در صحنههای مختلف استفاده کنید.
- توسعهدهندگان میتوانند با استفاده از API جدید، ابزارهای تولید ویدیو با هزینه پایین را در محصولات خود ادغام کنند.
- بررسی کنید که آیا کنترلهای مبتنی بر مرجع در پروژههای بلندمدت، واقعاً جایگزین مهندسی پرامپت میشوند یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو