پرش به محتوای اصلی
پرش به محتوای مقاله

«کاهش هزینه‌ها برای سازندگان»؛ هدف مدل Vidu Q4 در تولید ویدیو

·۱۵ مهر ۱۴۰۵۴ دقیقه مطالعه
پیش‌نمایش مدل نسل بعدی ویدیویی هوش مصنوعی Vidu برای سه‌ماهه چهارم منتشر شد
پیش‌نمایش مدل نسل بعدی ویدیویی هوش مصنوعی Vidu برای سه‌ماهه چهارم منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از تولید بر اساس متن به تولید بر اساس مراجع (تا ۱۵ تصویر و ۳ صوت) برای تضمین تداوم بصری در سطح صنعتی، در حالی که هزینه تولید را ۸۰٪ کاهش داده است.

اگر امروز برای تولید یک کلیپ کوتاه باکیفیت هزینه‌های گزاف پرداخت می‌کنید، باید بدانید که هزینه تولید ویدیوهای حرفه‌ای با هوش مصنوعی اکنون ۵ برابر ارزان‌تر شده است. در ۷ اکتبر ۲۰۲۶، شرکت ShengShu Technology از پیش‌نمایش مدل Vidu Q4 پرده‌برداری کرد؛ مدل پرچمداری از نسل جدید که به‌طور خاص برای همگام‌سازی پیشرفته و بیانگرانه میان صدا و تصویر طراحی شده است.

این پیش‌نمایش از طریق محصول وب Vidu و پلتفرم API در دسترس است. به نقل از ShengShu Technology، این مدل به‌طور مشخص سازندگان مستقل، استودیوهای کوچک و تیم‌های تولید را هدف قرار داده است. این کاربران معمولاً در هر دو حوزه آثار روایی (Narrative) و کارهای تجاری فعالیت می‌کنند و به ابزارهایی نیاز دارند که از نمایش‌های ساده (Demonstrations) فراتر رفته و وارد خط تولید واقعی (Production Pipeline) شوند. این رویکرد کاهش هزینه‌ها برای استودیوهای کوچک، یادآور استراتژی مشابه بایت‌دنس در عرضه ابزار Dramagic برای کاهش هزینه‌های تولید ویدیو است که هدفش دموکراتیزه کردن تولید محتوای باکیفیت بود.

تولید یک نمای آماده برای پخش معمولاً نیازمند ده‌ها بار تکرار است تا حالت چهره یک شخصیت یا زاویه دوربین دقیقاً مطابق میل سازنده شود. برای کاربران تجاری، این چرخه تکرار اغلب گران‌ترین بخش کل فرآیند تولید است. Vidu Q4 با ارائه ساختار قیمتی که از ۰.۰۱۴ دلار به‌ازای هر ثانیه شروع می‌شود، این مشکل را حل می‌کند. شرکت ادعا می‌کند که با همین بودجه، می‌توان تا ۵ برابر خروجی بیشتری نسبت به مدل‌هایی با مشخصات مشابه دریافت کرد.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی مدل‌های مولد ویدیو اشاره کردیم، چالش اصلی همواره حفظ تداوم بصری بوده است. Vidu Q4 این موضوع را با مکانیزم تولید مبتنی بر مرجع (Reference-based Generation) حل کرده است. کاربران اکنون می‌توانند عناصر بصری و صوتی خاصی را در طول یک صحنه ثابت نگه دارند و آن‌ها را «پین» کنند. این کنترل‌ها از طریق ورودی‌های زیر اعمال می‌شوند:

  • مراجع بصری: امکان استفاده از حداکثر ۱۵ تصویر مرجع برای حفظ تداوم و ثبات شخصیت‌ها، لباس‌ها، وسایل، محصولات و محیط‌های پیرامونی. در این راستا، دقت در بازتولید جزئیات بصری اهمیت دارد، مشابه آنچه در بهبودهای تایپوگرافی مدل GPT-Image-2.5 Flare برای دستیابی به دقت ۹۸.۴ درصدی مشاهده کردیم.
  • مراجع صوتی: استفاده از حداکثر ۳ کلیپ صوتی برای اطمینان از اینکه صدای شخصیت و نحوه بیان احساسات در تمام طول ویدیو پایدار و هم‌راستا باقی می‌ماند.
  • وضوح و رنگ: گزینه‌های خروجی شامل رزولوشن‌های 540p، 720p، 1080p، 2K و 4K با عمق رنگ ۱۰ بیتی است.

بر اساس مستندات این شرکت، مدل Q4 هماهنگی بسیار بهتری میان حالات چهره، حرکات بدن و صدا ایجاد می‌کند. این امر منجر به انتقال احساسات ظریف‌تر و حرکات طبیعی‌تر در سکانس‌های پیچیده می‌شود. در صحنه‌هایی با سرعت بالا، مانند تعقیب و گریز یا مبارزات، دوربین به‌گونه‌ای طراحی شده است که اکشن را به‌طور منسجم‌تری دنبال کند. همچنین جلوه‌های بصری مانند انفجارها، آتش‌بازی‌ها و ذرات (Particles) به‌طور طبیعی‌تری با محیط اطراف ترکیب می‌شوند.

ShengShu Technology اشاره کرد که ارائه طیف گسترده‌ای از رزولوشن‌ها دو هدف اصلی را دنبال می‌کند: اول، انجام تست‌های خلاقانه در مراحل اولیه با هزینه کم، و دوم، تولید خروجی نهایی با کیفیت بالا. این قابلیت به سازندگان اجازه می‌دهد پیش از متعهد شدن به رندر نهایی 4K، ایده‌های خود را در رزولوشن‌های پایین‌تر به‌سرعت تکرار و اصلاح کنند. این تفکیک میان پیش‌نمایش سریع و خروجی نهایی، شباهت زیادی به تفاوت میان تولید Generative و Upscaling در معماری DLSS 5 دارد که در آن بازسازی بصری در لحظه با خروجی نهایی بهینه‌سازی می‌شود.

برای توسعه‌دهندگان، این مدل از طریق نقاط اتصال (Endpoint) مخصوص در API در دسترس است. درخواست‌ها باید به آدرس‌های POST https://api.vidu.com/ent/v2/img2video و POST https://api.vidu.com/ent/v2/reference2video ارسال شوند. این سامانه دو حالت اصلی را پشتیبانی می‌کند:

۱. تبدیل تصویر به ویدیو (Image-to-Video): متحرک‌سازی یک تصویر واحد (تا ۵۰ مگابایت در فرمت‌های png، jpeg، jpg یا webp) بر اساس یک پرامپت متنی تا ۲۰ هزار کاراکتر. این حالت کلیپ‌هایی بین ۳ تا ۱۶ ثانیه (به‌طور پیش‌فرض ۵ ثانیه) با رزولوشن‌های ۵۴۰p تا 4K (به‌طور پیش‌فرض 720p) تولید می‌کند. پارامتر صوتی به‌طور پیش‌فرض روی حالت true است که امکان تولید دیالوگ و افکت‌های صوتی را همراه با تغییر خودکار دوربین فراهم می‌کند.

۲. تبدیل مرجع به ویدیو (Reference-to-Video): ترکیب یک تا ۱۵ تصویر و صفر تا سه مرجع صوتی mp3 (هر کدام بین ۳ تا ۱۲ ثانیه). این حالت از نسبت‌های ابعادی ۱:۱، ۹:۱۶، ۱۶:۹، ۳:۴ و ۴:۳ (به‌طور پیش‌فرض ۱۶:۹) پشتیبانی می‌کند. این مود قابلیت‌های پیشرفته‌ای چون تغییر هوشمند دوربین، حفظ تداوم در موقعیت‌های مختلف دوربین و خروجی همزمان صدا و ویدیو را دارد. لازم به ذکر است که URLهای ایجاد شده برای خروجی‌ها تا ۲۴ ساعت معتبر می‌مانند.

این عرضه نشان‌دهنده یک چرخش استراتژیک از هوش مصنوعی «دمو-محور» به سمت هوش مصنوعی «تولید-محور» است. ییهانگ لو، هم‌بنیان‌گذار و مدیرعامل ShengShu Technology در بیانیه انتشار مدل تأکید کرد: «مدل‌های پیشرفته ویدیو باید خود را فراتر از دموهای دست‌چین‌شده ثابت کنند. هر بهبود در بهره‌وری باید در نهایت به سازندگان این آزادی را بدهد که یک نمای بیشتر امتحان کنند یا یک نسخه جدید بسازند.»

با اولویت دادن به بهره‌وری هزینه و تداوم مبتنی بر مرجع، ShengShu در حال پر کردن شکاف میان یک «کلیپ جذاب AI» و یک «دارایی تجاری قابل استفاده» است. برای تیم‌های تبلیغاتی و تجارت الکترونیک، این به معنای توانایی تست چندین سکانس آغازین یا تغییرات محصول برای مخاطبان مختلف، بدون تمام کردن بودجه تولید است. فیلم‌سازان نیز می‌توانند پیش از ورود به مراحل نهایی تولید، اجراها، استوری‌بوردها و ریتم اثر را تست کنند.

وقتی هزینه یک نمای «ناموفق» ۸۰٪ کاهش می‌یابد، سازندگان جسارت بیشتری برای تجربه صحنه‌پردازی‌های پیچیده و اجراهای جسورانه پیدا می‌کنند. این اتفاق سد ورود استودیوهای کوچک برای تولید محتوای با کیفیت سینمایی را می‌شکند؛ کارهایی که پیش از این نیازمند مزارع رندر (Render Farms) عظیم یا نیروی انسانی متخصص و گران‌قیمت در حوزه VFX بود.

کاربران در حال حاضر می‌توانند از طریق محصول وب و پلتفرم API به این پیش‌نمایش دسترسی داشته باشند تا بازخوردهای خود را درباره عملکرد و کنترل‌های خلاقانه ارائه دهند؛ بازخوردهایی که شکل نهایی نسخه Q4 را تعیین خواهد کرد. توصیه می‌شود نظاره‌گر باشید که این کنترل‌های مبتنی بر مرجع در پروژه‌های روایی بلندمدت، در مقایسه با مدل‌های مبتنی بر پرامپت، چه عملکردی خواهند داشت.

گام بعدی شما

  • اگر تولیدکننده محتوا هستید، از حالت Reference-to-Video برای تست تداوم شخصیت در صحنه‌های مختلف استفاده کنید.
  • توسعه‌دهندگان می‌توانند با استفاده از API جدید، ابزارهای تولید ویدیو با هزینه پایین را در محصولات خود ادغام کنند.
  • بررسی کنید که آیا کنترل‌های مبتنی بر مرجع در پروژه‌های بلندمدت، واقعاً جایگزین مهندسی پرامپت می‌شوند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش شدید هزینه‌های استنتاج، دسترسی به کیفیت ۴K را برای استودیوهای کوچک دموکراتیزه می‌کند. اعتبار این ادعا از طریق ارائه API با قیمت مشخص و قابلیت‌های کنترل مرجع (Reference-based) قابل تأیید است.

تأثیر برای ایران

کاهش شدید هزینه تولید ویدیوهای ۴K، فرصتی استثنایی برای استودیوهای انیمیشن و تبلیغاتی ایرانی است تا بدون نیاز به سخت‌افزارهای گران‌قیمت، خروجی‌های سینمایی تولید کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز Vidu Q4 بر کاهش هزینه به‌جای افزایش صرفِ کیفیت، نشان می‌دهد که مدل‌های ویدیو از مرحله «نمایش قدرت» به مرحله «بهره‌برداری اقتصادی» رسیده‌اند. حذف وابستگی به پرامپت‌های طولانی و جایگزینی آن با مراجع بصری و صوتی، در واقع استقرار یک سیستم کنترل مهندسی در دل مدل‌های مولد است. این رویکرد، هوش مصنوعی را از یک ابزار تخیلی به یک ابزار پیش‌بینی‌پذیر برای استودیوهای تجاری تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.