پرش به محتوای اصلی
پرش به محتوای مقاله

آیا ابزار گسترش صحنه محدودیت 8 ثانیه‌ای کلیپ‌های Veo را می‌شکند؟

·۲ شهریور ۱۴۰۵۷ دقیقه مطالعه
مقایسه Veo 3.1 و Veo 3: مشخصات، صدا، قیمت و نحوه استفاده
مقایسه Veo 3.1 و Veo 3: مشخصات، صدا، قیمت و نحوه استفاده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی متد متن-به-ویدیو با گردش‌کار مبتنی بر تصاویر مرجع (Ingredients-to-video) و ادغام بومی صدا در فایل خروجی، به‌جای تولید ویدیوهای بی‌صدا.

تصور کنید می‌خواهید یک تبلیغ ویدیو بسازید اما چهره مدل شما در هر نما تغییر می‌کند؛ این کابوس همیشگی تولیدکنندگان محتواست. گوگل با به‌روزرسانی Veo 3.1، این مشکل را با سیستمی حل کرده که اجازه می‌دهد شخصیت‌ها در تمام طول ویدیو ثابت بمانند.

طبق اعلام گوگل در ۱۵ اکتبر ۲۰۲۵، مدل Veo 3.1 و نسخه سریع آن (Fast)، تغییری بنیادین ایجاد کرده‌اند: عبور از ویدیوهای بی‌صدا به سمت صدای بومی. حالا یک کلیپ ۸ ثانیه‌ای همراه با دیالوگ و صدای محیطی تولید می‌شود و خطوط گفتاری مستقیماً در پرامپت نوشته می‌شوند. این پیشرفت در زمینه ادغام صدا و تصویر، یادآور قابلیت‌های صوتی جدیدی است که اخیراً در ابزارهای Firefly با بهره‌گیری از مدل‌های Gemini معرفی شدند.

تولید ویدیو مدت‌ها با «لغزش شخصیت» (Character Drift) دست‌وپنجه نرم می‌کرد؛ وضعیتی که در آن چهره یک فرد بین نماها تغییر می‌کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی پایداری مدل‌های مولد اشاره کردیم، اکثر مدل‌ها هر پرامپت را یک شروع تازه می‌بینند. گوگل برای حل این مسئله، از رویکرد متن-به-ویدیو به سمت گردش‌کار مبتنی بر مرجع حرکت کرده است.

ابزارهای کنترل دقیق

مدل Veo 3.1 قابلیتی به نام «ترکیبات-به-ویدیو» (Ingredients-to-video) معرفی کرده است. این ویژگی به کاربر اجازه می‌دهد تا سه تصویر مرجع از یک شخصیت، شیء یا صحنه را آپلود کند. این کار مثل دادن یک شناسنامه تصویری به مدل است تا محصول یا بازیگر در نماهای مختلف قابل شناسایی بماند. هرچند کیفیت تصویر بهبود یافته، اما طبق گزارش‌های فنی، هنوز احتمال لغزش جزئی در چهره‌ها یا تاری لوگوهای کوچک وجود دارد. این رویکرد استفاده از تصاویر مرجع برای کنترل بصری، مشابه استراتژی به‌روزرسانی xAI برای مدل Grok است که از تعداد بیشتری تصویر مرجع برای دقت بالاتر استفاده می‌کند.

مقایسه Veo 3.1 و Veo 3: مشخصات فنی، صدا، قیمت و نحوه استفاده

علاوه بر تصاویر مرجع، اکنون کنترل فریم اول و آخر نیز فراهم شده است. شما می‌توانید یک عکس برای شروع و یکی برای پایان بدهید و مدل، انتقال بین آن‌ها و صدای مربوطه را تولید می‌کند.

شکستن سقف ۸ ثانیه‌ای

هر بار تولید ویدیو همچنان به ۴، ۶ یا ۸ ثانیه محدود است. اما یک ویژگی جدید برای گسترش صحنه اضافه شده که هر کلیپ جدید را از ثانیه آخر کلیپ قبلی می‌سازد. بر اساس مستندات گوگل، این روش به سازندگان اجازه می‌دهد سکانس‌هایی با طول یک دقیقه یا بیشتر خلق کنند.

سطوح مدل و مشخصات فنی

گوگل سه نسخه از این مدل را از طریق Gemini API، Google AI Studio و Vertex AI ارائه می‌دهد:

  • Standard: سطح باکیفیت با پشتیبانی از رزولوشن 4K و تصاویر مرجع.
  • Fast: نسخه‌ای بهینه برای سرعت که همچنان 4K را پشتیبانی می‌کند.
  • Lite: نسخه اقتصادی با محدودیت رزولوشن 720p و 1080p که قابلیت گسترش صحنه را ندارد.

در به‌روزرسانی ژانویه ۲۰۲۶، گوگل پشتیبانی بومی از نسبت تصویر ۹:۱۶ را برای تصاویر مرجع اضافه کرد تا محتوای عمودی شبکه‌های اجتماعی به‌جای برش خوردن، به‌صورت بومی رندر شوند.

محدودیت‌های فنی و هزینه‌ها

در انتخاب مدل، باید به این محدودیت‌ها دقت کنید:

  • طول کلیپ: در تمام سطوح حداکثر ۸ ثانیه.
  • رزولوشن: مدل Lite تا 1080p و مدل‌های Fast و Standard تا 4K.
  • صدا: در هر سه سطح در دسترس است.

قیمت‌گذاری در Gemini API بر اساس ثانیه‌های تولید شده است. برای کاربران پولی، هزینه مدل Standard در کیفیت 4K هر ثانیه ۶۰ سنت است. این یعنی یک کلیپ ۸ ثانیه‌ای ۳.۲ دلار هزینه دارد. اگر سه بار تلاش کنید و در نهایت چهارمین خروجی قابل استفاده باشد، باید ۹.۶ دلار بپردازید. در مقابل، همین کلیپ در مدل Fast تنها ۰.۹۶ دلار هزینه دارد. این مدل‌های پولی در حالی عرضه می‌شوند که سهمیه‌های تولید رایگان در نسخه‌های قبلی Veo با محدودیت‌های سخت‌گیرانه‌تری روبرو شده بود.

مسیرهای دسترسی

کاربران می‌توانند از طریق اپلیکیشن Gemini، ابزار فیلم‌سازی Flow یا APIهای گوگل به این مدل دسترسی داشته باشند. همچنین پلتفرم‌های واسطی مثل Movby.ai دسترسی به نسخه‌های Lite و Standard را فراهم کرده‌اند که از سیستم اعتباری استفاده می‌کنند.

با وجود پیشرفت‌ها، Veo 3.1 هنوز در رندر متون ریز روی صفحه مشکل دارد. مدل نمی‌تواند آدرس‌های وب یا قیمت‌های کوچک را به‌درستی نمایش دهد. برای بهترین نتیجه، باید از پرامپت‌های دقیق استفاده کنید؛ مثلاً ذکر زاویه دوربین (Handheld medium close-up) و نوع لنز (35mm) و جزئیات صدای محیطی.

این چرخش به سمت «ترکیبات» و صدای بومی نشان می‌دهد گوگل از عصر «پرامپت‌های جادویی» فاصله گرفته و به دنبال کنترل ذره‌بینی برای تدوینگران حرفه‌ای است.

گام بعدی شما

  • اگر برای پروژه‌های تجاری از Movby یا API گوگل استفاده می‌کنید، حتماً شرایط لایسنس هر کدام را بررسی کنید زیرا خروجی‌های رایگان معمولاً غیرتجاری هستند.
  • برای کاهش هزینه‌ها، ابتدا پیش‌نویس‌های خود را در مدل Lite یا Fast تست کنید و تنها برای خروجی نهایی به مدل Standard بروید.
  • از ترکیب تصاویر مرجع و کنترل فریم اول و آخر برای ساخت ویدیوهای کوتاه با تداوم بصری بالا استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این به‌روزرسانی با حل مشکل تداوم شخصیت‌ها، تولید ویدیو را از سطح سرگرمی به ابزاری قابل اتکا برای تبلیغات و سینما تبدیل می‌کند. اعتبار این تغییر در توانایی گوگل برای ادغام بومی صدا و تصویر است که نیاز به ابزارهای جانبی برای صداگذاری را حذف می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API گوگل، توسعه‌دهندگان ایرانی برای دسترسی به Veo 3.1 باید از واسطه‌هایی مانند Movby.ai یا سرویس‌های تغییر آی‌پی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

گوگل با معرفی تصاویر مرجع، عملاً پذیرفت که مهندسی پرامپت برای حفظ تداوم بصری کافی نیست. این تغییر نشان می‌دهد که آینده تولید ویدیو در گروی «کنترل‌های ساختاریافته» است، نه فقط توصیفات متنی. در واقع، مدل‌های مولد در حال تبدیل شدن به ابزارهای تولیدی هستند که به جای تخیل محض، بر اساس داده‌های مرجع کاربر عمل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.