تصور کنید میخواهید یک تبلیغ ویدیو بسازید اما چهره مدل شما در هر نما تغییر میکند؛ این کابوس همیشگی تولیدکنندگان محتواست. گوگل با بهروزرسانی Veo 3.1، این مشکل را با سیستمی حل کرده که اجازه میدهد شخصیتها در تمام طول ویدیو ثابت بمانند.
طبق اعلام گوگل در ۱۵ اکتبر ۲۰۲۵، مدل Veo 3.1 و نسخه سریع آن (Fast)، تغییری بنیادین ایجاد کردهاند: عبور از ویدیوهای بیصدا به سمت صدای بومی. حالا یک کلیپ ۸ ثانیهای همراه با دیالوگ و صدای محیطی تولید میشود و خطوط گفتاری مستقیماً در پرامپت نوشته میشوند. این پیشرفت در زمینه ادغام صدا و تصویر، یادآور قابلیتهای صوتی جدیدی است که اخیراً در ابزارهای Firefly با بهرهگیری از مدلهای Gemini معرفی شدند.
تولید ویدیو مدتها با «لغزش شخصیت» (Character Drift) دستوپنجه نرم میکرد؛ وضعیتی که در آن چهره یک فرد بین نماها تغییر میکند. همانطور که در تحلیلهای قبلی ما دربارهی پایداری مدلهای مولد اشاره کردیم، اکثر مدلها هر پرامپت را یک شروع تازه میبینند. گوگل برای حل این مسئله، از رویکرد متن-به-ویدیو به سمت گردشکار مبتنی بر مرجع حرکت کرده است.
ابزارهای کنترل دقیق
مدل Veo 3.1 قابلیتی به نام «ترکیبات-به-ویدیو» (Ingredients-to-video) معرفی کرده است. این ویژگی به کاربر اجازه میدهد تا سه تصویر مرجع از یک شخصیت، شیء یا صحنه را آپلود کند. این کار مثل دادن یک شناسنامه تصویری به مدل است تا محصول یا بازیگر در نماهای مختلف قابل شناسایی بماند. هرچند کیفیت تصویر بهبود یافته، اما طبق گزارشهای فنی، هنوز احتمال لغزش جزئی در چهرهها یا تاری لوگوهای کوچک وجود دارد. این رویکرد استفاده از تصاویر مرجع برای کنترل بصری، مشابه استراتژی بهروزرسانی xAI برای مدل Grok است که از تعداد بیشتری تصویر مرجع برای دقت بالاتر استفاده میکند.

علاوه بر تصاویر مرجع، اکنون کنترل فریم اول و آخر نیز فراهم شده است. شما میتوانید یک عکس برای شروع و یکی برای پایان بدهید و مدل، انتقال بین آنها و صدای مربوطه را تولید میکند.
شکستن سقف ۸ ثانیهای
هر بار تولید ویدیو همچنان به ۴، ۶ یا ۸ ثانیه محدود است. اما یک ویژگی جدید برای گسترش صحنه اضافه شده که هر کلیپ جدید را از ثانیه آخر کلیپ قبلی میسازد. بر اساس مستندات گوگل، این روش به سازندگان اجازه میدهد سکانسهایی با طول یک دقیقه یا بیشتر خلق کنند.
سطوح مدل و مشخصات فنی
گوگل سه نسخه از این مدل را از طریق Gemini API، Google AI Studio و Vertex AI ارائه میدهد:
- Standard: سطح باکیفیت با پشتیبانی از رزولوشن 4K و تصاویر مرجع.
- Fast: نسخهای بهینه برای سرعت که همچنان 4K را پشتیبانی میکند.
- Lite: نسخه اقتصادی با محدودیت رزولوشن 720p و 1080p که قابلیت گسترش صحنه را ندارد.
در بهروزرسانی ژانویه ۲۰۲۶، گوگل پشتیبانی بومی از نسبت تصویر ۹:۱۶ را برای تصاویر مرجع اضافه کرد تا محتوای عمودی شبکههای اجتماعی بهجای برش خوردن، بهصورت بومی رندر شوند.
محدودیتهای فنی و هزینهها
در انتخاب مدل، باید به این محدودیتها دقت کنید:
- طول کلیپ: در تمام سطوح حداکثر ۸ ثانیه.
- رزولوشن: مدل Lite تا 1080p و مدلهای Fast و Standard تا 4K.
- صدا: در هر سه سطح در دسترس است.
قیمتگذاری در Gemini API بر اساس ثانیههای تولید شده است. برای کاربران پولی، هزینه مدل Standard در کیفیت 4K هر ثانیه ۶۰ سنت است. این یعنی یک کلیپ ۸ ثانیهای ۳.۲ دلار هزینه دارد. اگر سه بار تلاش کنید و در نهایت چهارمین خروجی قابل استفاده باشد، باید ۹.۶ دلار بپردازید. در مقابل، همین کلیپ در مدل Fast تنها ۰.۹۶ دلار هزینه دارد. این مدلهای پولی در حالی عرضه میشوند که سهمیههای تولید رایگان در نسخههای قبلی Veo با محدودیتهای سختگیرانهتری روبرو شده بود.
مسیرهای دسترسی
کاربران میتوانند از طریق اپلیکیشن Gemini، ابزار فیلمسازی Flow یا APIهای گوگل به این مدل دسترسی داشته باشند. همچنین پلتفرمهای واسطی مثل Movby.ai دسترسی به نسخههای Lite و Standard را فراهم کردهاند که از سیستم اعتباری استفاده میکنند.
با وجود پیشرفتها، Veo 3.1 هنوز در رندر متون ریز روی صفحه مشکل دارد. مدل نمیتواند آدرسهای وب یا قیمتهای کوچک را بهدرستی نمایش دهد. برای بهترین نتیجه، باید از پرامپتهای دقیق استفاده کنید؛ مثلاً ذکر زاویه دوربین (Handheld medium close-up) و نوع لنز (35mm) و جزئیات صدای محیطی.
این چرخش به سمت «ترکیبات» و صدای بومی نشان میدهد گوگل از عصر «پرامپتهای جادویی» فاصله گرفته و به دنبال کنترل ذرهبینی برای تدوینگران حرفهای است.
گام بعدی شما
- اگر برای پروژههای تجاری از Movby یا API گوگل استفاده میکنید، حتماً شرایط لایسنس هر کدام را بررسی کنید زیرا خروجیهای رایگان معمولاً غیرتجاری هستند.
- برای کاهش هزینهها، ابتدا پیشنویسهای خود را در مدل Lite یا Fast تست کنید و تنها برای خروجی نهایی به مدل Standard بروید.
- از ترکیب تصاویر مرجع و کنترل فریم اول و آخر برای ساخت ویدیوهای کوتاه با تداوم بصری بالا استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو