تصور کنید تمام سهمیهٔ ماهانهٔ پردازش خود در Runway Gen-3 یا Kling AI را صرف تولید ویدیوهایی کنید که در نهایت به دلیل خطاهای بصری در ابعاد سهبعدی، غیرقابل استفاده هستند. برای حل این مشکل، در ۱ اکتبر ۲۰۲۶ چارچوبی جدید معرفی شد که پرامپتهای ویدیو را بهجای توصیفات انتزاعی، به عنوان یک معماری ساختاریافته در دو سطح تعریف میکند.
بسیاری از سازندگان فعلاً به روش آزمون و خطای کورکورانه تکیه میکنند؛ روشی که با توجه به نیاز شدید مدلهایی مثل Luma، Google VEO و Sora به واحد پردازش گرافیکی (GPU) — که مثل موتورهای قدرتمند اما گرانقیمت یک کارخانه است — بسیار هزینهبر است. این چالشها در حالی رخ میدهد که برخی مدلها برای کاهش خطا، به جای تولید مستقیم پیکسل، از رویکردهای مبتنی بر کدهای انیمیشن استفاده میکنند تا خروجیهای پیشبینیپذیرتری داشته باشند. طبق گزارشهای فنی، این ناکارآمدی به این دلیل رخ میدهد که صفتهای معمولی در متن، بهدرستی به بردارهای حرکت دوربین یا وضعیتهای پیچیده نورپردازی تبدیل نمیشوند.

همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای مولد اشاره کردیم، کلید کاهش هزینه در ساختاردهی به ورودیهاست. بر اساس مستندات این روش جدید، هر کلیپ مرجع به دو لایه مجزا تقسیم میشود:
لایه اول: پرامپت پایه
این لایه وضعیت اولیه و ایستا را تعیین میکند و بر موارد زیر تمرکز دارد:
- سوژه و محیط: استفاده از اسمهای دقیق و بدون ابهام برای تعریف فضای محیط.
- نورپردازی حجمی: تعیین ماتریسهای نوری دقیق (مانند سایهپردازی کیاروسکورو) برای جلوگیری از رندرهای تخت و بیروح.
لایه دوم: پرامپت کارگردان
این لایه تغییرات زمانی را اعمال میکند تا از ایجاد آرتیفکتهای بصری یا دفرمه شدن تصویر جلوگیری کند:
- اپتیک دوربین: تعریف دقیق حرکاتی مثل Dolly Zoom یا چرخشهای کرین.
- شتابهای حرکتی: تعریف سرعت سوژه بر اساس محورهای مختصاتی (مثلاً «شتاب در محور Z») بهجای استفاده از افعال کلی مثل «دویدن».
برای کسانی که توانایی محاسبه دستی این فیزیک را ندارند، پلتفرم VromptAI اکنون این فرآیند را خودکار کرده است. این سامانه ساختارهای ماشینخوان را مستقیماً از فایلهای منبع استخراج کرده و ویدیو را به پارامترهای متنی آماده برای تولید تبدیل میکند. این نوع اتوماسیون در واقع تکامل یافتهی همان جریانهای کاری خودکار در رابط Sora 2 Pro است که هدفش حذف مراحل تکراری در استودیوهای تولید است.
این چرخش، تجربه تولید ویدیو با هوش مصنوعی را از یک «ماشین قمار» به یک فرآیند مهندسی قطعی تبدیل میکند. با جداسازی «چیستی» (لایه ۱) از «چگونگی» (لایه ۲)، سازندگان میتوانند بدون تولید مجدد کل سکانس، تنها بخشهای خطادار را اصلاح کنند و از این طریق بودجهٔ محاسباتی خود را حفظ کنند. این دقت در کنترل پارامترها، شباهت زیادی به سیستمهای تضمین اصالت بصری در Seedance دارد که برای حفظ یکپارچگی بصری در تولیدات چندوجهی طراحی شدهاند.
گام بعدی شما
- گرانترین تولیدات شکستخورده خود را بررسی کنید تا بفهمید خطا مربوط به سوژه (لایه ۱) بوده یا حرکت (لایه ۲).
- از ابزارهای خودکار برای تبدیل ویدیوهای مرجع به پرامپتهای ساختاریافته استفاده کنید.
- در پرامپتهای خود بهجای افعال توصیفی، از مختصات حرکتی و اصطلاحات اپتیک دوربین بهره ببرید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است؛ برای درک نحوه مدیریت حافظه در این مدلها، به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو