تصور کنید برای یک صحنه پیچیده مینویسید: «مردی بیدار میشود، به سمت پنجره میرود و به شهر نگاه میکند؛ سبک انیمه». نتیجه معمولاً یک انیمیشن «آشغال» است که در آن رنگ موها تغییر میکنند و اشیا بین فریمها ناپدید میشوند.
این اتفاق به این دلیل رخ میدهد که مدل دنیای شما را نمیشناسد؛ هر ثانیه اشیا را از هیچ میسازد و هر بار کمی متفاوت است. طبق گزارشی که در ۱۱ اکتبر ۲۰۲۶ منتشر شد، یک گردشکار ماژولار جدید، امید به پرامپتهای طولانی را با یک خط لوله تولید ۸ مرحلهای جایگزین کرده است. این متد، انیمیشن را به جای یک جهش تخیلی بزرگ، مجموعهای از فراخوانیهای کوچک و کنترلشده میبیند. این رویکرد در واقع پاسخی به شکست ابزارهای تصویری AI در تلهی تنظیمات فنی است که نشان داد بدون یک جریان کاری دقیق، ابزارهای پیشرفته نیز خروجیهای ناپایداری دارند.
همانطور که در تحلیلهای قبلی ما دربارهی محدودیتهای حافظه در مدلهای چندوجهی اشاره کردیم، مدلها نمیتوانند جزئیات یک کتاب را برای هر فریم در ذهن نگه دارند. بنابراین، این روش از تلهی «پرامپتهای طولانی» فاصله میگیرد.

معماری ماژولار
هسته این روش، یک سیستم پوشهبندی ساختاریافته است که هر پرامپت در یک فایل markdown کنار خروجیاش ذخیره میشود. این کار از گم شدن پرامپتهای موفق در تاریخچه چتها جلوگیری میکند و کنترل نسخه را از طریق Git ممکن میسازد. ساختار پروژه به این شکل است:
story/: شامل فایلهایstory.md(داستان)،assets.md(داراییها)،scenes.md(صحنهها)،video.md(کلیپها)،film.txt(لیست تدوین) وcut.sh(اسکریپت ساخت فیلم).- پوشههای
assets/،scenes/وvideo/به همراه فایل نهاییfinal.mp4.
هر پرامپت از یک سرآیند استاندارد سه خطی استفاده میکند: Header (ماهیت پرامپت)، Says (فایل خروجی)، Attach (فایلهای پیشنیاز) و Use (محل استفاده در آینده). با این ساختار، شما پیش از تولید، فیلم را در قالب متن میبینید و تغییر یک پرامپت، کل پروژه را به هم نمیریزد.
گام ۱: داستان کوچک
ثبات با محدود کردن دامنه شروع میشود. نویسنده قانون «۲-۲-۳-۶» را پیشنهاد میدهد زیرا هوش مصنوعی در حفظ هویت در طول زمان ضعیف است:
- دنیاها (حداکثر ۲): هر مکان باید نور و رنگ خاص خود را داشته باشد (مثلاً یک فضای داخلی و یک خارجی).
- شخصیتها (حداکثر ۲): هر شخصیت باید در تمام صحنهها یکسان باشد.
- اشیا (حداکثر ۳): اشیای تکرارشونده (مثل یک ساعت) باید دقیقاً یکی باشند، وگرنه ویدیو خراب میشود.
- صحنهها (حداکثر ۶): هر صحنه یک شات است؛ یک مکان و یک اکشن. اگر به «و سپس» نیاز دارید، یعنی دو صحنه دارید.
گام ۲: داراییها، نه صحنهها
بسیاری از سازندگان به اشتباه از صحنه اول شروع میکنند. این گردشکار دستور میدهد ابتدا داراییها (Assets) با استفاده از GPT Image 2.5 Sunburst ساخته شوند. تمام داراییها باید ۱۶:۹ و با سبکی خاص (رنگهای تخت، سایههای سخت، خطوط تیره و ظاهر انیمههای تلویزیونی) باشند.
قوانین ساخت دارایی:
- اول دنیا: دنیا را خالی بکشید. اگر تخت را در همان ابتدا در اتاق بکشید، بعداً با تخت موجود در فایل
bed.pngتداخل پیدا میکند. - پیوست برای نورپردازی: تصویر دنیا را به پرامپتهای بعدی پیوست کنید تا رنگها و نور مطابقت داشته باشند.
- بدون متن: هیچ برچسب یا حباب گفتاری در این مرحله نباشد.
- شیت شخصیت: یک صفحه شامل سه نمای کامل (جلو، کنار، سه-چهارم) بسازید تا مدل در هر قدم، پاهای شخصیت را متفاوت حدس نزند.
- جزئیات اشیا: برای اشیا، یک نمای با جزئیات بالا بسازید و هر بخش را نامگذاری کنید.
گام ۳: صحنههای خام
هر خط از داستان به یک تصویر در پوشه assets/ تبدیل میشود. در scenes.md ،هر آنچه در شات حضور دارد پیوست میشود. برای صحنه زنگ ساعت، تصاویر room.png ،man.png ،bed.png و clock.png پیوست میشوند و به مدل گفته میشود: «تصاویر پیوست شده تنها منبع حقیقت هستند». این کار وظیفه مدل را از «تخیل» به «کپیبرداری» تغییر میدهد.
گام ۴: دو فریم برای هر صحنه
برای ایجاد حرکت، مدل ویدیو به یک نقطه شروع و پایان نیاز دارد. هر صحنه به دو فریم «اول» و «آخر» تقسیم میشود. برای ساخت فریم دوم، فریم اول پیوست شده و فقط تغییرات توصیف میشوند. مثلاً در صحنه راه رفتن، فقط گفته میشود: «تنها یک تغییر: مرد از اتاق عبور کرده و کنار پنجره ایستاده است».
گام ۵: نیمصفحهها (Half-Screens)
پرشهای ناگهانی بین صحنهها را با «نیمصفحهها» حل کنید؛ شاتهای کوتاه و ثابت از یک جزئیات (مثل چشمها یا دست) که برای یک ثانیه نمایش داده میشوند و جایگزین نقاط ضعف در تغییر موقعیت شخصیت میشوند.
گام ۶: ادغام صدا
به دلیل محدودیتهای فنی در Seedance 2.5 ،پیوست کردن فایل صوتی خارجی اغلب مسیر حرکت فریمها را خراب میکند. بنابراین، صدا و لحن باید در خودِ پرامپت ویدیو نوشته شوند (مثلاً: «صدایی بم و خسته، مردی سی ساله که تازه بیدار شده است»). این رویکرد یادآور نقش متدولوژی نویسندگی در انسانیسازی صدای مصنوعی است که در آن کنترل دقیق روی لحن، کلید خروج از حالت رباتیک است. موسیقی باید در نهایت به صورت یک لایه مجزا روی کل فیلم قرار گیرد.
گام ۷: تولید کلیپ
کلیپها در پوشه video/ با سه قانون ساخته میشوند:
- مدت زمان: دقیقاً ۴ ثانیه.
- حرکت: فقط یک چیز حرکت کند (یا مرد راه برود یا ساعت زنگ بزند).
- طول پرامپت: کوتاه باشد تا کیفیت حرکت افت نکند.
گام ۸: تدوین
اسمبل نهایی با ffmpeg و یک فایل متنی (film.txt) انجام میشود. یک اسکریپت شل (cut.sh) فرآیند را خودکار کرده و برای حذف تیکهای صوتی و تصویری از xfade و acrossfade استفاده میکند.
هزینه و رندرینگ:
بر اساس قیمتهای اکتبر ۲۰۲۶، یک فیلم ۳۴ ثانیهای حدود ۲۴.۶۱ دلار هزینه دارد (۳.۹۱ دلار برای تصاویر و ۲۰.۸۰ دلار برای کلیپها). با احتساب تکرارها، بودجه ۴۰ دلاری پیشنهاد میشود. استراتژی اصلی این است: روی مراحل ارزان (تصاویر) وقت بگذارید تا در مراحل گران (ویدیو) هزینه کمتری کنید.
گام بعدی شما
- ساختار پوشهبندی ماژولار را برای پروژههای کوچک خود پیاده کنید تا از گم شدن پرامپتها جلوگیری کنید.
- قانون «۲-۲-۳-۶» را برای محدود کردن دامنه داستانهایتان به کار ببرید.
- از تکنیک «نیمصفحهها» برای پوشاندن پرشهای بصری در تدوین استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو