پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش جدید: تبدیل اسکرین‌شات به داده، خطاهای بصری ویدیو را گرفت

·۱۶ مرداد ۱۴۰۵۶ دقیقه مطالعه۱ بازدید
عنوان مقاله: «عوامل هوش مصنوعی نمی‌توانند ویدیو ببینند. مال من با این حال سه فیلم ساخت.»
عنوان مقاله: «عوامل هوش مصنوعی نمی‌توانند ویدیو ببینند. مال من با این حال سه فیلم ساخت.»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی روش «رندرینگ قطعی» برای تبدیل خروجی بصری به داده‌های عددی؛ این اولین بار است که یک عامل هوش مصنوعی بدون داشتن حس بینایی، تنها از طریق تحلیل ریاضی و اسکرین‌شات، خطاهای فیزیکی ویدیو (مانند برخورد اشیاء) را با دقت ۱۰۰٪ اصلاح می‌کند.

تصور کنید کارگردانی را تصور کنید که هرگز فیلم خود را ندیده است، اما می‌داند دقیقاً کجا باید هر پیکسل را جابه‌جا کند تا صحنه بی‌نقص شود. مارتین کرپان (Martin Krpan) ثابت کرد که یک عامل (Agent) — سیستم‌های خودکاری که می‌توانند هدف را برنامه‌ریزی و اجرا کنند — حتی بدون داشتن حس بینایی، قادر است فیلم‌هایی صیقل‌خورده بسازد بدون اینکه حتی یک فریم از ویدیوهای متحرک را ببیند.

به نقل از مستندات این پروژه، کرپان در مجموعه‌ای از آزمایش‌های الهام‌گرفته از فیلم مرورگری «ارباب حلقه‌ها» اثر آندری کارپاتی (که او آن را «تا حدی نپخته اما سرگرم‌کننده» می‌نامید)، نشان داد که اگر فریم‌های ویدیو را به عنوان توابعی خالص از زمان تعریف کنیم، یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیارد‌ها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — می‌تواند با تحلیل تصاویر ثابت و مقادیر عددی، خروجی خود را ممیزی کند. این روش به‌طور مؤثری محدودیت بنیادین مدل‌های زبانی در «دیدن» و ممیزی دنیایی را که می‌سازند، دور می‌زند. این رویکرد یادآور تلاش‌های گسترده‌تر برای استانداردسازی کیفیت در تولیدات بصری است، مشابه آنچه در متد جدید ارزیابی خط لوله waoowaoo برای عبور از سطح زیبایی تک‌فریم و رسیدن به ثبات بصری مشاهده کردیم.

این دستاورد در حالی می‌رسد که جریان‌های کاری عامل‌محور اغلب با توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — دست‌وپنجه نرم می‌کنند و خروجی‌هایی تولید می‌کنند که برای خود مدل درست به نظر می‌رسند اما در واقعیت شکست می‌خورند. همان‌طور که در تحلیل قبلی ما درباره‌ی ارزیابی‌های استوار هوش مصنوعی اشاره کردیم که عامل‌ها نمی‌توانند آن‌ها را دور بزنند، کلید حل این مشکل، پیاده‌سازی یک «مهارگاه» (Harness) است که مدل را مجبور می‌کند صحت خروجی خود را از طریق اندازه‌گیری‌ها به جای حدس و گمان ثابت کند. این پروژه شبیه معمار نابینایی است که ساختمان را نمی‌بیند، اما مختصات هر آجر را با نقشه چک می‌کند تا از صحت اجرا مطمئن شود.

موتور قطعی‌ساز (Determinism Engine)

مرکز این پروژه یک خط زمانی قطعی است که در آن هر پیکسل تابعی از زمان است. طبق اعلام کرپان، در زمان اجرا از هیچ عدد تصادفی (مانند Math.random) استفاده نمی‌شود. این یعنی رفتن به ثانیه ۴۹.۵ فیلم، در هر مرورگری دقیقاً یک تصویر یکسان تولید می‌کند. این قطعیت، سنگ‌بنای پروژه است: اگر فریم یک تابع خالص از زمان باشد، یک اسکرین‌شات تبدیل به یک «سنجش» یا اندازه‌گیری می‌شود. این اجازه می‌دهد عامل، تصویر را تحلیل کرده (تنها حس بصری که یک LLM دارد)، هش‌های پیکسلی را بین اجراهای مختلف مقایسه کند و ویدیو را فریم‌به‌فریم صادر کند. چنین پردازش‌های دقیق و متمرکزی در محیط وب، پتانسیل‌های جدیدی را برای ابزارهای ویرایش ویدیو می‌گشاید، همان‌طور که Timeline Studio با بهره‌گیری از WebGPU توانست پردازش‌های سنگین ویدیو را مستقیماً در مرورگر پیاده کند.

کرپان برای هر سه اجرا، قوانین سخت‌گیرانه «صفر دارایی» (Zero assets) را اجرا کرد. هیچ مدل سه‌بعدی، بافت (Texture) یا فایل‌های خارجی تصویر، فونت یا صوتی مجاز نبود. تمام هندسه‌ها با استفاده از اشکال اولیه کتابخانه Three.js ساخته شدند و صداها مستقیماً در مرورگر سنتز شدند. تنها استثنا، روایت داستان بود که با یک ابزار رایگان پیش‌ساخته شده بود، هرچند هر فیلم بدون آن نیز به طور کامل کار می‌کند.

عامل هوش مصنوعی نمی‌تواند ویدیو ببیند. مال من سه فیلم ساخت.

سه سطح اعتبارسنجی

این آزمایش در سه مرحله تکامل یافت تا مرزهای خود-اصلاحی هوش مصنوعی و کلاس‌های مختلف باگ‌ها بررسی شود:

فیلم اول: حلقه اسکرین‌شات
این مرحله روی یک صحنه واحد (ملاقات در جاده) متمرکز بود که ۷۵ ثانیه طول داشت و در ۱۱ نما (Shot) سازماندهی شد. یک عامل Claude طی ۷.۵ ساعت زمان ساخت، ۳۵۰۵ خط کد TypeScript تولید کرد.

  • مکانیسم: پس از ساخت، اسکریپتی خط زمانی را جستجو کرده و اسکرین‌شات می‌گرفت. سپس عامل، مانند یک کارگردان، این تصاویر ثابت را نقد می‌کرد و مواردی چون کادربندی، مقیاس، فیگورها و تداخل‌های مش (Mesh intersecions) را بررسی می‌کرد.
  • خود-اصلاحی: عامل به‌طور خودکار بیش از ۲۴ نقص را شناسایی کرد. از جمله مواردی که پوزه مادیان ۴۳ درجه به سمت بالا بود (که AI آن را شاخ تشخیص داد)، سر امپراتور که از سقف کالسکه بیرون زده بود، و دو نما از جاده خالی، چون کالسکه هنوز نرسیده بود.
  • عنصر انسانی: در حالی که بازبینی خودکار به نتیجه «درست» رسید، اما هرگز متوجه نشد که فیلم «زشت» است. چهار نظر کوتاه انسانی (مثلاً «ظاهر کم-پولی واقعاً زشت است»، «صدای پس‌زمینه آزاردهنده است»، «راوی رباتیک است» و «دیسکورد می‌گوید حداکثر ۱۵ مگابایت») باعث واکنش‌های مهندسی شد. نتیجه این شد که مدل از Bloom HDR، نورپردازی ساعت طلایی (Golden-hour)، ریمیکس صدای ۶۰٪ آرام‌تر، صداهای عصبی و کدگذاری دو مرحله‌ای برای کاهش حجم فایل به ۱۳.۴ مگابایت استفاده کرد.

فیلم دوم: مهارگاه خصمانه
این اجرا مقیاس بیشتری داشت و کل داستان را در ۱۰ صحنه و ۲۶۰ ثانیه پوشش داد که در مجموع حدود ۱۴۸۰۰ خط کد بود. در این مرحله از تیمی متشکل از سه عامل استفاده شد: یک برنامه‌ریز، یک سازنده و یک مدل رقیب از OpenAI Codex که نقش «مخالف» یا Adversary را داشت.

  • نقش مخالف: مدل Codex پیش از آنکه هر کدی نوشته شود، برنامه را مورد حمله قرار داد و ۱۶ یافته ارائه کرد. مهم‌ترین مورد این بود که Codex متوجه شد یک جمله دیالوگ در لیست نماها، در متن اصلی وجود ندارد؛ مدل اول جمله را از حافظه بازنویسی کرده بود. Codex با استخراج داده‌های منبع ویکی‌سورس (Wikisource) ثابت کرد که متن اشتباه است. این منجر به ایجاد یک اعتبارسنج جدید شد: هر زیرنویس و خط روایت باید دقیقاً یک زیر-رشته (Substring) از متن سال ۱۸۵۸ باشد.
  • ناورداهای ماشین-بررسی‌پذیر: زیبایی‌شناسی از طریق شش کلاس ناوردا (Invariants) قابل اندازه‌گیری شد: پالت رنگی محدود به ثابت‌های نام‌گذاری شده، اندازه اشیاء با تلورانس ۱۰٪ نسبت به مقادیر اعلام شده، تعداد دقیق چراغ‌ها، سقف‌های عملکردی (Performance Ceilings) و محدودیتی که هیچ شیئی نباید بیش از ۰.۵ متر خارج از یک برش (Cut) جابه‌جا شود.
  • قطعیت پیکسلی: دو رندر تازه با هم مقایسه شدند که تفاوت پیکسلی ۰.۰۰۰۰٪ را نشان دادند. این بررسی باعث شناسایی یک باگ «وابستگی به ترتیب فریم» در شمشیر دوئل شد که به موقعیت دست غول در فریم قبلی وابسته بود. این خطا زمانی که مستقیماً به آن لحظه می‌رفتند، به صورت تفاوت پیکسلی ۰.۲٪ ظاهر می‌شد، در حالی که در پخش عادی دیده نمی‌شد.

عنوان مقاله: «عوامل هوش مصنوعی نمی‌توانند ویدیو ببینند. مال من با این حال سه فیلم ساخت.»

فیلم سوم: اسکن عددی
در این مرحله با استفاده از GPT-5.6 Codex به صورت تعاملی، فیلم مانند یک پروژه نمایشگاه علمی با معیارهای پذیرش عددی (Numeric pass criteria) پیش از ارزیابی مدیریت شد. فیلم ۷۸ ثانیه طول داشت (۱۸۷۲ فریم در ۲۴ فریم بر ثانیه).

  • اسکن جامع برخورد: تک‌تک فریم‌ها برای تداخل بین جعبه‌های محدودکننده (Bounding boxes) تمام اشیاء متحرک اسکن شدند. این کار خطاهایی را یافت که بازبینی تصاویر ثابت نمی‌دید: اسب‌هایی که به مدت ۸ ثانیه درون بدن کرپان حرکت می‌کردند و میله کالسکه که برای ۱۵ ثانیه از روی مادیان رد می‌شد. پس از اولین اسکن که چهار بازه برخورد طولانی را یافت، اسکن نهایی ۰ تخلف را در تمام ۱۸۷۲ فریم نشان داد.
  • دقت کینماتیک: چرخش چرخ‌ها به جای استفاده از یک ضریب بصری، از طریق فاصله و شعاع مشتق شد. این منجر به خطای لغزش نهایی تنها ۱.۶ × ۱۰⁻⁷ واحد صحنه در هر فریم شد و هیچ فریمی در آن چرخ‌ها به عقب نمی‌چرخیدند.
  • تأیید نهایی: خروجی‌های MP4 فریم‌به‌فریم رمزگشایی شدند تا اطمینان حاصل شود که دقیقاً ۱۸۷۲ فریم H.264 در هر دو نسخه اسلوونیایی و انگلیسی وجود دارد.

جدول نتایج

ویژگی فیلم ۱ فیلم ۲ فیلم ۳
دامنه صحنه ۱، ۷۵ ثانیه کل داستان، ۲۶۰ ثانیه بازگویی صحنه ۱، ۷۸ ثانیه
سازنده یک عامل Claude برنامه‌ریز/سازنده Claude + مخالف Codex GPT-5.6 Codex (تعاملی)
کد ۳۵۰۵ خط حدود ۱۴۸۰۰ خط حدود ۳۱۴۰ خط
اعتبارسنجی بازبینی اسکرین‌شات ۶ ناوردا، تفاوت پیکسلی ۰.۰۰۰۰٪ اسکن تمام ۱۸۷۲ فریم، معیارهای عددی
خطاهای یافت شده ۲۴+ نقص بصری نقل‌قول ساختگی، باگ ترتیب فریم ۴ بازه برخورد، چرخ‌های معکوس
هزینه - حدود ۱.۴ میلیون توکن -

این متدولوژی ثابت می‌کند که سه دسته از باگ‌های مجزا — نقص‌های بصری، خطاهای پخش مستمر و برخوردهای عددی — به سه نوع اسکن متفاوت نیاز دارند. تکیه بر هر یک از این روش‌ها به تنهایی، توسعه‌دهنده را گمراه خواهد کرد.

تحلیل: سلیقه در مقابل کد

برای یک توسعه‌دهنده عملی، این رویکرد نقش انسان را از «کدنویس» به «کیوریتور» یاภัراق تغییر می‌دهد. در هر سه فیلم، انسان حتی یک خط کد را ویرایش نکرد. انسان تنها انتخاب داستان، محدودیت‌های فنی و قضاوت‌های کیفی تک‌جمله‌ای را ارائه داد، در حالی که عامل‌ها مهندسی و شکار باگ‌ها را مدیریت کردند. در فیلم دوم، هزینه توکن ۱.۴ میلیون تقریباً به قیمت یک بلیط سینما برای یک اقتباس دوزبانه بود که احتمالاً هیچ استودیویی بودجه‌اش را تأمین نمی‌کرد. این سطح از بهینه‌سازی در گردش کار تولید، مشابه استراتژی‌هایی است که نتفلیکس برای بهینه‌سازی ۳۰۰ اثر با هوش مصنوعی به کار گرفت تا بدون کاهش بودجه، کیفیت و کارایی را افزایش دهد.

این نشان می‌دهد که آینده تولید ویدیو و محیط‌های سه‌بعدی با هوش مصنوعی لزوماً در «چشم‌های بهتر» (درک چندوجهی یا Multimodal) نیست، بلکه در «مهارگاه‌های بهتر» است. اگر بتوانیم خروجی‌های بصری را به داده‌های قابل تأیید تبدیل کنیم، می‌توانیم به عامل‌ها اعتماد کنیم تا دنیاهای پیچیده‌ای بسازند که از نظر ریاضی تضمین شده‌اند که درست هستند.

برای مشاهده نتایج این کارگردانی «نابینا»، می‌توانید نسخه‌های زنده فیلم‌ها را در krpan.hellonunc.com بررسی کنید.

گام بعدی شما

  • اگر از عامل‌های هوش مصنوعی برای تولید محتوای بصری استفاده می‌کنید، به‌جای تکیه بر بازبینی چشمی، برای متغیرهای کلیدی خود «ناورداهای عددی» (Invariants) تعریف کنید.
  • بررسی کنید که آیا خروجی‌های مدل شما «قطعی» هستند یا با هر بار اجرا تغییر می‌کنند؛ برای رسیدن به دقت صنعتی، باید تصادفی بودن را حذف کنید.
  • نتایج این کارگردانی نابینا را در سایت krpan.hellonunc.com مشاهده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی اثبات می‌کند که می‌توان بدون نیاز به سخت‌افزارهای سنگین رندرینگ، تنها با کنترل ریاضی، تولید ویدیو را از حالت «شانسی» به حالت «مهندسی شده» برد. این تغییر، نقش انسان را از کدنویس به کیوریتور (Curator) تبدیل می‌کند که تنها استانداردهای کیفی را تعیین می‌کند.

تأثیر برای ایران

این رویکرد به‌دلیل تکیه بر کتابخانه‌های متن‌باز مانند Three.js و استفاده از APIهای متنی، مسیر توسعه ابزارهای تولید محتوای بصری را برای برنامه‌نویسان ایرانی بدون نیاز به GPUهای بسیار گران‌قیمت هموار می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «بینایی» با «اندازه‌گیری عددی» پارادایم تولید محتوای AI را تغییر می‌دهد. این رویکرد نشان می‌دهد که برای رسیدن به کیفیت استودیویی، نیاز به مدل‌های چندوجهی (Multimodal) پیشرفته‌تر نداریم، بلکه به «مهارگاه‌های» (Harnesses) دقیق‌تری نیاز داریم که خروجی‌های بصری را به داده‌های قابل اثبات تبدیل کنند. در واقع، اعتماد به عامل‌ها نه در توانایی دیدن آن‌ها، بلکه در توانایی ما برای ریاضی‌وار کردنِ معیارهای بصری است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.