پرش به محتوای اصلی
پرش به محتوای مقاله

اتوماسیون B-Roll در تبلیغات AI با استفاده از پرامپت‌های مبتنی بر بینایی

·۴ شهریور ۱۴۰۵۷ دقیقه مطالعه
سه فاز تصویر فرعی هوش مصنوعی: از ضرباهنگ دستی تا برش‌های مبتنی بر بینایی
سه فاز تصویر فرعی هوش مصنوعی: از ضرباهنگ دستی تا برش‌های مبتنی بر بینایی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از مدل‌های بینایی برای «نویسندگی پرامپت» لحظه‌ای بر اساس فریم‌های مجاور؛ این یعنی B-roll دیگر بر اساس حدس مدل، بلکه بر اساس واقعیت بصری صحنه تولید می‌شود.

اگر برای تولید ویدیوهای تبلیغاتی AI هزینه می‌کنید، احتمالاً با مشکل «تخت بودن» احساسی نماهای تک‌شات مواجه شده‌اید. راهکار جدید برای حل این بحران، استفاده از پرامپت‌های نویسندگیِ بصری برای تولید خودکار نماهای B-roll است. یک تحلیل فنی مفصل از وب‌سایت dev.to در ۲۵ اوت ۲۰۲۶ فاش کرد که چگونه یک خط لوله تولیدی تکامل یافته است تا این نماهای برش را نه به عنوان تزئین، بلکه به عنوان «علائم نگارشیِ روایت» ببیند.

اکثر محتواهای تولیدشده توسط کاربر (UGC) که با هوش مصنوعی ساخته می‌شوند، به دلیل نبود نماهای ریتمیک — مثل نمای نزدیک از محصول یا نماهای لایف‌استایل — مصنوعی به نظر می‌رسند. بدون این برش‌ها، یک ویدیو صرفاً یک نمای ایستا و واحد از یک ارائه‌دهنده است. این چالش‌ها در واقع بخشی از تجربه گسترده‌تری است که تولیدکنندگان مستقل برای کوتاه کردن چرخه‌ی تولید ویدیو با ابزارهای AI با آن دست‌وپنجه نرم می‌کنند. چالش اصلی برای هوش مصنوعی این است که B-roll به محدودیت‌های متفاوتی نسبت به صحنه اصلی نیاز دارد؛ در حالی که ارائه‌دهنده به تثبیت هویت، انتقال حرکت و همگام‌سازی صدا (VO sync) نیاز دارد، نماهای B-roll باید اولویت را به دیده‌شدن محصول بدهند و از معرفی چهره‌های انسانی جدید که باعث سردرگمی بیننده می‌شود، بپرهیزند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت و کنترل مدل‌های مولد اشاره کردیم، نبودِ محدودیت‌های سخت‌گیرانه در خروجی‌های AI منجر به نتایج غیرقابل‌پیش‌بینی می‌شود. در اینجا نیز سیستم برای رسیدن به اتوماسیون کامل، سه مرحله تکاملی را طی کرد. این رویکرد در واقع پاسخی به نیاز برای عبور از تک‌پرامپت‌ها به سمت خط لوله‌های تولیدی است تا از لحن رباتیک و خروجی‌های کلیشه‌ای جلوگیری شود.

تکامل سه مرحله‌ای

توسعه این سیستم از یک قوس ساختاریافته پیروی کرد تا پیش از اتوماسیون فرآیند خلاقانه، مدل داده‌ای آن اثبات شود. این پیشرفت از طریق یک پرچم ویژگی (feature flag) برای کاربران پیشرفته به نام UGC_BROLL_ENABLED مدیریت شد که برای هر سطح از فازها، زیر-پرچم‌های (sub-flags) خاصی داشت. این ساختار اجازه می‌داد تا قابلیت‌ها به‌صورت تدریجی عرضه شوند بدون اینکه جریان‌های تولید فعلی (production swipe flows) دچار اختلال شوند.

مرحله اول: جایگذاری دستی ضرب‌آهنگ
در مرحله اول، این قابلیت در قالب «مارکرهای ضرب‌آهنگ برش» در برنامه‌ریز صحنه ابزار عرضه شد. ویراستاران به‌صورت دستی نقاط درج (beats) را روی خط زمانی A-roll (نمای اصلی) مشخص می‌کردند؛ آن‌ها با پیمایش (scrubbing) نمای اصلی، نقاط درج را رها می‌کردند. این فرآیند دقیقاً مانند علامت‌گذاری زمان‌های استراحت در یک ویرایشگر غیرخطی بود که کاربر صرفاً با کلیک کردن، یک جایگاه (slot) برای برش ایجاد می‌کرد.

این فاز مدل داده‌ای BrollBeat را تثبیت کرد که ویژگی‌های زیر را دنبال می‌کرد:

  • id: یک شناسه رشته‌ای منحصر‌به‌فرد.
  • insertAfterSceneId: صحنه‌ای که ضرب‌آهنگ بعد از آن رخ می‌دهد.
  • offsetMs: آفست دقیق در داخل صحنه (به میلی‌ثانیه).
  • durationMs: طول هدف برای نمای برش.
  • brief: یک راهنمای اختیاری برای ویراستار.
  • source: که در این مرحله روی مقدار 'manual' تنظیم شده بود.

اگرچه مرحله اول امکان‌پذیری فنی و مدل داده‌ای را ثابت کرد، اما مقیاس‌پذیری پایینی داشت. برای یک تبلیغ با ۱۲ صحنه و ۳ برش در هر صحنه، ویراستار باید ۳۶ تصمیم دستی برای کلیک می‌گرفت که منجر به ایجاد یک گلوگاه کاری (labor bottleneck) قابل توجه شد. در نتیجه، ویراستاران درخواست کردند که سیستم به جای ارائه جایگاه‌های خالی، زمان‌بندی‌ها را پیشنهاد دهد.

مرحله دوم: اتوماسیون مبتنی بر مرجع
مرحله دوم به‌طور خاص زمانی فعال می‌شد که یک ویدیوی مرجع وجود داشت. این فاز «سوایپ مرجع» (reference swiping) را معرفی کرد؛ جایی که تحلیل‌گر سیستم، بخش‌های B-roll را — یعنی لحظاتی که دوربین از ارائه‌دهنده به سمت محصول یا نماهای لایف‌استایل می‌رفت — استخراج می‌کرد. سپس برنامه‌ریز، این برچسب‌های زمانی را روی خط زمانی A-roll تولیدشده نگاشت می‌کرد.

استعاره «سوایپ» در اینجا لفظی است: زمان‌بندی از مرجع به برنامه تولیدشده «سوایپ» یا منتقل می‌شود و بر اساس یک ضریب مقیاس (scale factor) که ناشی از تفاوت مدت‌زمان صدای مرجع و صدای تولیدشده است، تنظیم می‌گردد. سیستم این بخش‌ها را به سه دسته تقسیم می‌کرد: «محصول» (product)، «لایف‌استایل» (lifestyle) یا «جزئیات» (detail).

این روش فشار کاری را برای اجراهای مبتنی بر مرجع به‌شدت کاهش داد، اما برای حالت «اول-متن» (script-first) هیچ کاربردی نداشت. ویراستارانی که اسکریپت‌های اصلی می‌نوشتند، هیچ زمان‌بندی مرجعی برایTسوایپ کردن نداشتند و همچنان مجبور به جایگذاری دستی بودند.

مرحله سوم: تولید مبتنی بر بینایی
مرحله سوم راهکار کامل است: سیستم اکنون خودِ کلیپ‌های B-roll را تولید می‌کند، نه فقط جایگاه‌های زمانی را. خط لوله تولید از توالی خاصی پیروی می‌کند:

  • پیشنهاد ضرب‌آهنگ: یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — متن را می‌خواند و لحظات مناسب برای برش، مانند رونمایی از محصول، دموهای استفاده یا زمینه‌های لایف‌استایل را پیشنهاد می‌دهد.
  • پرامپت‌های نویسندگی بصری: یک مدل بینایی فریم‌های مجاور A-roll را بررسی می‌کند تا محصول قابل مشاهده، محیط، نورپردازی و پالت رنگی را توصیف کند، در حالی که صراحتاً چهره‌ها و هویت ارائه‌دهنده را حذف می‌کند. این سطح از اتوماسیون بصری یادآور رویکردهای DX Builder در حذف نیاز به مهندسی پرامپت برای نورپردازی دوربین است که پیچیدگی‌های فنی را برای کاربران غیرمتخصص ساده می‌کند.
  • تولید: مدل ویدیو، کلیپ را با استفاده از این پرامپت‌های مستند (grounded) و محدودیت‌های سخت‌گیرانه «بدون انسان» رندر می‌کند.
  • یادداشت ویراستار: ویراستاران می‌توانند متن‌های جایگزین اختیاری ارائه دهند که با پرامپت بصری ادغام می‌شود.

پرامپت‌های نویسندگی بصری مشکل توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، مثل دوستی که خاطره‌ای را اشتباه تعریف می‌کند — را حل می‌کند. پرامپت‌های متنی خالص اغلب «زنی در آشپزخانه‌ای آفتابی در حالی که محصول را نگه داشته» تولید می‌کنند، در حالی که فریم A-roll در واقع یک میز حمام با نور سرد را نشان می‌دهد. با مبنی‌سازی (Grounding) پرامپت در فریم واقعی، B-roll با جغرافیای صحنه مطابقت می‌یابد.

حل بحران هویت

یک مانع فنی بزرگ در مرحله سوم، «سردرگمی هویت» بود. اگر یک نمای برش چهره‌ای انسانی و عمومی را نشان دهد — حتی یک فردی که شبیه مدل‌های استوک است — بینندگان ناخودآگاه هویت شخصیت اصلی را بازتعریف می‌کنند. این یعنی ارائه‌دهنده در صحنه چهار دیگر با ارائه‌دهنده در صحنه هفت مطابقت ندارد، زیرا چهره موجود در B-roll به یک لنگر (anchor) رقیب تبدیل شده است.

برای جلوگیری از این اتفاق، پلتفرم یک محدودیت سه لایه «بدون انسان» را پیاده‌سازی کرد:

  • پرامپت‌های منفی: حذف صریح چهره‌ها، فیگورهای کامل انسانی و دست‌هایی با ویژگی‌های شناسایی‌شدنی.
  • تضمین کیفیت بصری (Vision QA): اسکن فریم‌های پس از تولید که اگر چهره‌ای بالاتر از یک آستانه اطمینان خاص تشخیص داده شود، کلیپ را رد می‌کند.
  • جایگزین محصول‌محور: اگر تولید بدون انسان دو بار شکست بخورد، سیستم به‌طور پیش‌فرض به یک انیمیشن قهرمان (hero animation) از محصول بدون زمینه لایف‌استایل بازمی‌گردد.

ادغام فنی و معیارها

این استقرار نیازمند تغییرات عمیق در خط لوله‌های دوخت (stitching) و صدا بود. سیستم اکنون از شبیه‌سازی صدای ElevenLabs برای روایت‌های تکمیلی در B-roll استفاده می‌کند تا تضمین شود روایت‌های الحاقی با صدای ارائه‌دهنده و با اهداف زمان‌بندی کوتاه‌تر مطابقت دارد.

اصلاحات فنی اضافی شامل موارد زیر بود:

  • کنترل درج بین صحنه‌ها: ضرب‌آهنگ‌های B-roll اکنون می‌توانند در مرز صحنه‌ها به عنوان «بخش‌های پل» (bridge segments) با هم‌پوشانی صوتی J-cut درج شوند که برای شکست‌های طبیعی پاراگراف در اسکریپت مفید است.
  • ترتیب دوخت: بخش‌های B-roll با استفاده از شاخص‌های صریح خط زمانی (timeline indices) به جای ترتیب نام فایل، با کلیپ‌های A-roll در هم می‌آمیزند.
  • همگام‌سازی مدت‌زمان: طول نمای برش به مدت‌زمان ضرب‌آهنگ محدود (clamp) می‌شود؛ مقدار اضافی باعث برش (trim) و مقدار کمتر باعث گسترش فریم ثابت (hold-frame extension) می‌شود.
  • اعتبارسنجی لینک درایو: برای رفع باگی که در آن پیش‌نمایش‌های گوگل درایو موضوع اشتباهی را نشان می‌دادند، تیم اعتبارسنجی کپشن و بررسی‌های بدون انسان را روی کلیپ‌های مرجع آپلودشده اضافه کرد.

بر اساس معیارهای داخلی گزارش‌شده، انتقال به مرحله سوم بازدهی را به‌شدت تغییر داد:

معیار مرحله ۱ (دستی) مرحله ۲ (مرجع) مرحله ۳ (AI)
زمان ویراستار در هر اجرا ۸–۱۲ دقیقه ۲–۳ دقیقه (بازبینی) ۳–۵ دقیقه (تأیید/راهنما)
سردرگمی هویت کم کم ۶٪ $ \rightarrow $ کمتر از ۱٪ (بعد از QA)
ارتباط با متن ندارد متوسط بالا (مبنی بر بینایی)

بازبینی و الگوها

تیم توسعه در بازبینی نهایی اشاره کرد که محدودیت «بدون انسان» باید از همان مرحله اول در کتابخانه پرامپت‌های مشترک تعریف می‌شد. چون این مورد در مرحله سوم به‌صورت اصلاحی (retrofit) اضافه شد، برخی ویراستاران در فاز دستی جایگاه‌هایی را ایجاد کرده بودند که بعدها با کلیپ‌های حاوی چهره پر شدند. علاوه بر این، نمایش سطح فاز (phase tier) در مانیفست اجرا می‌توانست با شفاف کردن اینکه آیا یک اجرا از ضرب‌آهنگ‌های دستی، سوایپ مرجع یا تولید AI استفاده کرده، تعداد تیکت‌های پشتیبانی را کاهش دهد.

این رویکرد مرحله‌ای — حرکت از کنترل دستی به استنتاج (Inference) خودکار و در نهایت تولید مستند — الگویی قابل استفاده برای سایر ویژگی‌های مولد پیچیده فراهم می‌کند. با ثابت نگه داشتن مدل داده‌ای (BrollBeat) در تمام فازها، تیم توانست بدون ایجاد انشعاب (forking) در خط لوله دوخت، قابلیت‌ها را مقیاس‌بندی کند.

برای کسانی که ابزارهای ویدیویی AI می‌سازند، نکته کلیدی ضرورت «محدودیت‌های دامنه» (domain constraints) است. چه B-roll بدون انسان باشد، چه قفل محصول یا اعتبارسنجی لینک‌های کپشن‌دار، هوش مصنوعی را نمی‌توان به پرامپت‌های کلی سپرد؛ بلکه باید آن را به واقعیت بصری فریم‌های اطراف گره زد.

گام بعدی شما

  • اگر از ابزارهای تولید ویدیو استفاده می‌کنید، سعی کنید پرامپت‌های خود را بر اساس توصیف دقیق فریم‌های قبلی (Image-to-Text) بنویسید تا انسجام بصری حفظ شود.
  • برای کاهش نرخ توهم در ویدیوها، از پرامپت‌های منفی (Negative Prompts) برای حذف عناصر مزاحم مانند چهره‌های تصادفی استفاده کنید.
  • بررسی کنید که آیا ابزار شما قابلیت همگام‌سازی ریتمیک (Beat-matching) دارد یا همچنان به جایگذاری دستی متکی است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این سیستم با کاهش زمان ویرایش از ۱۲ دقیقه به ۳ دقیقه، هزینه‌های تولید محتوای تبلیغاتی را به‌شدت کاهش می‌دهد. تخصص تیم در پیاده‌سازی لایه‌های QA بصری، استانداردی جدید برای جلوگیری از توهمات بصری در صنعت ویدیو ایجاد کرده است.

تأثیر برای ایران

این رویکرد برای آژانس‌های دیجیتال مارکتینگ ایران که از ابزارهای AI برای تولید UGC استفاده می‌کنند، راهکاری برای کاهش هزینه‌های تدوین و افزایش کیفیت بصری است.

·نگاه ما
تحریریه دات‌هوش

اتوماسیون واقعی در تولید محتوا نه در تولید «هر چیزی»، بلکه در تعریف «چه چیزی نباید تولید شود» نهفته است. حذف چهره‌های تصادفی برای حفظ هویت شخصیت، نشان می‌دهد که آینده‌ی ابزارهای AI در لایه‌های نظارتی (Guardrails) و نه فقط در قدرت مدل‌های مولد است. این رویکرد، مدل تولید ویدیو را از یک ابزار خلاقانه به یک ابزار مهندسی‌شده تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.