پرش به محتوای اصلی
پرش به محتوای مقاله

چارچوب PROVE خطای ارزیابی حذف اشیا در ویدیوها را حذف کرد

·۲۱ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
معیارهای حذف شیء هم‌راستا با ادراک RC-S و RC-T با بنچ‌مارک ویدیوی دنیای واقعی PROVE از MiLM Plus شیائومی
معیارهای حذف شیء هم‌راستا با ادراک RC-S و RC-T با بنچ‌مارک ویدیوی دنیای واقعی PROVE از MiLM Plus شیائومی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی نخستین معیاری که بدون نیاز به ویدیوهای جفت‌شده (Ground Truth)، می‌تواند کیفیت حذف اشیا را با دقت نزدیک به انسان و سرعت ۱۳ برابر بیشتر از روش‌های فعلی بسنجد.

تصور کنید می‌خواهید یک شیء مزاحم را از یک ویدیوی شلوغ حذف کنید، اما هیچ راهی ندارید تا بفهمید آیا نتیجه واقعاً طبیعی است یا فقط یک لکه‌ی محو شده است. تا امروز، ارزیابی حذف اشیا در ویدیوها یکی از بزرگ‌ترین نقاط کور هوش مصنوعی بود، زیرا هیچ «پاسخ صحیح» واحدی برای پر کردن فضای خالیِ به‌جامانده وجود ندارد.

به همین دلیل، تیم MiLM Plus از شرکت شیائومی (Xiaomi Inc.) چارچوبی به نام PROVE (Perceptual RemOVal cohErence) را معرفی کرد که در کنفرانس ACM MM ۲۰۲۶ پذیرفته شده است. این ابزار نیاز به ویدیوهای مرجع یا همان داده مرجع (Ground Truth) را به‌طور کامل از بین می‌برد.

شکست معیارهای سنتی

طبق گزارش marktechpost.com، معیارهای سنتی مانند PSNR، SSIM و LPIPS به دلیل تکیه بر تطابق نقطه-به-نقطه، دچار «سوگیری مرجع کامل» (Full-reference bias) هستند؛ یعنی به جای حذف واقعی، به ترمیم‌های «کپی-پیست» پاداش می‌دهند. در این سیستم‌ها، اغلب سایه‌های باقی‌مانده از شیء حذف شده، پیکسل‌های بسیار کمی را اشغال می‌کنند و در نتیجه تقریباً هیچ جریمه‌ای در امتیاز نهایی دریافت نمی‌کنند.

در بسیاری از موارد، کاهش مراحل استنتاج در مدل‌های دیفیوژن (Diffusion inference steps) در واقع باعث بهبود امتیازات PSNR و SSIM می‌شود، در حالی که کیفیت بصری تصویر به‌شدت فرو می‌پاشد؛ پدیده‌ای که به عنوان «رگرسیون به میانگین» شناخته می‌شود. این موضوع یک حلقه بازخورد خطرناک ایجاد می‌کند که در آن مدل‌ها برای رسیدن به اعداد ریاضی غلط بهینه می‌شوند.

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی ارزیابی مدل‌های بینایی اشاره کردیم، تکیه بر اعداد ریاضی بدون در نظر گرفتن ادراک انسانی، منجر به بهینه‌سازی مدل‌ها در مسیر اشتباه می‌شود. معیارهای بدون مرجع دیگر مانند ReMOVE و CFD نیز نقاط کوری دارند؛ برای مثال، نویسندگان در مجموعه داده ROSE-Bench دریافتند که محو کردن تدریجی ناحیه ماسک‌شده، به‌جای کاهش امتیاز، باعث افزایش آن در ReMOVE و CFD می‌شد و در نهایت امتیازات آن‌ها از نسخه‌های بدون محو (Baseline) پیشی گرفت. علاوه بر این، عبارت توهم (Hallucination) در CFD که بر پایه SAM است، گاهی دچار خطا می‌شود؛ مثلاً یک زین دوچرخه که به‌درستی ترمیم شده را به عنوان توهم شناسایی کرده و امتیازی بدتر از ورودی ویرایش‌نشده به آن می‌دهد. این چالش‌ها در تشخیص جزئیات بصری، شباهت زیادی به دشواری‌های شناسایی دست‌کاری‌های پیشرفته در ویدیوها دارد، جایی که برخی سیگنال‌های فنی برای شناسایی جعل‌های عمیق با کیفیت بالا به عنوان ابزارهای تشخیص به کار می‌روند.

چارچوب PROVE برای حل این مشکل، دو معیار اصلی معرفی می‌کند:

  • RC-S (پایداری مکانی): برای سنجش انسجام تصویر در یک لحظه.
  • RC-T (پایداری زمانی): برای اطمینان از اینکه حذف شیء در طول فریم‌ها لرزش یا پرش ایجاد نمی‌کند.

هر دو معیار از ویژگی‌های مدل DINOv2 و یک پنجره لغزان برای محاسبه فاصله میانگین بیشینه (MMD) استفاده می‌کنند تا نواحی ویرایش‌شده را به‌صورت محلی بسنجند.

جزئیات فنی و مکانیسم‌ها

مکانیسم عملکرد این دو معیار به شرح زیر است:

۱. RC-S (مکانی): این معیار از تحلیل مؤلفه‌های متصل (Connected-component analysis) برای تقسیم ماسک‌ها به اهداف مستقل استفاده می‌کند. هر جعبه محصورکننده (Bounding box) به اندازه یک‌سوم طول ضلع خود گسترش می‌یابد. سپس این برش به DINOv2 ارسال شده و ماسک را به رزولوشن ویژگی‌ها کاهش می‌دهد. یک پنجره w×w روی نقشه ویژگی‌ها می‌لغزد و MMD مربعی را با یک هسته Gaussian RBF بین ویژگی‌های ماسک‌شده و ویژگی‌های پس‌زمینه محلی محاسبه می‌کند.

۲. RC-T (زمانی): برای جلوگیری از عدم تراز (Misalignment)، فریم‌های مجاور به‌طور مشترک تحت اتحادی از ماسک‌هایشان برش داده می‌شوند. MMD تنها در داخل اشتراک — یعنی ناحیه‌ای که در هر دو فریم ترمیم شده است — محاسبه می‌شود. آزمایش‌های حذف (Ablations) نشان می‌دهد که اگر این برش حذف شود، RC-T نسبت به خرابی‌های تزریق‌شده در ویدیو کور می‌شود.

عملکرد و استقرار:

  • سرعت: RC-S روی یک کارت گرافیک RTX 4090 با سرعت ۱۳۴.۶ میلی‌ثانیه بر هر فریم اجرا می‌شود که ۱۳.۷ برابر سریع‌تر از معیار CFD است.
  • پیاده‌سازی: این ابزار به صورت یک مخزن PyTorch با مجوز Apache 2.0 منتشر شده و یک نقطه ورود CLI (run_prove_metrics.py) دارد. برای اجرا به پایتون ۳.۱۰+، PyTorch ۲.۶+، Transformers ۴.۵۱+ و وزن‌های DINOv2-giant نیاز دارد. استفاده از ماسک‌ها اجباری است و پیکسل‌های سفید نشان‌دهنده شیء حذف شده هستند.

برای اعتبارسنجی، شیائومی مجموعه داده PROVE-Bench را در دو سطح عرضه کرد:

  • PROVE-M: شامل ۸۰ جفت ویدیو. این مجموعه شامل فیلم‌برداری‌های ورودی و هدف (بدون شیء) است که با سه پایه در فاصله زمانی دو دقیقه ضبط شده‌اند. در اینجا از ماسک‌های SAM3 که فریم به فریم اصلاح شده‌اند، کنترل کیفیت سه مرحله‌ای و تقویت حرکت به سبک Ken Burns استفاده شده است. هر کلیپ ۸۱ فریم با کیفیت ۱۰۸۰p است.
  • PROVE-H: شامل ۱۰۰ ویدیوی «سخت» بدون داده مرجع. این ویدیوها المان‌های پیچیده‌ای مثل جمعیت، جریان آب، شعله‌های آتش، زمین‌های بافت‌دار، انعکاسات چندگانه در گودال‌های آب و حرکت سریع را شامل می‌شوند و عمداً از ماسک‌های اصلاح‌نشده SAM3 استفاده می‌کنند.

در آزمون‌های رودررو با رتبه‌بندی ۲۰ شرکت‌کننده انسانی (که با روش Borda count تجمیع شد)، معیار RC-S به طور خیره‌کننده‌ای از رقبای خود پیشی گرفت و به میانگین Kendall’s τ برابر ۰.۵۹ و Spearman’s ρ برابر ۰.۶۶ رسید. این اعداد در مقایسه با ReMOVE (۰.۲۶/۰.۲۹) و CFD (۰.۱۶/۰.۱۸) بسیار بالاتر است. RC-S در ۵ مورد از ۶ بنچمارک رتبه اول را کسب کرد.

علاوه بر این، RC-S در مجموعه داده RORD-Val دقت ۱۰۰٪ در ترجیح تصاویر پاک نسبت به نسخه‌های محو یا جابه‌جا شده نشان داد، در حالی که ReMOVE تنها ۶۰.۰۶٪ و CFD در حالت محو ۴۹.۲۷٪ موفق بودند. همچنین RC-T برخلاف معیارهای Temporal Consistency (TC) و Temporal Flickering (TF) که روی ویژگی‌های کل فریم عمل می‌کنند و به نواحی کوچک ویرایش‌شده حساس نیستند، به صورت یکنواخت به افزایش خرابی‌ها پاسخ می‌دهد.

تأثیرات پژوهشی و صنعتی

این تغییر رویکرد، تمرکز پژوهشگران بینایی ماشین را از تطبیق جهانی به تطبیق توزیع محلی در فضای ویژگی‌های عمیق منتقل می‌کند و «سوگیری مرجع کامل» را کنار می‌زند. اکنون مهندسان می‌توانند بدون نیاز به تولید ویدیوهای جفت‌شده برای هر تست، مراحل استنتاج (Inference) یا کوانتایزیشن (Quantization) را بهینه کنند. آزمایش‌ها تأیید می‌کنند که DINOv2 (با میانگین τ=۰.۵۹) از DINOv3 (۰.۵۱) و SAM (۰.۴۴) بهتر عمل می‌کند. این پیشرفت در تحلیل ویدیوها همسو با روندهای جدیدتری است که در آن آموزش از طریق ویدئو به عنوان جایگزینی برای برچسب‌های متنی در مدل‌های استدلالی مورد بررسی قرار می‌گیرد.

برای تیم‌های MLOps، سرعت بالای RC-S اجازه می‌دهد تا این معیار مستقیماً در گیت‌های CI شبانه ادغام شود. این یعنی استارتاپ‌ها و شرکت‌هایی که کاتالوگ‌های عظیم ویرایشی دارند، می‌توانند داده‌های آموزشی خود را به‌طور خودکار فیلتر کرده و از پس‌رفت کیفیت بصری در هنگام بهینه‌سازی مدل‌ها جلوگیری کنند.

کاربردهای صنعتی این فناوری از اپلیکیشن‌های گالری گوشی‌های هوشمند و پاک‌سازی کاتالوگ‌های تجارت الکترونیک تا جلوه‌های ویژه (VFX) سطح بالا، تبلیغات، رسانه‌های استوک، تصویربرداری املاک و حذف اطلاعات حساس در آرشیوهای نقشه‌برداری گسترده است. توانایی امتیازدهی به ویدیوهای «سخت»، امکان مقایسه مدل‌ها را بسیار مستحکم‌تر می‌کند.

در حال حاضر، پژوهشگران می‌توانند از کد Apache 2.0 و مجموعه داده Hugging Face برای بنچمارک مدل‌های خود استفاده کنند. در حال حاضر مدل SVOR (با ۱.۳ میلیارد پارامتر) با امتیاز ۰.۵۱۹۷ در RC-S و مدل EffectErase با امتیاز ۰.۲۵۲۵ در RC-T پیشتاز هستند.

گام بعدی شما

  • اگر روی مدل‌های ترمیم تصویر یا ویدیو کار می‌کنید، مخزن Apache 2.0 این پروژه را برای جایگزینی معیارهای PSNR با RC-S بررسی کنید.
  • مجموعه داده PROVE-Bench را برای تست استواری مدل خود در برابر سناریوهای سخت (مانند انعکاسات آب) دانلود کنید.
  • برای کاهش هزینه استنتاج بدون افت کیفیت، از RC-S به عنوان یک تابع پاداش در مدل‌های RLHF استفاده کنید.

اما بهینه‌سازی این مدل‌ها تنها نیمی از مسیر است؛ برای درک اینکه چگونه سخت‌افزارهای جدید سرعت این پردازش‌ها را تغییر می‌دهند، تحلیل ما درباره تراشه‌های Blackwell را بخوانید.

چرا این موضوع مهم است؟

این چارچوب با حذف نیاز به ویدیوهای مرجع، هزینه و زمان تولید بنچمارک‌های بینایی را به‌شدت کاهش می‌دهد. اعتبار این روش از طریق همبستگی بالا با ارزیابی‌های انسانی و تکیه بر معماری DINOv2 تأیید شده است.

تأثیر برای ایران

این ابزار به‌دلیل متن‌باز بودن (Apache 2.0)، برای پژوهشگران بینایی ماشین در ایران که با محدودیت داده‌های مرجع مواجه‌اند، یک ابزار رایگان و قدرتمند برای ارزیابی مدل‌های داخلی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی داده‌های مرجع با تحلیل توزیع ویژگی‌ها در فضای DINOv2، پایان عصر «تطبیق پیکسل‌به-پیکسل» در ارزیابی‌های بینایی است. این رویکرد ثابت می‌کند که برای سنجش کیفیت، مدل‌های پیش‌آموزش‌دیده (Foundation Models) می‌توانند جایگزین معیارهای ریاضی صلب شوند و ادراک انسانی را شبیه‌سازی کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.