تصور کنید میخواهید یک شیء مزاحم را از یک ویدیوی شلوغ حذف کنید، اما هیچ راهی ندارید تا بفهمید آیا نتیجه واقعاً طبیعی است یا فقط یک لکهی محو شده است. تا امروز، ارزیابی حذف اشیا در ویدیوها یکی از بزرگترین نقاط کور هوش مصنوعی بود، زیرا هیچ «پاسخ صحیح» واحدی برای پر کردن فضای خالیِ بهجامانده وجود ندارد.
به همین دلیل، تیم MiLM Plus از شرکت شیائومی (Xiaomi Inc.) چارچوبی به نام PROVE (Perceptual RemOVal cohErence) را معرفی کرد که در کنفرانس ACM MM ۲۰۲۶ پذیرفته شده است. این ابزار نیاز به ویدیوهای مرجع یا همان داده مرجع (Ground Truth) را بهطور کامل از بین میبرد.
شکست معیارهای سنتی
طبق گزارش marktechpost.com، معیارهای سنتی مانند PSNR، SSIM و LPIPS به دلیل تکیه بر تطابق نقطه-به-نقطه، دچار «سوگیری مرجع کامل» (Full-reference bias) هستند؛ یعنی به جای حذف واقعی، به ترمیمهای «کپی-پیست» پاداش میدهند. در این سیستمها، اغلب سایههای باقیمانده از شیء حذف شده، پیکسلهای بسیار کمی را اشغال میکنند و در نتیجه تقریباً هیچ جریمهای در امتیاز نهایی دریافت نمیکنند.
در بسیاری از موارد، کاهش مراحل استنتاج در مدلهای دیفیوژن (Diffusion inference steps) در واقع باعث بهبود امتیازات PSNR و SSIM میشود، در حالی که کیفیت بصری تصویر بهشدت فرو میپاشد؛ پدیدهای که به عنوان «رگرسیون به میانگین» شناخته میشود. این موضوع یک حلقه بازخورد خطرناک ایجاد میکند که در آن مدلها برای رسیدن به اعداد ریاضی غلط بهینه میشوند.
همانطور که در بحثهای گذشتهی ما دربارهی ارزیابی مدلهای بینایی اشاره کردیم، تکیه بر اعداد ریاضی بدون در نظر گرفتن ادراک انسانی، منجر به بهینهسازی مدلها در مسیر اشتباه میشود. معیارهای بدون مرجع دیگر مانند ReMOVE و CFD نیز نقاط کوری دارند؛ برای مثال، نویسندگان در مجموعه داده ROSE-Bench دریافتند که محو کردن تدریجی ناحیه ماسکشده، بهجای کاهش امتیاز، باعث افزایش آن در ReMOVE و CFD میشد و در نهایت امتیازات آنها از نسخههای بدون محو (Baseline) پیشی گرفت. علاوه بر این، عبارت توهم (Hallucination) در CFD که بر پایه SAM است، گاهی دچار خطا میشود؛ مثلاً یک زین دوچرخه که بهدرستی ترمیم شده را به عنوان توهم شناسایی کرده و امتیازی بدتر از ورودی ویرایشنشده به آن میدهد. این چالشها در تشخیص جزئیات بصری، شباهت زیادی به دشواریهای شناسایی دستکاریهای پیشرفته در ویدیوها دارد، جایی که برخی سیگنالهای فنی برای شناسایی جعلهای عمیق با کیفیت بالا به عنوان ابزارهای تشخیص به کار میروند.
چارچوب PROVE برای حل این مشکل، دو معیار اصلی معرفی میکند:
- RC-S (پایداری مکانی): برای سنجش انسجام تصویر در یک لحظه.
- RC-T (پایداری زمانی): برای اطمینان از اینکه حذف شیء در طول فریمها لرزش یا پرش ایجاد نمیکند.
هر دو معیار از ویژگیهای مدل DINOv2 و یک پنجره لغزان برای محاسبه فاصله میانگین بیشینه (MMD) استفاده میکنند تا نواحی ویرایششده را بهصورت محلی بسنجند.
جزئیات فنی و مکانیسمها
مکانیسم عملکرد این دو معیار به شرح زیر است:
۱. RC-S (مکانی): این معیار از تحلیل مؤلفههای متصل (Connected-component analysis) برای تقسیم ماسکها به اهداف مستقل استفاده میکند. هر جعبه محصورکننده (Bounding box) به اندازه یکسوم طول ضلع خود گسترش مییابد. سپس این برش به DINOv2 ارسال شده و ماسک را به رزولوشن ویژگیها کاهش میدهد. یک پنجره w×w روی نقشه ویژگیها میلغزد و MMD مربعی را با یک هسته Gaussian RBF بین ویژگیهای ماسکشده و ویژگیهای پسزمینه محلی محاسبه میکند.
۲. RC-T (زمانی): برای جلوگیری از عدم تراز (Misalignment)، فریمهای مجاور بهطور مشترک تحت اتحادی از ماسکهایشان برش داده میشوند. MMD تنها در داخل اشتراک — یعنی ناحیهای که در هر دو فریم ترمیم شده است — محاسبه میشود. آزمایشهای حذف (Ablations) نشان میدهد که اگر این برش حذف شود، RC-T نسبت به خرابیهای تزریقشده در ویدیو کور میشود.
عملکرد و استقرار:
- سرعت: RC-S روی یک کارت گرافیک RTX 4090 با سرعت ۱۳۴.۶ میلیثانیه بر هر فریم اجرا میشود که ۱۳.۷ برابر سریعتر از معیار CFD است.
- پیادهسازی: این ابزار به صورت یک مخزن PyTorch با مجوز Apache 2.0 منتشر شده و یک نقطه ورود CLI (
run_prove_metrics.py) دارد. برای اجرا به پایتون ۳.۱۰+، PyTorch ۲.۶+، Transformers ۴.۵۱+ و وزنهای DINOv2-giant نیاز دارد. استفاده از ماسکها اجباری است و پیکسلهای سفید نشاندهنده شیء حذف شده هستند.
برای اعتبارسنجی، شیائومی مجموعه داده PROVE-Bench را در دو سطح عرضه کرد:
- PROVE-M: شامل ۸۰ جفت ویدیو. این مجموعه شامل فیلمبرداریهای ورودی و هدف (بدون شیء) است که با سه پایه در فاصله زمانی دو دقیقه ضبط شدهاند. در اینجا از ماسکهای SAM3 که فریم به فریم اصلاح شدهاند، کنترل کیفیت سه مرحلهای و تقویت حرکت به سبک Ken Burns استفاده شده است. هر کلیپ ۸۱ فریم با کیفیت ۱۰۸۰p است.
- PROVE-H: شامل ۱۰۰ ویدیوی «سخت» بدون داده مرجع. این ویدیوها المانهای پیچیدهای مثل جمعیت، جریان آب، شعلههای آتش، زمینهای بافتدار، انعکاسات چندگانه در گودالهای آب و حرکت سریع را شامل میشوند و عمداً از ماسکهای اصلاحنشده SAM3 استفاده میکنند.
در آزمونهای رودررو با رتبهبندی ۲۰ شرکتکننده انسانی (که با روش Borda count تجمیع شد)، معیار RC-S به طور خیرهکنندهای از رقبای خود پیشی گرفت و به میانگین Kendall’s τ برابر ۰.۵۹ و Spearman’s ρ برابر ۰.۶۶ رسید. این اعداد در مقایسه با ReMOVE (۰.۲۶/۰.۲۹) و CFD (۰.۱۶/۰.۱۸) بسیار بالاتر است. RC-S در ۵ مورد از ۶ بنچمارک رتبه اول را کسب کرد.
علاوه بر این، RC-S در مجموعه داده RORD-Val دقت ۱۰۰٪ در ترجیح تصاویر پاک نسبت به نسخههای محو یا جابهجا شده نشان داد، در حالی که ReMOVE تنها ۶۰.۰۶٪ و CFD در حالت محو ۴۹.۲۷٪ موفق بودند. همچنین RC-T برخلاف معیارهای Temporal Consistency (TC) و Temporal Flickering (TF) که روی ویژگیهای کل فریم عمل میکنند و به نواحی کوچک ویرایششده حساس نیستند، به صورت یکنواخت به افزایش خرابیها پاسخ میدهد.
تأثیرات پژوهشی و صنعتی
این تغییر رویکرد، تمرکز پژوهشگران بینایی ماشین را از تطبیق جهانی به تطبیق توزیع محلی در فضای ویژگیهای عمیق منتقل میکند و «سوگیری مرجع کامل» را کنار میزند. اکنون مهندسان میتوانند بدون نیاز به تولید ویدیوهای جفتشده برای هر تست، مراحل استنتاج (Inference) یا کوانتایزیشن (Quantization) را بهینه کنند. آزمایشها تأیید میکنند که DINOv2 (با میانگین τ=۰.۵۹) از DINOv3 (۰.۵۱) و SAM (۰.۴۴) بهتر عمل میکند. این پیشرفت در تحلیل ویدیوها همسو با روندهای جدیدتری است که در آن آموزش از طریق ویدئو به عنوان جایگزینی برای برچسبهای متنی در مدلهای استدلالی مورد بررسی قرار میگیرد.
برای تیمهای MLOps، سرعت بالای RC-S اجازه میدهد تا این معیار مستقیماً در گیتهای CI شبانه ادغام شود. این یعنی استارتاپها و شرکتهایی که کاتالوگهای عظیم ویرایشی دارند، میتوانند دادههای آموزشی خود را بهطور خودکار فیلتر کرده و از پسرفت کیفیت بصری در هنگام بهینهسازی مدلها جلوگیری کنند.
کاربردهای صنعتی این فناوری از اپلیکیشنهای گالری گوشیهای هوشمند و پاکسازی کاتالوگهای تجارت الکترونیک تا جلوههای ویژه (VFX) سطح بالا، تبلیغات، رسانههای استوک، تصویربرداری املاک و حذف اطلاعات حساس در آرشیوهای نقشهبرداری گسترده است. توانایی امتیازدهی به ویدیوهای «سخت»، امکان مقایسه مدلها را بسیار مستحکمتر میکند.
در حال حاضر، پژوهشگران میتوانند از کد Apache 2.0 و مجموعه داده Hugging Face برای بنچمارک مدلهای خود استفاده کنند. در حال حاضر مدل SVOR (با ۱.۳ میلیارد پارامتر) با امتیاز ۰.۵۱۹۷ در RC-S و مدل EffectErase با امتیاز ۰.۲۵۲۵ در RC-T پیشتاز هستند.
گام بعدی شما
- اگر روی مدلهای ترمیم تصویر یا ویدیو کار میکنید، مخزن Apache 2.0 این پروژه را برای جایگزینی معیارهای PSNR با RC-S بررسی کنید.
- مجموعه داده PROVE-Bench را برای تست استواری مدل خود در برابر سناریوهای سخت (مانند انعکاسات آب) دانلود کنید.
- برای کاهش هزینه استنتاج بدون افت کیفیت، از RC-S به عنوان یک تابع پاداش در مدلهای RLHF استفاده کنید.
اما بهینهسازی این مدلها تنها نیمی از مسیر است؛ برای درک اینکه چگونه سختافزارهای جدید سرعت این پردازشها را تغییر میدهند، تحلیل ما درباره تراشههای Blackwell را بخوانید.




گفتگو