پرش به محتوای اصلی
پرش به محتوای مقاله

مدل LaMa با تبدیل تصاویر به فرکانس، واترمارک‌های پیچیده را ترمیم می‌کند

·۸ مرداد ۱۴۰۵۹ دقیقه مطالعه۱ بازدید
راهنما
راهنمای توسعه‌دهندگان برای حذف واترمارک با هوش مصنوعی و بازسازی تصاویر
راهنمای توسعه‌دهندگان برای حذف واترمارک با هوش مصنوعی و بازسازی تصاویر
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نوآوری اصلی در LaMa، استفاده از کانولوشن‌های فوریه سریع (FFC) است که برخلاف CNNهای سنتی، اجازه می‌دهد مدل در همان لایه‌ی اول، ساختار کلی و الگوهای تکراری تصویر را ببیند و ترمیم کند.

تصور کنید یک خط لوله (Pipeline) پردازش تصویر واحد دارید که واترمارک‌های پیچیده را در عرض چند میلی‌ثانیه پاک می‌کند؛ این کار را نه با حذف ساده، بلکه با treating کردن مشکل به عنوان یک «بازسازی» (Reconstruction) انجام می‌دهد. در یک راهنمای فنی که در ۳۰ ژوئیه ۲۰۲۶ منتشر شد، جامعه توسعه‌دهندگان با جزئیات توضیح دادند که چگونه مدل LaMa (Large Mask Inpainting) با حل مشکل «زمینه جهانی» (Global Context) که باعث ناکارآمدی شبکه‌های عصبی پیچشی (CNN) قدیمی‌تر می‌شد، به اسب بارکش صنعت تبدیل شده است.

حذف واترمارک شبیه کندن یک لایه فیزیکی نیست؛ زیرا هنگامی که یک تصویر رستر (Rasterize) می‌شود، واترمارک در پیکسل‌ها پخته شده و با آن‌ها یکپارچه می‌گردد. برای اصلاح این وضعیت، هوش مصنوعی ابتدا باید عملیات «قطعه‌بندی» (Segmentation) را برای ایجاد یک ماسک دوتایی (Binary Mask) انجام دهد و سپس از «ترمیم تصویر» (Inpainting) استفاده کند تا آن حفره را با محتوایی منطقی و بر اساس پیکسل‌های اطراف پر کند. در واقع، یک «حذف‌کننده واترمارک AI» در حقیقت دو مسئله است که به صورت زنجیروار به هم متصل شده‌اند: قطعه‌بندی (پیدا کردن علامت) و ترمیم (پر کردن حفره).

مسئله محوری: بازسازی در برابر حذف

این یک باور غلط رایج است که نرم‌افزارهای مدرن واترمارک را «حذف» می‌کنند. در واقعیت، این فرآیند از یک جریان منطقی سخت‌گیرانه سه مرحله‌ای پیروی می‌کند: تصویر ورودی (همراه با علامت) $\rightarrow$ ماسک واترمارک $\rightarrow$ مدل ترمیم $\rightarrow$ تصویر پاک. دشوارترین بخش، گام دوم است: بازسازی آنچه تصویر احتمالاً در زیر آن پیکسل‌های ماسک‌شده داشته است. این یک چالش کلاسیک در بینایی ماشین است که در آن مدل از سرنخ‌های موجود در پیکسل‌های محیطی برای پر کردن نواحی تخریب‌شده استفاده می‌کند.

گام اول: تولید ماسک

قبل از اینکه ترمیم بتواند اتفاق بیفتد، سیستم به یک ماسک دوتایی نیاز دارد که به مدل بگوید کدام پیکسل‌ها باید جایگزین شوند. بسته به ماهیت واترمارک، سه استراتژی اصلی برای دستیابی به این ماسک وجود دارد:

  • ماسک‌گذاری دستی یا به کمک رابط کاربری (UI-assisted): در ابزارهای مصرف‌کننده، کاربر با یک قلم روی واترمارک می‌کشد. این روش ساده و قابل اعتماد است زیرا کاربر دقیقاً به سیستم می‌گوید کجا کار کند و نیاز به تشخیص خودکار را از بین می‌برد. این رویکرد اساس اکثر ویرایشگرهای «قلم و پاک‌کن» است.
  • تطبیق الگو (Template Matching): برای لوگوهای شناخته‌شده و تکرار شونده (مانند الگوهای مورب عکس‌های استوک)، سیستم‌ها می‌توانند یک نمونه را به عنوان الگو استخراج کرده و از «همبستگی متقاطع نرمال‌شده» (Normalized Cross-Correlation) برای یافتن تمام موارد مشابه استفاده کنند. این روش سریع و قطعی (Deterministic) است، هرچند نیازمند دانستن ظاهر دقیق واترمارک از پیش است. در پایتون، این مورد معمولاً با استفاده از تابع cv2.matchTemplate از کتابخانه OpenCV و اغلب با یک آستانه (Threshold) (مثلاً ۰.۸) برای جداسازی مختصات تکه لوگو پیاده‌سازی می‌شود.
  • قطعه‌بندی یادگیرنده (Learned Segmentation): برای متن‌های روی‌هم‌افتاده دلخواه، لوگوهای متنوع یا امضاها، یک مدل قطعه‌بندی کوچک — مانند U-Net — روی جفت‌های (تصویر واترمارک‌دار، ماسک) آموزش می‌بیند.

یک چالش خاص در ماسک‌گذاری، برخورد با واترمارک‌های نیمه‌شفاف است. وقتی یک علامت ترکیبی از یک رنگ و پس‌زمینه است، یک ماسک باکیفیت به جای یک حالت دوتایی ساده (روشن/خاموش)، «شفافیت در هر پیکسل» (Per-pixel opacity) را حمل می‌کند. این امر به مدل ترمیم‌کننده اجازه می‌دهد تا رنگ واترمارک را تفریق کند، به جای اینکه کورکورانه روی آن را بازنویسی کند.

دوران کلاسیک ترمیم تصویر

قبل از ظهور یادگیری عمیق، ابزارها به الگوریتم‌های کلاسیک موجود در تابع cv2.inpaint کتابخانه OpenCV متکی بودند. دو روش اصلی بر این دوران مسلط بودند:

  • روش Telea (Fast Marching Method): این روش اطلاعات را از لبه‌ها به سمت داخل منتشر می‌کند. برای خراش‌های نازک و نقاط کوچک (به عنوان مثال با استفاده از شعاع ۳) بسیار مؤثر است.
  • روش Navier-Stokes: این روش ناحیه را به عنوان یک مسئله جریان سیال در نظر می‌گیرد و اطلاعات لبه را به داخل حفره منتقل می‌کند.

اگرچه این روش‌ها فوری هستند و نیازی به GPU ندارند، اما در نواحی بزرگ شکست می‌خورند. برای مثال، یک لوگوی ۲۰۰×۸۰ که روی یک پس‌زمینه بافت‌دار قرار گرفته باشد، منجر به لکه‌های واضح می‌شود زیرا این الگوریتم‌ها ساختار جهانی (Global Structure) را نادیده می‌گیرند. تکنولوژی PatchMatch (تکنولوژی پشت Content-Aware Fill فتوشاپ) با کپی کردن تکه‌های مشابه از نقاط دیگر فریم، این مشکل را بهبود بخشید. با این حال، PatchMatch فرض می‌کند محتوای گم‌شده در جای دیگری از تصویر وجود دارد — که برای چمن یا آسمان درست است، اما برای چهره‌ای که نیمی از آن توسط واترمارک پوشانده شده، نادرست است.

تکامل یادگیری عمیق

گذار به یادگیری عمیق، توانایی «توهم» (Hallucinate) ادامه منطقی تصویر را بر اساس یک «پیش‌فرض یادگرفته‌شده» (Learned Prior) از ظاهر تصاویر طبیعی ایجاد کرد. استفاده از این مدل‌ها تضمین می‌کند که نتیجه از نظر ادراکی چنان به نسخه اصلی نزدیک باشد که چشم انسان نتواند تفاوتی تشخیص دهد.

  • رمزگذارهای زمینه (۲۰۱۶): معرفی اولین معماری Encoder-Decoder بر پایه CNN برای درک زمینه جهانی تصویر.
  • کانولوشن‌های جزئی (۲۰۱۸): حل مشکل «ترک خوردگی یا نشت رنگ» (Color Bleed). کانولوشن‌های استاندارد همه چیز را زیر یک هسته (Kernel) ترکیب می‌کنند، حتی پیکسل‌های ماسک‌شده. کانولوشن‌های جزئی خروجی را فقط از پیکسل‌های معتبر (غیر ماسک‌شده) محاسبه کرده و نتیجه را نرمال‌سازی می‌کنند. این اطمینان می‌دهد که شبکه فقط اطلاعاتی را ترکیب می‌کند که اجازه دیدن آن‌ها را داشته است.
  • کانولوشن‌های گیت‌دار (۲۰۱۹): به شبکه اجازه داد تا گیت‌های نرم (Soft Gating) را در هر لایه یاد بگیرد و مدیریت ماسک‌های نامنظم را به طور قابل توجهی بهبود بخشید.
  • مدل LaMa (۲۰۲۱): معرفی کانولوشن‌های فوریه سریع (FFC) برای فراهم کردن یک میدان پذیرش جهانی (Global Receptive Field) در اولین لایه.
  • مدل‌های مبتنی بر انتشار (۲۰۲۲ به بعد): استفاده از حذف نویز تکراری (Iterative Denoising) مشروط به زمینه برای نتایجی خیره‌کننده و با دقت بسیار بالا.

مدل LaMa به طور ویژه‌ای مؤثر است زیرا اطلاعات را در «دامنه فرکانسی» ترکیب می‌کند. در حالی که یک CNN استاندارد برای «دیدن» واترمارکی که بخش بزرگی از تصویر را اشغال کرده به لایه‌های متراکمی نیاز دارد، FFC کل ساختار را فوراً مشاهده می‌کند. این ویژگی به مدل اجازه می‌دهد تا الگوهای تکرار شونده، مانند دیوارهای آجری یا نرده‌ها، را در یک گذر پیشرو (Forward Pass) بازسازی کند.

برای دستیابی به بالاترین کیفیت ممکن، توسعه‌دهندگان اکنون به مدل‌های مبتنی بر انتشار مانند نسخه Inpainting مدل Stable Diffusion روی می‌آورند. این مدل‌ها می‌توانند از پرامپت‌های متنی (مثلاً «یک آسمان آبی صاف») برای هدایت بازسازی استفاده کنند. با این حال، آن‌ها به ده‌ها یا صدها مرحله حذف نویز نیاز دارند و این امر باعث می‌شود تأخیر (Latency) و هزینه آن‌ها یک مرتبه (Order of magnitude) بیشتر از LaMa باشد. در مقابل، برخی رویکردهای جایگزین تلاش می‌کنند تا با استفاده از محاسبات ریاضی به جای حدس‌های هوش مصنوعی، کیفیت خروجی را بدون افت داده‌ها حفظ کنند.

مهندسی خط لوله (Pipeline)

ساخت یک سیستم تولیدی (Production) نیازمند چیزی فراتر از یک مدل است. طبق راهنمای توسعه‌دهندگان، مدل تنها حدود یک‌سوم از تلاش مهندسی است. کارهای باقی‌مانده بر روی موانع عملیاتی زیر متمرکز است:

تأخیر و توان عملیاتی (Latency and Throughput): اقتصاد واحد (Unit economics) توسط استخرهای GPU، سقف رزولوشن تصاویر و اندازه دسته‌ها (Batch sizes) تعیین می‌شود. یک گذر پیشرو در LaMa برای یک تصویر ۱۰۲۴ پیکسلی در یک GPU مناسب، چند صد میلی‌ثانیه زمان می‌برد، در حالی که ترمیم با مدل انتشار چندین ثانیه زمان می‌برد. در سرویس‌های با توان عملیاتی بالا، مدل انتشار معمولاً برای سخت‌ترین موارد یا پاس‌های نهایی ارتقای کیفیت (Upscaled passes) رزرو می‌شود.

دقت ماسک (Mask Precision): اصل «ورودی زباله، خروجی زباله» اینجا صادق است. اگر ماسک بیش از حد تنگ باشد، بقایای واترمارک باقی می‌ماند. اگر بیش از حد گشاد باشد، جزئیات واقعی تصویر پاک می‌شود. به همین دلیل است که ابزارهای حرفه‌ای سرمایه‌گذاری سنگینی روی رابط کاربری (اندازه قلم) یا قطعه‌بندی یادگیرنده برای اصلاح مرز ماسک می‌کنند.

مدیریت نیمه‌شفافیت (Handling Translucency): یک لوگوی سفید توپر مسئله‌ای ساده است. اما یک لوگوی خاکستری با شفافیت ۳۰٪ نیازماد آن است که سیستم رنگ لایه رویی را تخمین زده و آن را تفریق کند، به جای اینکه صرفاً روی پیکسل‌ها را رنگ کند.

ایمنی، ذخیره‌سازی و اعتماد: کاربران درباره آپلود تصاویر حساس در سرورها عصبی هستند. تیم‌های مهندسی این مشکل را با روش‌های زیر کاهش می‌دهند:

  • پردازش تصاویر در حافظه (In-memory) و حذف فوری آن‌ها.
  • پشتیبانی از جلسات موقت (Ephemeral sessions).
  • بررسی استنتاج در سمت کلاینت با استفاده از WebGPU یا WASM.

برای کسانی که به نتایج فوری بدون ساخت یک خط لوله کامل نیاز دارند، سرویس‌های میزبانی‌شده مانند Watermark Remover AI یا دموی Gemini Watermark Remover یک رابط «بکش و رها کن» (Drag-and-drop) فراهم می‌کنند که مراحل قطعه‌بندی و ترمیم را در یک API واحد بسته‌بندی کرده است.

پیاده‌سازی عملی: یک خط لوله مینیمال

برای توسعه‌دهندگان، یک خط لوله پایه را می‌توان با استفاده از simple-lama-inpainting طرح‌ریزی کرد. این فرآیند شامل بارگذاری تصویر، ایجاد یک ماسک (که می‌تواند یک مستطیل کشیده شده توسط کاربر باشد، مانند draw.rectangle([180, 60, 520, 140], fill=255)) و ارسال هر دو به مدل SimpleLama است.

برای پیشبرد این خط لوله، یک توسعه‌دهنده ممکن است:

  • ماسک دستی را با یک مرحله آستانه‌گذاری (Thresholding) برای تشخیص لوگوهای نیمه‌شفاف جایگزین کند.
  • کیفیت بازسازی نهایی را با استفاده از PSNR (نسبت سیگنال به نویز اوج) یا SSIM (شاخص شباهت ساختاری) در برابر یک نسخه پاک شناخته شده از تصویر اندازه‌گیری کند.

از دیدگاه کاربردی، این تغییر در تکنولوژی به این معناست که «حقیقت» یک تصویر را می‌توان به راحتی تغییر داد. چون این مدل‌ها از یک توزیع یادگرفته شده از تصاویر طبیعی نمونه‌برداری می‌کنند، نتیجه یک «ساختگی منطقی» (Plausible fabrication) است، نه بازیابی حقیقت اصلی (Ground Truth). این تمایز برای کاربردهای قانونی، پزشکی یا جرم‌شناسی که در آن‌ها دقت در سطح پیکسل اجباری است، حیاتی است. در واقع، استفاده از چارچوب‌های سه‌لایه هوش مصنوعی برای شناسایی دست‌کاری‌ها در مقالات علمی، پاسخی به همین چالش بازسازی‌های متقاعدکننده است. شما باید با این خروجی‌ها به عنوان بازسازی برخورد کنید، نه حقیقت عینی. همچنین باید توجه داشت که این توانایی در بازسازی تصاویر، ابزارهای کلاهبرداری را تقویت کرده و طبق برآوردهای دلویت، خسارات کلاهبرداری‌های مبتنی بر هوش مصنوعی تا سال ۲۰۲۷ به رقم قابل توجهی خواهد رسید.

با بلوغ WebGPU، چرخش بزرگ بعدی احتمالاً انتقال از سرورهای ابری سنگین GPU به استنتاج کاملاً محلی در سمت کلاینت خواهد بود. این امر نگرانی اصلی حریم خصوصی در مورد آپلود عکس‌های شخصی در سرور شخص ثالث برای ویرایش‌های ساده را حل می‌کند و در عین حال سرعت مدل‌هایی مانند LaMa را حفظ می‌نماید.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، کتابخانه simple-lama-inpainting را برای تست سریع بازسازی تصاویر امتحان کنید.
  • برای ارزیابی خروجی‌ها، به‌جای تکیه بر چشم، از معیارهای SSIM استفاده کنید تا میزان شباهت ساختاری بازسازی با نسخه پاک را بسنجید.
  • اگر روی ابزارهای ویرایشی کار می‌کنید، بررسی کنید که آیا امکان انتقال مدل به WebGPU برای کاهش هزینه‌های GPU سرور وجود دارد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این فناوری با حذف مرز بین «بازیابی داده» و «تولید محتوا»، اعتبار بصری تصاویر را در سطح صنعتی تغییر می‌دهد. تخصص در ترکیب FFC و مدل‌های انتشار، سرعت بازسازی را از ثانیه‌ها به میلی‌ثانیه‌ها رسانده و ابزارهای ویرایشی را برای کاربر عادی دسترس‌تر کرده است.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی، استفاده از مدل‌های وزن‌باز مانند LaMa جایگزینی بهینه برای APIهای پولی است که دسترسی به آن‌ها با تحریم یا هزینه‌های ارزی دشوار است.

·نگاه ما
تحریریه دات‌هوش

تکیه بر دامنه‌ی فرکانسی به‌جای پیکسل‌ها در LaMa، پارادایم ترمیم تصویر را از «تخمین محلی» به «درک سراسری» تغییر داد. این یعنی مدل‌ها دیگر فقط به همسایگان پیکسل نگاه نمی‌کنند، بلکه ساختار کلی تصویر را می‌فهمند. این رویکرد احتمالاً راه را برای بازسازی‌های پیچیده‌تر در ویدیوها، جایی که ثبات زمانی در کنار ساختار کلی حیاتی است، هموار می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.