پرش به محتوای اصلی
پرش به محتوای مقاله

مدل MultiMatte دقت قطعه‌بندی SAM 3 را به عدد ۰.۹۰۱ رساند

·۱۹ شهریور ۱۴۰۵۴ دقیقه مطالعه
چندلایه‌ای: آنچه می‌خواهید نگه دارید، بقیه را حذف کنید — فاین
چندلایه‌ای: آنچه می‌خواهید نگه دارید، بقیه را حذف کنید — فاین
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی ماسک‌های باینری (صفر و یک) با آلفا مت در یک مدل Promptable؛ این یعنی برای اولین بار می‌توان با یک دستور متنی ساده، لبه‌های بسیار ظریف مانند مو را با دقت ریاضی استخراج کرد بدون اینکه نیاز به آموزش مجدد کل مدل باشد.

اگر طراح گرافیک هستید و ساعت‌ها وقت خود را صرف پاک کردن لبه‌های دندانه‌دار عکس‌ها می‌کنید، دوران دست‌اندازهای بصری به پایان رسیده است. عدد ۰.۹۰۱ در معیار S-measure اکنون به استاندارد جدید دقت در قطعه‌بندی تصویر تبدیل شده است. در ۱۰ سپتامبر ۲۰۲۶، شرکت Feyn مدل MultiMatte را منتشر کرد. این مدل با عبور از ماسک‌های ساده‌ی باینری، به ایجاد «آلفا مت‌های» با وفاداری بالا (High-fidelity alpha mattes) می‌پردازد تا جزئیاتی مثل تارهای مو یا لبه‌های محو را حفظ کند. این فناوری اجازه می‌دهد تنها با یک پرامپت متنی، سوژه با دقتی در سطح استودیوهای حرفه‌ای از پس‌زمینه جدا شود.

بیشتر ابزارهای حذف پس‌زمینه با پیکسل‌ها مثل یک کلید برق برخورد می‌کنند؛ یا روشن هستند (جزء شیء) یا خاموش (پس‌زمینه). این رویکرد باینری در مواجهه با المان‌های نیمه‌شفاف یا مرزهای مبهم شکست می‌خورد و اغلب لبه‌های زبر و دندانه‌دار دور سوژه باقی می‌گذارد. MultiMatte این مشکل را با اختصاص یک مقدار شفافیت پیوسته (Continuous opacity value) به هر پیکسل حل می‌کند تا انتقال طبیعی و نرم بین سوژه و محیط ایجاد شود. این رویکرد در کنار بهبود معیارهای ارزیابی حذف اشیا در ویدیوها، استانداردهای جدیدی را برای سنجش کیفیت خروجی‌های بصری تعریف می‌کند.

چندلایه مات: آنچه می‌خواهی نگه دار، بقیه را ببر — فاین

چرخش به سمت آلفا مت

مدل SAM 3 (Segment Anything Model 3) به عنوان یک تشخیص‌دهنده با پرامپت متنی عمل می‌کند. این مدل ماسک‌های باینری برمی‌گرداند که پیکسل‌ها را صرفاً به دو دسته «داخل شیء» یا «خارج از شیء» تقسیم می‌کند. این روش در مواجهه با المان‌های ظریف، مانند یک صفحه نمایش محو یا تارهای مو، ناتوان است و نمی‌تواند پیچیدگی لبه‌ها را بازنمایی کند.

MultiMatte این شکاف را با پیاده‌سازی آلفا مت پر می‌کند. در این حالت، مرزهای محو دقیقاً همان‌طور که در واقعیت ظاهر می‌شوند، توصیف می‌گردند. طبق گزارش‌های منتشر شده، این بهبود در داده‌های با رزولوشن بالای DIS کاملاً مشهود است؛ جایی که امتیاز SAM 3 بین ۰.۶۴۹ و ۰.۷۰۳ است، اما MultiMatte به بازه ۰.۸۹۳ تا ۰.۹۲۳ رسیده است.

تیم Feyn با تکیه بر مدل SAM 3 شرکت متا (Meta) که در سال ۲۰۲۵ عرضه شد، از روش لورا (LoRA) — شبیه به اضافه کردن یک لایه نازک اصلاحی روی یک نقاشی قدیمی برای تغییر جزئیات بدون تخریب اثر اصلی — استفاده کرد. آن‌ها تنها ۱۹.۴۹ میلیون پارامتر از مجموع ۸۶۰ میلیون پارامتر مدل را تغییر دادند. این بدان معناست که تنها ۲.۲۷٪ از وزن‌های مدل به‌روزرسانی شده‌اند، اما جهش عملکردی حاصله بسیار چشمگیر بود. به نقل از وب‌سایت usefeyn.com، مدل MultiMatte در محک DIS-VD به امتیاز S-measure معادل ۰.۹۰۱ دست یافت، در حالی که امتیاز SAM 3 در همین محک ۰.۶۶۷ بود.

چند لایه مات: آنچه می‌خواهید نگه دارید، بقیه را حذف کنید — فاین

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های بینایی-زبانی اشاره کردیم، همراستاسازی متن و تصویر کلید دستیابی به کنترل دقیق در ویرایش است. در همین راستا، معماری Intermediate Fusion نیز با ایجاد استدلال بومی در مدل‌های چندوجهی، گامی مهم در جهت درک عمیق‌تر ارتباط میان مفاهیم متنی و بصری برداشته است.

معماری فنی و استراتژی آموزش

ساختار SAM 3 شامل چندین بخش همراستا است: یک برج بینایی (Vision Tower)، یک برج متنی CLIP، یک رمزگذار هندسی، یک رمزگذار و رمزگشای تشخیص، و در نهایت یک رمزگشای ماسک. مدل MultiMatte توانایی همراستاسازی متنی این بخش‌ها را به طور مستقیم به حوزه متینگ (Matting) منتقل کرده است.

به بر اساس مستندات فنی، کارایی این مدل حاصل استراتژی‌های آموزشی زیر است:

  • یکپارچه‌سازی PEFT: تیم از تنظیم کارآمد با پارامتر اندک (PEFT) از طریق لورا (Hu et al., 2021) استفاده کرد. در این روش، وزن‌های پیش‌آموزش‌دیده منجمد (Frozen) ماندند و مدل تنها دو ماتریس کوچک را برای هر لایه خطی هدف یاد گرفت.
  • پیکربندی آداپتور: با پیروی از تحلیل‌های لورا در سال ۲۰۲۵ توسط Thinking Machines، یک آداپتور با رتبه ۱۶ (Rank-16) روی لایه‌های توجه (Attention) و تصویرسازی‌های MLP در تمام برج‌ها، از جمله برج متنی CLIP، قرار گرفت. این آداپتورها در نهایت با وزن‌های اصلی ادغام شدند تا در زمان استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند — نیازی به کتابخانه‌های مجزا نباشد.
  • ترکیب داده‌ها: آموزش روی ۱۹,۹۵۳ تصویر شامل صحنه‌های استتار، محیط‌های دریایی، تارهای مو و سوژه‌های با رزولوشن بالا انجام شد. این فرآیند آموزشی در ۱۴,۰۰۰ گام (Step) اجرا گردید.
  • نظارت بر پرامپت: برای آموزش «سرِ متینگ» (Matte Head) جدید، از ۴,۹۴۹ تصویر (معادل ۲۴.۸٪ از کل مجموعه) با برچسب‌های انسانی استخراج شده از FlowDIS (Sargsyan and Navasardyan, 2026) استفاده شد.
  • توابع زیان: برای بهینه‌سازی قطعه‌بندی معنایی، ترکیبی از Focal Loss (Lin et al., 2017) و Dice Loss به کار گرفته شد.

عملکرد در محک‌های جهانی

نتایج بر اساس S-measure (از ۰ تا ۱) که به شکل‌های وفادار به واقعیت پاداش می‌دهد و میانگین خطای مطلق (MAE) برای مقادیر شفافیت اندازه‌گیری شده‌اند. MultiMatte در تمام بخش‌های آزمایشی از SAM 3 پیشی گرفت.

برخی از دستاوردهای کلیدی عبارتند از:

  • DIS-VD: افزایش از ۰.۶۶۷ به ۰.۹۰۱ (بهبود ۰.۲۳۳+).
  • DIS-TE4: افزایش از ۰.۶۴۹ به ۰.۸۹۳ (بهبود ۰.۲۴۴+).
  • COD10K-TE: افزایش از ۰.۷۸۷ به ۰.۹۳۴ (بهبود ۰.۱۴۸+).

در مجموعه داده DAVIS-S — که یک بررسی حیاتی بود زیرا هیچ نمونه مشابهی در داده‌های آموزش نداشت — MultiMatte به بالاترین امتیاز مطلق خود یعنی ۰.۹۷۹ رسید. همچنین امتیاز DUT-OMRON را از ۰.۷۹۲ به ۰.۹۰۱ ارتقا داد. نکته جالب این است که حتی بدون تنظیم دقیق (Fine-tuning)، استفاده از یک نام مفهوم واقعی، ۰.۱۵۰ امتیاز S-measure به SAM 3 در محک DIS-VD اضافه می‌کند که ثابت می‌کند مسیر پرامپت پس از بازآموزی همچنان فعال مانده است.

برای توسعه‌دهندگان، این مدل در کتابخانه NoBg ادغام شده است. کاربران می‌توانند با دستور pip install nobg آن را نصب کرده و با فراخوانی تابع ساده predict و تعیین نام شیء مورد نظر (مثلاً "the dog")، مدل را پیاده‌سازی کنند.

این تغییر از «تشخیص» به «متینگ»، خط پایه ویرایش تصاویر مبتنی بر پرامپت را جابه‌جا می‌کند. Feyn ثابت کرد که مدل‌های عظیم برای کسب قابلیت‌های تخصصی و دقیق، نیازی به آموزش مجدد کامل ندارند و می‌توان با لایه‌های کوچک به نتایج خیره‌کننده رسید. در حالی که مدل‌هایی مانند NeoMME با بهینه‌سازی ذخیره‌سازی بردارها بر کارایی زیرساختی تمرکز کرده‌اند، MultiMatte بر ارتقای کیفیت خروجی نهایی متمرکز است.

برای کاربر نهایی، این یعنی کیفیت «بریدن» (Cutout) در ابزارهای هوش مصنوعی از تخمین‌های تقریبی به دارایی‌های آماده برای تولید صنعتی تبدیل می‌شود. توانایی هدایت مدل با کلمات برای مدیریت سخت‌ترین بخش‌های تصویر — یعنی لبه‌ها — گلوگاه‌های دستی در طراحی دیجیتال را از بین می‌برد.

شما می‌توانید دقت این مدل را روی تصاویر شخصی خود در وب‌سایت usefeyn.com/multimatte بررسی کنید یا پیاده‌سازی آن را در گیت‌هاب (GitHub) دنبال نمایید.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، کتابخانه NoBg را نصب کنید و تفاوت ماسک‌های باینری و آلفا مت را روی تصاویر پیچیده تست کنید.
  • برای طراحان، اکنون زمان جایگزینی ابزارهای سنتی حذف پس‌زمینه با مدل‌های Promptable است تا سرعت گردش کار افزایش یابد.
  • دقت مدل را روی تصاویر شخصی خود در وب‌سایت usefeyn.com/multimatte بررسی کنید.

اما این تنها بخشی از تحول در بینایی ماشین است؛ اثر مدل‌های چندوجهی بر آینده عکاسی محاسباتی را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار مدل SAM 3 و بهینه‌سازی لایه‌های خروجی، هزینه و زمان دستی در پس‌تولید تصویری را به شدت کاهش می‌دهد. انتقال از ماسک‌های سخت به شفافیت پیوسته، استاندارد جدیدی برای ابزارهای طراحی گرافیکی ایجاد می‌کند.

تأثیر برای ایران

توسعه‌دهندگان ایرانی در حوزه گرافیک و ادیت ویدیو می‌توانند با استفاده از کتابخانه متن‌باز NoBg، قابلیت‌های حذف پس‌زمینه حرفه‌ای را بدون نیاز به زیرساخت‌های سنگین به محصولات خود اضافه کنند.

·نگاه ما
تحریریه دات‌هوش

استفاده از لورا برای تبدیل یک مدل تشخیص کلی به یک ابزار متینگ تخصصی، نشان می‌دهد که آینده مدل‌های بنیادی در «تخصص‌گرایی سریع» است نه لزوماً بزرگ‌تر شدن. این رویکرد ثابت می‌کند که می‌توان با تغییر کمتر از ۳ درصد پارامترها، خروجی را از سطح آماتور به سطح تولید صنعتی رساند. در واقع، مدل‌های غول‌پیکر اکنون به عنوان زیرساختی برای آداپتورهای کوچک و بسیار دقیق عمل می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.