پرش به محتوای اصلی
پرش به محتوای مقاله

پژوهش جدید: شکست CLIP و BLIP در تشخیص تفاوت‌های جزئی محصولات

·۱ مرداد ۱۴۰۵۷ دقیقه مطالعه
تصویری از محصول با برچسب نادرست و نمودار مقایسه‌ای شباهت متن و تصویر در مدل‌های CLIP و BLIP
تصویری از محصول با برچسب نادرست و نمودار مقایسه‌ای شباهت متن و تصویر در مدل‌های CLIP و BLIP
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی اینکه مدل‌های پیشرفته‌ای مثل BLIP-2 در تشخیص تفاوت‌های SKU (برند و سایز) شکست می‌خورند و امتیازات بالای گمراه‌کننده‌ای می‌دهند؛ در حالی که پیش‌تر تصور می‌شد مقیاس بیشتر مدل‌ها این دقت را فراهم می‌کند.

یک پاکت شیر با برند اشتباه ممکن است از مدل BLIP امتیاز شباهت ۰.۷۹ بگیرد و عملاً یک خطای فاحش را به عنوان «تطابق احتمالی» تأیید کند. این شکاف در دقت، یک نقص اعتماد جدی برای خریداران آنلاین ایجاد می‌کند که برای تأیید جزئیات محصول پیش از خرید، به تصاویر تکیه می‌کنند. تصور کنید برای خرید برند خاصی از شیر اقدام می‌کنید؛ تصویر یک پاکت «Prairie Farms» را نشان می‌دهد، اما در توضیحات نوشته شده «Organic Valley». همین لحظه‌ی تردید باعث می‌شود مشتریان دچار شک شوند، در تصمیم خود تردید کنند و در بسیاری از موارد، سبد خرید را به‌طور کامل رها کنند.

این سناریو با استفاده از محصول شیر کامل Prairie Farms (در پاکت یک کوارتی) که در سراسر این تحلیل مورد استفاده قرار گرفته، به تصویر کشیده شده است. در دنیای تجارت الکترونیک، هزینه یک لیست نامنطبق بسیار بالا است. طبق تحقیقات منتشر شده در ScienceDirect و Besedo، ناهماهنگی‌های میان تصاویر و متن منجر به افزایش نرخ مرجوعی کالا، کاهش اعتماد مشتری و افزایش اختلافات و دعاوی حقوقی می‌شود. این مسائل در پلتفرم‌های بزرگی به‌صورت سیستمی و گسترده دیده می‌شوند:

  • Amazon: بخش قابل توجهی از مرجوعی‌ها و شکایت‌ها ناشی از محصولاتی است که در واقعیت با آنچه در تصویر لیست شده متفاوت هستند [2].
  • eBay: خریداران به‌کرات گزارش داده‌اند که اختلافات آن‌ها بر اثر دریافت کالایی تحریک شده که با تصاویر نمایش داده شده تطابق ندارد [1].
  • Instacart: لیست‌های خواربار گاهی دارای تصاویر قدیمی یا نادرست هستند که منجر به انتخاب اشتباه محصول توسط مشتری می‌شود؛ این مسئله به‌ویژه زمانی بحرانی است که محصولات از نظر بصری بسیار شبیه به هم باشند [3].

در تمامی این بازارها، ناهماهنگی‌ها در کنار اطلاعات ناقص یا نامفهوم محصول، در رده‌ی عوامل اصلی نارضایتی مشتریان قرار دارند [1]. برای این پلتفرم‌ها، مشکل تنها چند خطای اتفاقی نیست، بلکه مقیاس عظیم میلیون‌ها لیست ارسالی توسط شخص ثالث (Third-party) با کنترل کیفی ناسازگار است که بازبینی دستی آن‌ها را غیرممکن می‌سازد. بنابراین، آنچه مورد نیاز است، یک سیستم خودکار است که بتواند پیش از آنکه مشتری با مورد نامنطبق مواجه شود، آن را شناسایی و علامت‌گذاری کند.

در راستای پوشش قبلی ما درباره‌ی اینکه چگونه OCR و Moondream2 این شکاف‌های خاص را برطرف می‌کنند، این مسیر معماری با آزمایش مدل‌های عمومی بردار معنایی (Embedding) آغاز شد. این مقاله، بخش اول از یک سری دو قسمتی است؛ در حالی که این بخش بر تعریف مسئله، مبنای CLIP و مدل BLIP تمرکز دارد، بخش دوم به خط لوله (Pipeline) ترکیبی OCR و پرسش‌وپاسخ بصری (VQA) می‌پردازد که در ادامه پیاده شد. هدف نهایی، خلق سیستمی خودکار بود که لیست‌های نامنطبق را پیش از رسیدن به دست مصرف‌کننده شناسایی کند.

مبنای Zero-Shot: مدل CLIP

آزمایش‌ها ابتدا با استفاده از مدل CLIP (Contrastive Language–Image Pretraining) توسعه‌یافته توسط OpenAI انجام شد. مدل CLIP روی صدها میلیون جفت تصویر-متن آموزش دیده است تا یک فضای برداری مشترک را بیاموزد. در این نمایش ریاضی، تصاویر و متونی که از نظر معنایی به هم نزدیک هستند، در کنار یکدیگر قرار می‌گیرند و موارد غیرمرتبط در فواصل دوری از هم قرار می‌گیرند.

در عمل، تصویر یک پاکت شیر و متن «شیر کامل» (whole milk) امتیاز شباهت کسینوسی بالایی می‌گیرند، در حالی که همان تصویر اگر با متن «گربه‌ای که با توپ بازی می‌کند» جفت شود، امتیاز بسیار پایینی دریافت می‌کند. پیاده‌سازی این سیستم از CLIPProcessor و CLIPModel کتابخانه transformers استفاده می‌کند تا شباهت بین بردارهای نرمال شده‌ی تصویر و متن را محاسبه کند. سیستم مدیریت تخصیص سخت‌افزاری را با بررسی وجود mps (Metal Performance Shaders) یا بازگشت به cpu انجام می‌دهد.

تصویر: تشخیص عدم تطابق محصول با CLIP و BLIP

برای دسته‌بندی این نتایج، یک نقشه‌شباهت (Similarity Mapping) به شرح زیر تعریف شد:

  • امتیاز بیشتر از ۰.۳۰: تطابق احتمالی (Likely match)
  • بین ۰.۲۰ تا ۰.۳۰: نامطمئن (Uncertain)
  • امتیاز کمتر از ۰.۲۰: عدم تطابق احتمالی (Likely mismatch)

اما نتایج نشان داد که CLIP در تشخیص‌های دقیق و جزئی (Fine-grained) دارای محدودیت‌های آشکار است. تست روی تصویر شیر کامل Prairie Farms با توصیفات مختلف نشان داد که در حالی که CLIP با اطمینان کامل یک «گربه در حال بازی» را به عنوان عدم تطابق شناسایی کرد (امتیاز ۰.۱۱)، اما در تفکیک جزئی برند و اندازه دچار مشکل شد:

  • توصیف درست (یک کوارت شیر کامل از Prairie Farms): ۰.۳۱ (تطابق احتمالی)
  • برند اشتباه (یک کوارت شیر کامل از Organic Valley): ۰.۲۹ (نامطمئن)
  • اندازه اشتباه (نیم گالون شیر کامل از Prairie Farms): ۰.۳۰ (نامطمئن)

به دلیل اینکه CLIP توصیفات را به‌صورت کل‌نگر (Holistic) کدگذاری می‌کند، تغییر در نام برند یا مقدار محصول، بردار را به‌اندازه کافی جابه‌جا نمی‌کند تا یک سیگنال واضح «عدم تطابق» صادر شود. این مدل نوع محصول (شیر) را تشخیص می‌دهد اما در شناسایی جزئیات خاص SKU شکست می‌خورد. این امر CLIP را به یک مبنای مفید برای شناسایی عدم تطابق‌های فاحش تبدیل می‌کند، اما برای تفکیک در سطح محصول ناکافی است.

مقیاس‌پذیری با BLIP-2

برای بهبود درک مدل، سیستم به سمت مدل BLIP (Bootstrapping Language-Image Pre-training) تغییر مسیر داد. این انتقال، دو متد متمایز را معرفی کرد: شرح‌نویسی تصویر (Image Captioning) و تطبیق تصویر-متن (ITM).

مکانیزم‌های شرح‌نویسی تصویر

شرح‌نویسی تصویر به مدل اجازه می‌دهد آنچه را می‌بیند توصیف کند و بدین ترتیب ادراک مدل را صریح و قابل عیب‌یابی (Debuggable) می‌کند. آزمایش‌های اولیه با مدل blip-image-captioning-base یک حالت شکست شدید در تصاویر محصولی که متن زیادی داشتند را نشان داد؛ مدل در مواجهه با برچسب‌های برجسته محصول، خروجی‌های تکراری مانند «classic classic classic classic...» تولید می‌کرد.

برای رفع این مشکل، خط لوله به مدل Salesforce/blip2-opt-2.7b ارتقا یافت. این نسخه از یک مدل زبانی بزرگ (OPT-2.7B) به عنوان ستون فقرات زبانی خود برای تولید شرح‌های منسجم استفاده می‌کند. پیاده‌سازی این بخش شامل Blip2Processor و Blip2ForConditionalGeneration است که تصاویر را در حالت float16 پردازش کرده و برای بهره‌وری بیشتر، تولید متن را به max_new_tokens=50 محدود می‌کند.

نتایج به دست آمده روی سه محصول تست، موفقیت‌های پراکنده‌ای را نشان داد:

  • کره شور Land O Lakes (واقعی: کره شور، ۸ اونس): مدل عبارت «land o lakes salted butter» را تولید کرد و برچسب را به‌درستی خواند.
  • شیر Prairie Farms (واقعی: یک کوارت شیر کامل از Prairie Farms): مدل نوشت «یک پاکت شیر با برچسب روی آن» و هویت برند را گم کرد.
  • سینه مرغ Amazon Fresh (واقعی: سینه مرغ بدون پوست و استخوان، ۳۰ اونس): مدل عبارت «یک بسته سینه مرغ» را تولید کرد و جزئیات حیاتی «بدون پوست و استخوان» و وزن «۳۰ اونس» را نادیده گرفت.

اگرچه BLIP-2 در خواندن برچسب‌های خاص به‌طور محسوسی بهتر از مدل پایه است، اما همچنان جزئیات دانه‌ی ریز مانند اندازه و نوع محصول را برای بسیاری از کالاها گم می‌کند.

حالت شکست در مکانیزم ITM

بخش تطبیق تصویر-متن (ITM) در BLIP به‌گونه‌ای طراحی شده که یک امتیاز احتمالی بین ۰ و ۱ خروجی دهد که نشان‌دهنده میزان تطابق تصویر و متن است. این امتیاز نسبت به شباهت کسینوسی CLIP، تفسیرپذیرتر است زیرا نیاز به کالیبراسیون خارجی ندارد. این بخش از BlipProcessor و BlipForImageTextRetrieval با فعال کردن پرچم use_itm_head=True و استفاده از تابع softmax برای استخراج امتیاز نهایی بهره می‌برد.

تصویر: تشخیص ناهماهنگی محصول با CLIP و BLIP

هنگام تست روی محصول شیر Prairie Farms، نتایج ITM نشان داد که این مدل برای نیازهای یک بازارگاه (Marketplace) بیش از حد تسامح دارد:

  • درست (شیر Prairie Farms): ۰.۹۹۹۸ (تطابق احتمالی)
  • اندازه اشتباه (دو کوارت): ۰.۹۹۹۶ (تطابق احتمالی)
  • برند اشتباه (Organic Valley): ۰.۷۸۷۲ (تطابق احتمالی)
  • عدم تطابق آشکار (گربه در حال بازی): ۰.۰۰۰۰ (عدم تطابق احتمالی)

در یک محیط عملیاتی، برندی که امتیاز ۰.۷۹ می‌گیرد، به‌عنوان تطبیق تایید شده و عبور می‌کند. این موضوع ثابت می‌کند که هر دو مدل CLIP و BLIP، توصیف محصول را به عنوان یک کل می‌بینند، نه اینکه به‌طور سیستماتیک ویژگی‌های مجزای محصول را بررسی کنند.

تحلیل: محدودیت‌های بردار معنایی کل‌نگر

این شکست، یک فرض بحرانی در هوش مصنوعی چندوجهی (Multimodal) فعلی را برجسته می‌کند: این باور که «شباهت» برابر با «دقت» است. این موضوع به‌ویژه به این دلیل دشوار است که داده‌های محصولات در دنیای واقعی به‌طور فریبنده‌ای پیچیده‌اند:

  • ناهماهنگی برند: دو پاکت شیر ممکن است از نظر شکل و رنگ کاملاً یکسان باشند و تنها تفاوت آن‌ها در چند پیکسل از یک فونت کوچک روی برچسب باشد.
  • ناهماهنگی اندازه: بسته‌بندی‌های «۸ اونس» در برابر «۱۶ اونس» اغلب از نظر بصری یکسان هستند و تنها در چاپ ریز پشت بسته تفاوت دارند.
  • ناهماهنگی گونه (Variant): «کره شور» در مقابل «کره بدون نمک» از یک محصول و بسته‌بندی یکسان استفاده می‌کنند، اما SKU متفاوتی دارند که برای مشتری تفاوت معناداری ایجاد می‌کند.
  • ناهماهنگی‌های آشکار: جفت کردن تصویر سینه مرغ با توصیف کره برای انسان‌ها ساده است، اما این مورد باید در مقیاس وسیع به‌طور قابل اعتمادی شناسایی شود.

در یک زمینه کلی، یک پاکت شیر Organic Valley بسیار شبیه به یک پاکت شیر Prairie Farms است. اما در یک تراکنش تجاری، همین شباهت دقیقاً نقطه شکست است. برای توسعه‌دهندگان، این بدان معناست که مدل‌های همه‌منظوره نمی‌توانند به‌عنوان یک «جعبه سیاه» برای تضمین کیفیت استفاده شوند. آن‌ها در شناسایی «عدم تطابق‌های فاحش» عالی هستند اما در برابر ویژگی‌های ریزِ نوشته شده در متن کورند. مشابه این چالش در شناسایی دقیق تفاوت‌ها را می‌توان در بررسی شکست تشخیص‌دهنده‌های تجاری در برابر مدل‌های انتشار مشاهده کرد، جایی که مدل‌های پیشرفته نیز در درصد قابل توجهی از موارد دچار خطا می‌شوند. درس آموخته شده روشن است: منطق باید از «شباهت کل‌نگر» به «مقایسه ساختاریافته بر اساس هر ویژگی» تغییر یابد.

مسیر پیش‌رو

برای غلبه بر این محدودیت‌ها، خط لوله به سمت رویکرد «دیکشنری ویژگی‌ها» حرکت می‌کند. این شامل فاصله گرفتن از یک امتیاز شباهت واحد و حرکت به سمت سیستمی است که ویژگی‌های خاص را به‌صورت مجزا تحلیل می‌کند:

  • نویسه‌خوانی نوری (OCR): نام برندها، اندازه‌ها و گونه‌ها را مستقیماً از برچسب محصول به صورت متن خام می‌خواند.
  • پرسش‌وپاسخ بصری (VQA): به سوالات هدفمند درباره ویژگی‌های بصری که OCR قادر به خواندن آن‌ها نیست (مانند نوع ظرف یا دسته‌بندی محصول) پاسخ می‌دهد و به‌عنوان جایگزینی برای لوگوها یا فونت‌های استایلیزه عمل می‌کند.
  • منطق وتوی سخت (Hard Veto): تضمین می‌کند که اگر حتی یک ویژگی واحد (مثلاً اندازه) به‌عنوان اشتباه شناسایی شد، کل لیست به‌عنوان عدم تطابق علامت‌گذاری شود. در یک بازارگاه، اندازه اشتباه به‌اندازه اشتباه بودن کل محصول آسیب‌رسان است.

این رویکرد، سیستم را از یک طبقه‌بندی‌کننده عمومی به یک ابزار حسابرسی (Auditing) دقیق تبدیل می‌کند. مشابه این رویکرد سخت‌گیرانه در بازرسی، چارچوب سه‌لایه برای شناسایی دست‌کاری تصاویر در مقالات علمی نیز به دنبال حذف خطاهای احتمالی از طریق لایه‌بندی تحلیل‌هاست. کیفیت محتوای محصول یک نگرانی حاشیه‌ای نیست؛ تحقیقات به‌طور مداوم ناهماهنگی‌های بین تصاویر و متن را با کاهش اعتماد مشتری و کاهش قصد خرید مرتبط می‌دانند [4]. سیستم با شناسایی لیست‌هایی که احتمالاً اشتباه هستند، توجه انسان را به جایی که بیشترین اهمیت را دارد معطوف می‌کند، آن هم با کسری از هزینه بازبینی دستی. تمامی کدها و نوت‌بوک‌های Jupyter برای این آزمایش‌ها در گیت‌هاب در دسترس هستند: github.com/ebiarian/product-image-description-alignment.

چرا این موضوع مهم است؟

این یافته‌ها نشان می‌دهد که برای کاربردهای حساس تجاری، مدل‌های بنیادین چندوجهی بدون یک لایه بازرسی ساختاریافته غیرقابل اعتماد هستند. تخصص در این حوزه باید از «جست‌وجوی معنایی» به سمت «حسابرسی دقیق ویژگی-محور» حرکت کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حوزه اتوماسیون فروشگاه‌های آنلاین یا Marketplace فعالیت می‌کنند، این هشدار می‌دهد که نباید برای تایید صحت محصولات تنها به مدل‌های VLM تکیه کنند و باید خط لوله OCR را به سیستم خود اضافه کنند.

·نگاه ما
تحریریه دات‌هوش

تکیه بر بردار معنایی برای کنترل کیفیت در تجارت الکترونیک، اشتباه است چون در این حوزه «شباهت» دشمن «دقت» است. مدل‌های فعلی برای درک مفاهیم کلی ساخته شده‌اند، در حالی که تأیید SKU نیازمند استخراج دقیق داده است، نه تخمین احتمال. راهکار واقعی در تبدیل خروجی‌های بصری به دیکشنری‌های ویژگی (Feature Dictionary) نهفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.