پرش به محتوای اصلی
پرش به محتوای مقاله

۳۰ درصد تصاویر استخراج‌شده از ویکی‌پدیا با موضوع مقاله تطبیق ندارند

·۱۸ مرداد ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
بازبینی ۱۴۵۱۲ عکس میراث فرهنگی با مدل بینایی: منابع «معتبر» آلوده‌ترین بودند.
بازبینی ۱۴۵۱۲ عکس میراث فرهنگی با مدل بینایی: منابع «معتبر» آلوده‌ترین بودند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف مکانیسم «توهم جغرافیایی» در VLMها؛ اینکه مدل‌ها در حضور نام مکان، تحلیل تصویر را رها کرده و بر اساس دانش متنی خود پاسخ می‌دهند. همچنین اثبات عددی برتری ۲۰۰ برابری Google Places نسبت به ویکی‌پدیا در دقت تصاویر.

تصور کنید برای ساخت یک نقشه دیجیتال دقیق، هزاران عکس را از ویکی‌پدیا جمع‌آوری کنید و در نهایت بفهمید یک‌سوم آن‌ها متعلق به مکان دیگری است. این واقعیت تلخ، چالشی است که توسعه‌دهندگان مجموعه‌داده‌های بصری با آن روبروستند. طبق گزارش تیم Kahve Tabela (پروژه اطلس باز میراث فرهنگی ترکیه)، در جریان بازرسی ۱۴,۵۱۲ عکس برای ثبت ۳۲,۰۰۰ اثر میراثی از جمله قلعه‌ها، شهرهای باستانی، مساجد و موزه‌ها، مشخص شد که حدود ۲۹.۳ درصد از تصاویر استخراج‌شده از بدنه مقالات ویکی‌پدیا، اصلاً مربوط به موضوع مورد نظر نیستند.

زمینه و بستر داده‌ها

ساخت مجموعه‌داده‌های باکیفیت با بودجه محدود، اغلب مستلزم تجمیع منابع باز است. این تیم برای پر کردن خلأهای تصویری از منابع متنوعی بهره گرفت: تصاویر بدنه مقالات ویکی‌پدیا، Wikimedia Commons (هم از طریق جستجوی جغرافیایی و هم تطبیق عنوان)، Google Places، Mapillary و فهرست ملی میراث فرهنگی ترکیه (Kültür Envanteri).

با این حال، پس از آنکه یکی از خوانندگان گزارش داد در یکی از صفحات، ساختمان اشتباهی نمایش داده شده است، تیم متوجه شد که این باور شهودی — که هر تصویری در داخل یک مقاله خاص باید مربوط به آن موضوع باشد — در مقیاس بزرگ نادرست است. مقالات ویکی‌پدیا اغلب شامل نقشه‌ها، ساختمان‌های مرتبط اما مجاور، پرتره افراد، نماهای کلی از سایت یا مساجد همسایه هستند که ابزارهای استخراج‌کننده (Scrapers) به‌اشتباه آن‌ها را به‌عنوان موضوع اصلی دریافت می‌کنند. این موضوع یادآور چالش‌های مشابه در ابزارهای پیشرفته‌تر است، جایی که ادغام تولید تصویر در گوگل ارث ریسک گسترش اطلاعات جغرافیایی غلط را به همراه داشت.

جزئیات بازرسی و مکانیسم‌ها

برای شناسایی این خطاها، تیم پژوهشی از یک مدل بینایی-زبانی (VLM) به نام Qwen3-VL 30B (نسخه ۸-بیت با دمای ۰) استفاده کرد. برای اجتناب از هزینه‌های هنگفت API، این مدل به‌صورت محلی روی دستگاه Mac Studio و با استفاده از کتابخانه MLX اجرا شد. آن‌ها برای بهینه کردن عملکرد، ابعاد تصاویر را به ۵۱۲ پیکسل کاهش دادند؛ این اقدام توان عملیاتی (Throughput) را ۱۰ برابر کرد، بدون اینکه در یک مجموعه اعتبارسنجی ۵۱۲ عکسی، قضاوتهای مدل تغییر کند.

این بازرسی از یک فرآیند سخت‌گیرانه دو مرحله‌ای (Two-pass verification) پیروی می‌کرد:

  • مرحله اول (هویت): مدل عکس، نام مکان و استان را می‌دید و از او پرسیده می‌شد: «آیا این عکس می‌تواند متعلق به این مکان باشد؟». در این فاز، ۶۴.۳ درصد (۳۰۰ تصویر) از عکس‌های ویکی‌پدیا به‌طور گسترده به‌عنوان «نامطابق» علامت‌گذاری شدند.
  • مرحله دوم (طبقه‌بندی): چون درخواست‌های مبتنی بر نام باعث ایجاد توهم (Hallucination) می‌شود، تیم عکس‌های علامت‌گذاری شده را بدون ذکر نام دوباره پردازش کرد. مدل فقط تصویر و یک دسته را می‌دید: «آیا این تصویر یک قلعه یا ویرانه‌های قلعه است؟ بله/خیر».

نتایج اعتبارسنجی

نتایج این متدولوژی تکان‌دهنده بود؛ تنها ۳۷ درصد از اتهامات اولیه در مرحله دوم تأیید شدند. بررسی متن‌های خروجی (Transcripts) نشان داد وقتی نامی به مدل داده می‌شود، مدل به‌جای تحلیل تصویر، درباره «نام» استدلال می‌کند. برای مثال، مدل ممکن است ادعا کند «کربلا در عراق است» یا «این رکورد مربوط به دنیزلی است اما عکس شبیه الازیگ است»؛ در واقع مدل جغرافیا را توهم می‌زد، نه اینکه محتوای بصری را تحلیل کند.

مثلاً در عکس‌های تطبیق‌یافته با عنوان در Wikimedia، نرخ علامت‌گذاری در مرحله اول ۵۵.۶٪ بود، اما در مرحله دوم تنها ۱.۲٪ آن‌ها به‌عنوان عکس اشتباه تأیید شدند. اگر تیم به نتایج مرحله اول اعتماد می‌کرد، ۶۰۰ عکس صحیح را حذف می‌کرد.

در نهایت، این استاندارد سخت‌گیرانه تفاوت فاحشی را در کیفیت منابع آشکار کرد:

  • تصاویر بدنه مقالات ویکی‌پدیا: ۲۹.۳٪ تأیید شده به عنوان غلط.
  • جست‌وجوی جغرافیایی Wikimedia Commons: ۱.۵٪ تأیید شده به عنوان غلط.
  • فهرست میراث ملی: ۱.۲٪ تأیید شده به عنوان غلط.
  • Mapillary: ۰.۸٪ تأیید شده به عنوان غلط.
  • Google Places: ۰.۱٪ تأیید شده به عنوان غلط.

این اعداد ثابت می‌کنند Google Places تقریباً ۲۰۰ برابر پاک‌تر از استخراج مستقیم از ویکی‌پدیا است. در نتیجه، تیم ۲۶۴ عکس غلط را حذف کرد و خط لوله دریافت داده‌ها را تغییر داد تا عکس‌های گوگل و Mapillary به‌طور خودکار متصل شوند، در حالی که محتوای استخراج‌شده از ویکی‌پدیا اکنون وارد صف بررسی دستی می‌شود.

پیامدهایی برای کیوریتوری مجموعه‌داده‌ها

این تجربه یک نقص حیاتی را در سیستم‌های تولید بازیابی‌افزا (RAG) برملا می‌کند: «منشأ داده» (Provenance) یک ویژگی کلیدی است. باید ذخیره کنید که هر دارایی از کجا آمده است، زیرا نرخ خطا، ویژگیِ منبع است. برای اعتبارسنجی داده‌های بصری، استفاده از نام‌ها در پرامپت باعث ایجاد حلقه بازخورتی از توهمات می‌شود.

اعتبارسنجی واقعی نیازمند پرسش‌های دسته‌بندی‌شده با واژگان بسته و یک سیستم توافق چند-مرحله‌ای است. نظر یک مدل تنها یک «اتهام» است، نه یک «حکم». این رویکرد نشان می‌دهد که چرا قواعد ساده‌ی خودارزیابی در عامل‌های هوش مصنوعی نمی‌توانند خطاهای تثبیت‌شده را شکار کنند و نیاز به متدهای پیچیده‌تری است. در حال حاضر مجموعه داده‌های Kahve Tabela از طریق Zenodo (با DOI و لایسنس CC) و Kaggle در دسترس است و در سایت kahvetabela.com قابل مرور است.

گام بعدی شما

  • اگر از داده‌های ویکی‌پدیا برای آموزش مدل‌های بینایی استفاده می‌کنید، حتماً یک مرحله «تأیید بدون نام» (Name-blind verification) اضافه کنید.
  • منبع هر تصویر را در متاداده‌های خود ذخیره کنید تا در صورت شناسایی منشأ خطا، بتوانید کل دسته را سریع‌تر پاک‌سازی کنید.
  • به‌جای تکیه بر یک مدل، از سیستم توافق چند-مدلی (Multi-pass Agreement) برای تأیید نهایی استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به تحلیل ما درباره‌ی بهینه‌سازی مدل‌های VLM روی تراشه‌های اپل مراجعه کنید.

چرا این موضوع مهم است؟

این یافته با تکیه بر تجربه عملی در مقیاس هزاران تصویر، اعتبار روش‌های رایج استخراج داده از وب را زیر سؤال می‌برد. نتیجه این است که سازمان‌ها باید استراتژی جمع‌آوری داده‌های خود را از «کمیت» به «تأیید منشأ» تغییر دهند تا از مسمومیت داده‌ها جلوگیری کنند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت مجموعه‌داده‌های بصری برای زبان فارسی یا مناطق محلی هستند، این خبر هشدار می‌دهد که استخراج خودکار از ویکی‌پدیا بدون لایه تأیید انسانی یا مدل-بنیان، منجر به ایجاد داده‌های غلط در مقیاس بالا می‌شود.

·نگاه ما
تحریریه دات‌هوش

بزرگ‌ترین درس این مطالعه، افشای «سوگیری نام» در مدل‌های بینایی است؛ مدل‌ها ترجیح می‌دهند به دانش متنی خود درباره یک مکان تکیه کنند تا آنچه را که واقعاً در پیکسل‌ها می‌بینند. این یعنی در بسیاری از بنچمارک‌های فعلی، مدل‌ها احتمالاً با «حدس زدن» بر اساس نام‌ها موفق شده‌اند، نه با «دیدن». این یافته، ضرورت انتقال از پرسش‌های باز به پرسش‌های دسته‌بندی‌شده (Closed-vocabulary) را برای هر کسی که با داده‌های بصری کار می‌کند، اثبات می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.