پرش به محتوای اصلی
پرش به محتوای مقاله

چرا مدل‌های چندوجهی در استناد به تصاویر اسناد طولانی شکست می‌خورند؟

·۲۷ خرداد ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
چرا مدل‌های چندوجهی در استناد به تصاویر اسناد طولانی شکست می‌خورند؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیسمی برای استناد متقاطع (Interleaved Citation) بین متن و تصویر در مدل‌های باز-وزن؛ این اولین بار است که مدل‌های متن‌باز در سطح استناد بصری در اسناد طولانی، شکاف عملکردی با مدل‌های Frontier را می‌بندند.

آیا یک مدل چندوجهی واقعاً می‌تواند هنگام توضیح یک روند پیچیده، به نمودار مربوطه «اشاره» کند یا صرفاً بر اساس متن حدس می‌زند؟ اگر از مدل‌های فعلی برای تحلیل گزارش‌های PDF استفاده می‌کنید، احتمالاً متوجه شده‌اید که آن‌ها تمایل دارند پاسخ‌ها را فقط بر اساس متن بدهند و داده‌های بصری غنی را نادیده بگیرند.

VinQA، مجموعه داده‌ای که در ۱۵ ژوئن ۲۰۲۶ منتشر شد، دقیقاً همین مشکل را هدف قرار داده است. طبق اعلام پژوهشگران، این framework مدل‌ها را مجبور می‌کند پاسخ‌هایی طولانی تولید کنند که در آن عناصر بصری به‌طور فعال در متن جای گرفته و به صفحات خاصی از سند مستند شده باشند.

بسیاری از مدل‌های زبانی بزرگ چندوجهی (Multimodal LLMs) از سوگیری «پاسخ متن‌محور» رنج می‌برند. این یعنی مدل‌ها تفاوت بین یک توصیف ساده از تصویر و سنتز واقعی اطلاعات (که در آن یک جدول یا دیاگرام مدرک اصلی ادعاست) را نمی‌فهمند. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های باز-متن اشاره کردیم، توانایی مدل در «مبنی‌سازی» (Grounding) داده‌ها، مرز بین یک ابزار کاربردی و یک ماشین تولید توهم است.

بر اساس مستندات این پژوهش، دو استراتژی رمزگذاری برای حل این چالش آزمایش شد:

  • رمزگذاری صفحه (Page Encoding): تبدیل مستقیم تصاویر کامل صفحه با استفاده از جعبه‌های محصورکننده (Bounding Boxes) به عنوان واحدهای قابل استناد.
  • رمزگذاری وجه (Modality Encoding): تجزیه صفحات برای استخراج متن و برش عناصر بصری به‌صورت مجزا جهت رمزگذاری.

برای سنجش موفقیت، تیم سازنده چارچوب M-GroSE را توسعه داد تا معیارهایی چون کامل بودن، مرتبط بودن و وفاداری به منبع را بسنجد. همچنین ابزار Visual Source F1 برای quantification دقت استنادها و Visual G-Eval (یک داور مبتنی بر MLLM) برای تأیید جایگذاری صحیح تصاویر در جایگاه معنایی درست معرفی شدند.

تحلیل داده‌ها یک چرخش راهبردی را نشان می‌دهد: اگرچه رمزگذاری وجه در ابتدا برای اسناد پیچیده مقاوم‌تر است، اما تنظیم دقیق (Fine-tuning) مدل‌های Qwen2.5-VL با وزن‌های باز روی VinQA اجازه می‌دهد تا رمزگذاری صفحه به عملکردی مشابه برسد. این یعنی با پیشرفت استدلال مکان‌مند در مدل‌ها، شاید دیگر نیازی به تجزیه دستی و پیچیده اسناد نباشد.

گام بعدی شما

  • بررسی کنید که آیا ادغام استنادات بصری در خط‌لوله های تولید بازیابی‌افزا (RAG) می‌تواند نرخ توهم را در گزارش‌های خودکار شما کاهش می‌دهد یا خیر.
  • مقایسه خروجی‌های مدل‌های باز-وزن (مانند Qwen) با مدل‌های بسته در تحلیل اسناد دارای جدول.
  • مطالعه مستندات M-GroSE برای ارزیابی دقیق‌تر مدل‌های استخراج داده از PDF.

اما اثر این پیشرفت بر کاهش هزینه‌های پردازشی در مقیاس سازمانی حتی حیاتی‌تر است — به تحلیل ما درباره‌ی بهینه‌سازی هزینه‌های استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر اعتبار متدولوژی M-GroSE، استانداردهای تحلیل اتوماتیک اسناد را تغییر می‌دهد. اکنون مدل‌ها می‌توانند به جای ادعاهای کلی، با ارائه مدرک تصویری، اعتماد کاربر متخصص را جلب کنند.

تأثیر برای ایران

این پژوهش برای توسعه‌دهندگان ایرانی که روی سیستم‌های تحلیل خودکار اسناد حقوقی و پزشکی با مدل‌های Llama یا Qwen کار می‌کنند، یک نقشه راه عملی برای کاهش توهمات ارائه می‌دهد.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که VinQA در واقع در حال جابه‌جا کردن یک عدد حیاتی است: انتقال از «توصیف تصویر» به «استدلال بر اساس تصویر». این خبر فرضیه قدیمی مبنی بر برتری مطلق مدل‌های بسته در درک ساختاری اسناد را می‌شکند و ثابت می‌کند که با داده‌های تخصصی، مدل‌های باز-وزن می‌توانند در سطح استنادی (Citation-level) به رقابت برسند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.