پرش به محتوای اصلی
پرش به محتوای مقاله

«مبنی‌سازی فریبنده»؛ حفره‌ای امنیتی در ارزیابی‌های سیستم‌های RAG

·۲۲ تیر ۱۴۰۵۴ دقیقه مطالعه
تحلیل
ارزیابی RAG شما رسید را چک می‌کند، نه بیمار را
ارزیابی RAG شما رسید را چک می‌کند، نه بیمار را
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شناسایی مکانیسم «مبنی‌سازی فریبنده» که در آن مدل با استفاده از ارجاعات واقعی اما برای موجودیت‌های اشتباه، سیستم‌های ارزیابی استاندارد را دور می‌زند و نرخ شکست بالای ۸۶٪ را در مدل‌های تخصصی پزشکی نشان می‌دهد.

اگر امروز برای ارزیابی سیستم‌های بازیابی اطلاعات خود تنها به بررسی «صحت ارجاعات» تکیه می‌کنید، احتمالاً با یک نقطه کور مرگبار روبرو هستید. تصور کنید مدل شما پاسخی کاملاً مستند به یک سؤال پزشکی می‌دهد، اما اطلاعات مربوط به «داروی B» را با اطمینان کامل به «داروی A» نسبت می‌دهد. در واقع، استقرار یک سیستم RAG بر اساس اسناد واقعی، به معنای تضمین «انتساب صحیح موجودیت» نیست.

این مشکل که مبنی‌سازی فریبنده (Deceptive Grounding) نامیده شده، به این معناست که مدل از داده‌های واقعی برای گمراه کردن کاربر استفاده می‌کند. طبق یک تحلیل فنی جدید که در ۱۳ جولای ۲۰۲۶ منتشر شد، مدل‌ها می‌توانند تمام تست‌های استاندارد وفاداری (Faithfulness) را پاس کنند اما در بنیاد خود کاملاً اشتباه باشند؛ آن‌ها صرفاً یک عبارت درست درباره «داروی Y» را به پرس‌وجویی درباره «داروی X» می‌چسبانند.

این شکست نشان می‌دهد که مدل‌ها اطلاعات را از هیچ ابداع نمی‌کنند، بلکه یک حقیقت را به موجودیت (Entity) اشتباهی می‌چسبانند. در محیط‌های حساس و با ریسک بالا، این وضعیت از توهمات (Hallucinations) عادی خطرناک‌تر است؛ زیرا وجود ارجاعات معتبر و استنادی، زنگ‌های خطر را در ذهن کاربر و سیستم‌های نظارتی خاموش می‌کند.

به نقل از گزارش «مبنی‌سازی فریبنده: شکست انتساب موجودیت در تولید بازیابی‌افزای بالینی»، این نقص یک مشکل سیستمی است که در حوزه‌های مختلف تکرار می‌شود. نویسندگان تأکید می‌کنند که این الگو فراتر از پزشکی است؛ برای مثال، یک ربات حقوقی ممکن است دو بند مشابه را با هم ترکیب کند، یا یک ربات پشتیبانی ممکن است برای سطح دسترسی اشتباهی از یک محصول، یک لیست تغییرات (Changelog) را نقل کند. حتی در ربات‌های اسناد داخلی دیده شده که یک خط‌مشی اتحادیه اروپا (EU) را به دلیل اینکه هر دو تکه متن در پنجرهٔ زمینه (Context Window) کنار هم قرار داشتند، به یک گردش کار در ایالات متحده اعمال می‌کنند.

داده‌های مربوط به شکست مدل‌ها

بر اساس مستندات این پژوهش، نتایج عملکرد مدل‌ها در شرایط خصمانه (Adversarial Conditions) تکان‌دهنده است:

  • ۱۳ مدل مورد آزمایش، نرخ مبنی‌سازی فریبنده بین ۸٪ تا ۸۷٪ را نشان دادند.
  • مدل‌هایی که تحت تنظیم دقیق (Fine-tuning) پزشکی و زیست‌پزشکی قرار گرفته بودند، به نرخ شکست ۸۶.۷٪ رسیدند؛ این ثابت می‌کند که تنظیمات دامنه می‌تواند باعث شود پاسخ‌های غلط با استفاده از واژگان تخصصی، روان‌تر و متقاعدکننده‌تر به نظر برسند.
  • در محیط‌های عملیاتی (Production) که شامل ۷۴۰ جفت دارو-بیماری بود، نرخ خطا ۷.۸٪ ثبت شد.
  • برای داروهای تازه‌تأییدشده، این نرخ به ۱۳.۶٪ افزایش یافت. دلیل این اتفاق آن است که موجودیت‌های جدیدتر شواهد پراکنده‌تری دارند و در نتیجه، احتمال اینکه سیستم بازیابی شواهد مجاور (Adjacent Evidence) را بیرون بکشد، بیشتر می‌شود.

شکاف در متدهای ارزیابی

بسیاری از تیم‌های مهندسی، ارزیابی تولید بازیابی‌افزا (RAG) را به عنوان یک چک‌لیست تک‌مرحله‌ای می‌بینند و کیفیت بازیابی، اعتبار ارجاع، وفاداری پاسخ، انتساب موجودیت و رفتار در مواجهه با عدم پاسخ (Refusal) را در یک امتیاز کلی «مبنی بودن» (Groundedness) ادغام می‌کنند. این رویکرد اگرچه راحت است، اما دقیقاً همان کلاس از باگی را پنهان می‌کند که این مقاله شناسایی کرده است.

این تحقیق استدلال می‌کند که بررسی‌های وفاداری (Faithfulness checks) تنها این سوال را می‌پرسند: «آیا این ادعا توسط یک سند بازیابی شده پشتیبانی می‌شود؟». در مقابل، انتساب موجودیت سوال تکمیلی و گمشده‌ای را می‌پرسد: «آیا آن سند واقعاً درباره همان موجودیتی است که پاسخ ادعا می‌کند؟». انسانی که تنها پاورقی‌ها را سریع مرور می‌کند، احتمالاً متوجه این شکست نمی‌شود، زیرا پاسخ دارای منبع، مسئولانه‌تر از یک پاسخ بدون منبع به نظر می‌رسد.

مکانیسم‌های تایید و اصلاح

نویسندگان برای حل این معضل، یک حلقه تایید (Verification Loop) مشخص را پیشنهاد می‌کنند که پاسخ را مجبور به عبور از «بررسی موجودیت» می‌کند:

۱. استخراج هر ادعای واقع‌بینانه (Factual Claim).
۲. شناسایی منبع ذکر شده برای آن ادعا.
۳. شناسایی موجودیت اصلی درون آن منبع.
۴. مقایسه آن با موضوع (Subject) اصلی پاسخ.
۵. رد کردن پاسخ در صورتی که منبع واقعی باشد اما به موضوع اشتباهی وصل شده باشد.

این روش تایید هدفمند، مبنی‌سازی فریبنده را با دقت (Precision) ۹۷.۰٪ و بازخوانی (Recall) ۹۸.۷٪ نسبت به استانداردهای طلایی انسانی شناسایی کرد. اگرچه این یک تضمین جهانی نیست، اما به‌جای بررسی صرفِ «وجود مدرک»، «رابطه» میان مدرک و موضوع را تست می‌کند.

از منظر اجرایی، این یافته معیار موفقیت RAG را تغییر می‌دهد. این نشان می‌دهد که توانایی سیستم در شناسایی «وضعیت شواهد ناقص» (incomplete-evidence state) — یعنی پذیرفتن اینکه شواهد مجاور را یافته اما نه شواهد دقیق برای پرس‌وجوی کاربر — بسیار ارزشمندتر از یک پاسخ صیقل‌خورده اما نادرست است. مسیرهای رد پاسخ (Refusal paths) و پیام‌هایی که این شکاف را آشکار می‌کنند، شاید برای دموها جذاب نباشند، اما یک سیستم RAG را صادق نگه می‌دارند.

برای مهندسانی که گردش‌های کاری بالینی، حقوقی یا مالی می‌سازند، درس ساده است: اگر ارزیابی شما فقط چک می‌کند که مدل چیزی واقعی را نقل کرده یا نه، شما در واقع «رسید» را چک می‌کنید، نه «خرید» را. قابلیت اطمینان واقعی نیازمند بررسی رابطه مستقیم میان مدرک و موضوع است.

گام بعدی شما

  • ارزیابی‌های فعلی RAG خود را از معیار کلی Groundedness به تفکیک «صحت منبع» و «صحت انتساب» تغییر دهید.
  • در پرامپت‌های سیستمی، مدل را تشویق کنید در صورت عدم یافتن موجودیت دقیق، به جای ارجاع به مفاهیم مشابه، صراحتاً عدم دسترسی به داده را اعلام کند.
  • پیاده‌سازی لایه‌ی Verification Loop برای استخراج موجودیات منبع و مقایسه‌ی آن‌ها با موضوع پاسخ را در خط لوله (Pipeline) تولید قرار دهید.

اما تأثیر این نقص بر مدل‌های استدلالی جدیدتر که زنجیره تفکر را به کار می‌گیرند، ابعادی پیچیده‌تر دارد. این چالش شباهت زیادی به شکست‌های سیستم‌های خوداصلاح‌گر در مدل Kuro دارد، جایی که وعده‌های بازبینی لزوماً به معنای رفع خطاها نیست — در تحلیل بعدی ما درباره‌ی مدل‌های Reasoning این موضوع را بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این یافته با تکیه بر متدولوژی‌های سخت‌گیرانه پژوهشی، اعتبار سیستم‌های RAG را در محیط‌های YMYL (حیات و سلامت) به چالش می‌کشد. شکست در انتساب موجودیت یعنی حتی با وجود دیتابیس‌های صحیح، خروجی مدل می‌تواند منجر به تصمیمات پزشکی یا حقوقی غلط شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که سیستم‌های RAG را برای اسناد اداری یا پزشکی پیاده می‌کنند، این هشدار یعنی تکیه بر معیارهای آماده ارزیابی کافی نیست و باید لایه‌ی تایید موجودیت را به‌صورت دستی اضافه کنند.

·نگاه ما
تحریریه دات‌هوش

این پژوهش نشان می‌دهد که «اعتبار ظاهری» در مدل‌های RAG می‌تواند به یک ابزار گمراه‌کننده تبدیل شود. در واقع، ما با پارادوکسی روبروییم که هرچه مدل در بازیابی منابع دقیق‌تر شود، توهماتش (در صورت وجود) باورپذیرتر و خطرناک‌تر می‌شوند. این یافته، تمرکز صنعت را از «کاهش توهم» به سمت «دقت در انتساب» سوق می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.