پرش به محتوای اصلی
پرش به محتوای مقاله

چرا بازیابی دقیق اسناد تضمینی برای توقف توهمات هوش مصنوعی نیست؟

·۲۲ خرداد ۱۴۰۵۱۲ دقیقه مطالعه۳ بازدید
راهنما
سری تست RAG — قسمت ۳: تشخیص وفاداری و توهم
سری تست RAG — قسمت ۳: تشخیص وفاداری و توهم
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر تمرکز از بهینه‌سازی لایه‌ی بازیابی به اندازه‌گیری کمی لایه‌ی تولید پاسخ؛ معرفی متدولوژی خرد کردن پاسخ به ادعاهای مجزا برای سنجش ریاضی وفاداری متن.

اگر همین امروز یک سیستم تولید بازیابی‌افزا (RAG) — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — را مستقر کنید، باید بدانید که بازیابی دقیق اسناد، جلوی دروغ‌های هوش مصنوعی را نمی‌گیرد.

طبق گزارش فیزال شیخ، مهندس ارشد اتوماسیون، در ۱۱ ژوئن ۲۰۲۶، لایه‌ی تولید پاسخ است که خطرناک‌ترین توهمات (Hallucinations) — یعنی وقتی مدل با اطمینان چیزی می‌گوید که اصلاً وجود ندارد، شبیه دوستی که خاطره‌ای را اشتباه تعریف می‌کند — در آنجا شکل می‌گیرند، نه در لایه‌ی بازیابی.

بیشتر توسعه‌دهندگان روی یافتن سند درست تمرکز می‌کنند. اما مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — ممکن است متن را نادیده بگیرد یا واقعیت‌های جدیدی ابداع کند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، این شکاف باعث می‌شود سیستم در گزارش‌ها سالم به نظر برسد، اما در محیط عملیاتی شکست بخورد.

برای حل این مشکل، چارچوب RAGAS از رویکرد «مدل به‌عنوان داور» با استفاده از مدل‌هایی مثل GPT-4o-mini بهره می‌برد. این سیستم معیار وفاداری (Faithfulness) را محاسبه می‌کند. روش کار ساده است: پاسخ را به تک‌تک ادعاها خرد می‌کند و از مدل داور می‌پرسد: «آیا این ادعا در متن بازیابی‌شده وجود دارد یا خیر؟»

سری تست‌های مبتنی بر RAG — بخش ۳: وفاداری و تشخیص توهم

در این تحلیل، دو نوع شکست شناسایی شده است:

  • توهم ذاتی: مدل مستقیماً با متن موجود در سند مخالفت می‌کند.
  • توهم خارجی: مدل اطلاعاتی اضافه می‌کند که در منبع نیست و قابل تایید نیست.

برای تأیید نهایی در خط لوله تولید، امتیاز وفاداری کمتر از ۰.۸ هشدار ایجاد می‌کند و امتیاز کمتر از ۰.۳ یک « fabricate » یا جعل بحرانی تلقی می‌شود.

این تغییر یعنی مهندسان باید به جای تکیه بر مجموعه‌داده‌های مرجع (Ground Truth) که اغلب در دسترس نیستند، به مدل‌های «مبنی‌سازی شده» رویای‌پردازی‌های مدل را بگیرند.

گام بعدی شما

  • چارچوب RAGAS را در CI/CD خط لوله تولید خود تست کنید تا «بیش‌برآورد‌های مطمئن» را شناسایی کنید.
  • تمرکز تست‌های خود را از تطبیق کلمات کلیدی به دقت معنایی منتقل کنید.
  • استراتژی‌های تست برای حالت‌هایی که هیچ سند مرتبطی بازیابی نمی‌شود را بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار مدل‌های پیشرفته برای نظارت بر مدل‌های کوچک‌تر، امکان استقرار ایمن AI را در حوزه‌های حساس فراهم می‌کند. بدون معیار وفاداری، اعتماد کاربران به سیستم‌های RAG در محیط عملیاتی هرگز کامل نخواهد شد.

تأثیر برای ایران

توسعه‌دهندگان ایرانی می‌توانند با استفاده از این چارچوب متن‌باز، بدون نیاز به صرف هزینه‌ی بالای تولید مجموعه‌داده‌های مرجع دستی، کیفیت بات‌های سازمانی خود را ارزیابی کنند.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که صنعت از دوران «امید به دقت» به دوران «سنجش ریاضی دقت» وارد شده است. جایگزینی مجموعه‌داده‌های دستی با مدل‌های داور (LLM-as-judge)، سرعت تکرار و تست در محیط‌های عملیاتی را به‌طور چشم‌گیری افزایش می‌دهد، هرچند که ریسک توهمِ خودِ مدلِ داور همچنان یک چالش حل‌نشده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.