پرش به محتوای اصلی
پرش به محتوای مقاله

PhantomBench: نرخ توهم ۸۶.۷ درصدی مدل‌های زبانی در مواجهه با مفاهیم ناموجود

·۲۱ خرداد ۱۴۰۵۱ دقیقه مطالعه
PhantomBench: نرخ توهم ۸۶.۷ درصدی مدل‌های زبانی در مواجهه با مفاهیم ناموجود
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نکته‌ی کلیدی و جدید این پژوهش، شناسایی اثر «پیش‌فرض وجود» در پرامپت‌ها است؛ یعنی صرفاً با تغییر لحن سؤال از «آیا X وجود دارد؟» به «X چیست؟»، نرخ توهم به شکل چشمگیری افزایش می‌یابد.

اگر تصور می‌کنید مدل‌های زبانی پیشرو می‌دانند چه زمانی باید سکوت کنند، سخت در اشتباهید. طبق یافته‌های جدید، این مدل‌ها حتی در ساده‌ترین آزمون‌های فروتنی — یعنی تشخیص اینکه چه چیزی را نمی‌دانند — شکست می‌خورند.

این آسیب‌پذیری در استقرار مدل‌ها در محیط‌های حساس، جایی که تکیه کورکورانه به هوش مصنوعی زاینده (Generative AI) می‌تواند منجر به خسارات جدی شود، حیاتی است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مبانی‌سازی (Grounding) مدل‌های زبانی اشاره کردیم، مشکل توهمات صرفاً یک خطای تصادفی نیست، بلکه ریشه در توزیع داده‌ها و ساختار آموزش دارد.

به نقل از پژوهشی که در ۱۰ ژوئن ۲۰۲۶ در arxiv.org منتشر شد، مدل‌های زبانی در مواجهه با مفاهیم ناموجود، نرخ توهمی تا ۸۶.۷٪ را تجربه می‌کنند. پژوهشگران برای اثبات این ادعا، PhantomBench را معرفی کردند؛ مجموعه‌داده‌ای شامل بیش از ۶۰,۰۰۰ اصطلاح و موجودیت ساختگی که از مفاهیم دنیای واقعی مشتق شده‌اند. در بررسی ۲۱ مدل با اندازه‌های مختلف، نتایج تکان‌دهنده‌ای به دست آمد:

  • ناتوانی گسترده در خودداری از پاسخ‌دهی هنگام مواجهه با موجودیت‌های ناموجود.
  • افزایش شدید توهمات زمانی که متن پرامپت، پیش‌فرض می‌گیرد مفهوم مورد نظر وجود دارد.
  • تکرار این نرخ شکست در هر دو دسته مدل‌های کوچک و مدل‌های کلاس پیشرو (Frontier-class).

برای جامعه‌ی فنی، این نتایج هدف بنچمارک‌ها را تغییر می‌دهد؛ به جای تلاش برای بهبود دقت واقعیات، باید بر «منطق خودداری» (Abstention Logic) تمرکز کرد. به نظر ما، تکنیک‌های فعلی همراستاسازی (Alignment) احتمالاً مدل‌ها را بیش از حد به «سودمند بودن» عادت داده‌اند و در نتیجه، مدل به جای پذیرش جهل، برای حدس زدن پاداش می‌گیرد.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، از خط‌لوله PhantomBench برای ایجاد مجموعه‌های تست اختصاصی در دامنه (Domain) کاری خود استفاده کنید.
  • استراتژی‌های اعتبارسنجی خروجی را از «تأیید صحت» به «آزمون وجود» تغییر دهید.
  • نتایج این مطالعه را با مدل‌های استدلالی جدید مقایسه کنید تا ببینید آیا زنجیره تفکر (Chain-of-Thought) نرخ توهم را کاهش می‌دهد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر اعتبار داده‌های PhantomBench، ثابت می‌کند که مدل‌های فعلی فاقد «آگاهی از جهل» هستند. این موضوع اعتبار استقرار هوش مصنوعی در حوزه‌های حساس مانند پزشکی و حقوق را به شدت زیر سؤال می‌برد.

تأثیر برای ایران

این پژوهش برای توسعه‌دهندگان ایرانی که در حال ساخت مدل‌های تخصصی در حوزه‌های حساس هستند، هشداردهنده است؛ چرا که تکیه بر مدل‌های پیشرو بدون لایه‌ی اعتبارسنجی برای مفاهیم ناموجود، ریسک توهمات خطرناک را افزایش می‌دهد.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که ما با یک تضاد بنیادین در آموزش مدل‌ها روبرو هستیم: تقابل بین «سودمندی» (Helpfulness) و «صداقت» (Honesty). تا زمانی که پاداش‌های RLHF مدل را مجبور کند پاسخی تولید کند، توهمات در مواجهه با پرسش‌های القایی (Leading Questions) حذف نخواهند شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.