پرش به محتوای اصلی
پرش به محتوای مقاله

مدل‌های پیشرو هوش مصنوعی مقالات باطل‌شده را به‌عنوان سند معتبر می‌شناسند

·۱۶ تیر ۱۴۰۵۴ دقیقه مطالعه
مدل‌های برتر هوش مصنوعی مقالات پس‌گرفته‌شده را استناد می‌دهند، بدون اینکه بدانند.
مدل‌های برتر هوش مصنوعی مقالات پس‌گرفته‌شده را استناد می‌دهند، بدون اینکه بدانند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک «شکاف زمانی» ساختاری در مدل‌های پیشرو؛ مدل‌ها در تشخیص ابطال مقالات پس از تاریخ قطع آموزش، نرخ موفقیت صفر درصدی دارند، حتی اگر ارجاع را به‌درستی پیدا کنند.

آیا پیشرفته‌ترین مدل‌های هوش مصنوعی می‌توانند مرز بین یک دستاورد علمی و یک خطای باطل‌شده را تشخیص دهند؟ در مجموعه‌ای از آزمون‌ها که در ۷ جولای ۲۰۲۶ منتشر شد، مدل‌های GPT-5.5، Claude Sonnet 5 و Claude Opus 4.8 همگی با اطمینان کامل از مقاله ADVOCATE درباره داروهای avacopan در درمان vasculitis (التهاب عروق) به‌عنوان یک سند معتبر یاد کردند.

به نقل از گزارش‌های پژوهشی، این مقاله در سال ۲۰۲۶ باطل شده بود، اما مدل‌ها نه تنها مقاله را پیدا کردند و شناسه‌ی دیجیتال (DOI) درست آن را از مجله New England Journal of Medicine ارائه دادند، بلکه هیچ اشاره‌ای به ابطال آن نکردند. این موضوع یک شکست سیستمی در قابلیت اطمینان مدل‌های زبانی بزرگ (LLM) را افشا می‌کند: مدل‌های پیشرو نمی‌توانند تشخیص دهند مقاله‌ای که در داده‌های آموزشی آن‌ها «معتبر» بوده، پس از تاریخ قطع آموزش (Training Cutoff) باطل شده است.

این شکاف به این دلیل است که مدل‌ها به داده‌های آموزشی ایستا تکیه می‌کنند، نه به فهرست‌های زنده و به‌روز. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، افزایش تعداد پارامترها شاید نرخ ساختن DOIهای جعلی را کم کند، اما مشکل «اطلاعات تاریخ‌گذشته» را حل نمی‌کند. این چالش در کنار رشد چشمگیر ارجاعات جعلی در پایگاه‌های داده‌ای مانند PubMed، نگرانی‌ها را درباره‌ی اعتبار منابع تولیدشده توسط AI افزایش داده است. هیچ مقدار افزایش مقیاسی نمی‌تواند به مدل بفهماند مقاله‌ای که دیروز باطل شده است، اکنون دیگر معتبر نیست؛ اگر دانش مدل شش ماه پیش به پایان رسیده باشد، این شکاف را نمی‌توان با مدل بهتر بست، بلکه تنها با یک مکانیزم جست‌وجو (Lookup) می‌توان آن را حل کرد.

سازوکار تأیید اعتبار

برای quantified کردن این مشکل، پژوهشگران ابزاری به‌نام sourcecheck توسعه دادند که یک درگاه نظارتی بازمتن است. بر اساس مستندات این پروژه، sourcecheck به‌جای اینکه از یک مدل دیگر برای تأیید بخواهد، هر ارجاع را مستقیماً با فهرست‌های واقعی تطبیق می‌دهد تا سه مورد خاص را بررسی کند:

  • آیا ارجاع اصلاً وجود دارد؟
  • آیا مقاله باطل شده است؟
  • آیا ادعای خاص مطرح‌شده در متن مقاله به‌صورت تجربی در متن موجود است؟

این محدوده دقت به‌صورت عمدی انتخاب شده است، زیرا این‌ها دقیقاً همان بررسی‌هایی هستند که یک مدل زبانی قادر نیست به‌تنهایی برای خودش انجام دهد. این ابزار ارجاعات را به‌صورت زنده با پایگاه‌های داده OpenAlex، Crossref و Retraction Watch تطبیق می‌دهد. برای کاربرانی که به دنبال روش‌های سریع‌تر هستند، راهنمای شناسایی ارجاعات جعلی می‌تواند کمک‌کننده باشد تا متون تولیدشده را به‌سرعت ممیزی کنند.

شکاف تشخیص و نرخ توهم

برای تست این شکست، ۱۲ مدل پیشرو و تجاری (Production Models) با سؤالات علمی به چالش کشیده شدند. پژوهشگر سؤالات مربوط به ابطال مقالات را به دو دسته متمایز تقسیم کرد:

  • ابطال‌های قدیمی و مشهور: این موارد شامل پرونده‌های پرسر و صدایی مانند مقالات سلول‌های بنیادی STAP و مطالعه Surgisphere درباره هیدروکسی کلروکین است. چون این حوادث پیش از تاریخ آموزش همه‌ی مدل‌ها رخ داده بود، مدل‌ها در حدود ۸۲٪ موارد توانستند ابطال‌ها را به‌درستی علامت‌گذاری کنند.
  • ابطال‌های پس از تاریخ قطع: این دسته شامل مقالات معتبری است که در سال‌های ۲۰۲۵ و ۲۰۲۶ باطل شده‌اند. نرخ تشخیص مدل‌ها در این دسته ۰٪ بود. حتی یک مورد تشخیص درست وجود نداشت و در عوض، تمامی این مقالات به‌عنوان منابع معتبر ذکر شدند. ۶ مورد از این شکست‌ها مربوط به مدل‌های تراز اول (Top-tier) بود.
  • نرخ ساختگی (Fabrication): در مورد مقالات کلاسیک و شناخته‌شده، مدل‌های برتر تقریباً هیچ DOI جعلی نمی‌سازند. اما در سؤالات مربوط به یافته‌های سال ۲۰۲۵، نرخ ساختگی تقریباً دو برابر شد. حتی یک مدل کوچک قدیمی که هنوز به‌طور گسترده در بازار توزیع شده است، نزدیک به نیمی از DOIهای خود را به‌صورت جعلی ساخته بود.

علاوه بر این، پژوهش‌ها نشان داد که سیستم‌های تجاری در محیط عملیاتی، اغلب از مدل‌های میان‌رده به‌جای نسخه‌های پرچم‌دار استفاده می‌کنند. طبق داده‌های ارائه شده در وب‌سایت mikias.io/citations، در این مدل‌های میان‌رده، نرخ ساختگی DOI همچنان در اعداد دو رقمی باقی مانده است.

این وضعیت یک نقطه کور بحرانی برای هر سازمان یا نهادی است که از هوش مصنوعی برای سنتز داده‌های پزشکی، حقوقی یا علمی استفاده می‌کند. این شکست یک توهم (Hallucination) سنتی نیست—زیرا مدل‌ها مقالات واقعی با DOIهای درست را می‌آورند—بلکه شکست در «آگاهی زمانی» (Temporal Awareness) است. مدل پاسخ «درست» بر اساس داده‌های آموزشی‌اش را می‌دهد، اما پاسخ «غلط» بر اساس واقعیت جاری.

برای توسعه‌دهندگان، این شواهد ضرورت ایجاد یک لایه تأیید (Verification Layer) را ثابت می‌کند. تنها راه بستن شکاف بین وزن‌های داخلی مدل و اجماع علمی جاری، اتصال به یک فهرست زنده است. این حالت شکست (Failure Mode) به‌ندرت در دموهای تبلیغاتی دیده می‌شود—جایی که کاربران سؤالاتی می‌پرسند که مدل از قبل می‌داند—اما در محیط عملیاتی (Production) به‌شدت تکرار می‌شود.

کسانی که ابزارهای هوش مصنوعی صنعتی می‌سازند، اکنون می‌توانند این نقاط شکست را با کتابخانه sourcecheck در گیت‌هاب (github.com/aberaio/sourcecheck) ممیزی کنند. هر بار اجرا، یک گزارش کامل از ارجاعات (Per-citation audit) ارائه می‌دهد که دارای یک محیط تعاملی (Playground) است؛ در این محیط، DOIهایی که به هیچ‌جا ختم نمی‌شوند خط زده شده و مقالاتی که باطل شده‌اند با پرچم نارنجی مشخص می‌شوند.

گام بعدی شما

  • اگر از AI برای استخراج منابع علمی استفاده می‌کنید، هرگز بدون چک کردن DOI در Retraction Watch به پاسخ‌ها اعتماد نکنید.
  • برای توسعه‌دهندگان: لایه RAG خود را با یک API کنترل ابطال مقالات تجهیز کنید تا از توزیع اطلاعات غلط جلوگیری شود.
  • کتابخانه sourcecheck را روی جریان‌های کاری خود تست کنید تا نرخ خطای ارجاعات سیستم‌تان را بسنجید.

اما تأثیر این نقص بر تصمیم‌گیری‌های پزشکی در مقیاس کلان حتی نگران‌کننده‌تر است؛ در تحلیل ما درباره‌ی ریسک‌های استدلال در مدل‌های تخصصی بخوانید.

چرا این موضوع مهم است؟

این موضوع اعتبار مدل‌های هوش مصنوعی را در حوزه‌های پزشکی و حقوقی زیر سؤال می‌برد. تکیه بر تخصصِ صرفاً آماری مدل‌ها بدون اتصال به منابع زنده، می‌تواند منجر به تصمیمات حیاتی بر اساس مقالاتی شود که جامعه علمی آن‌ها را رد کرده است.

تأثیر برای ایران

این موضوع برای پژوهشگران و دانشجویان ایرانی که برای تحلیل متون علمی به LLMها تکیه می‌کنند حیاتی است؛ چراکه ابزارهای رایگان اغلب از مدل‌های میان‌رده با نرخ خطای ارجاع بالاتر استفاده می‌کنند.

·نگاه ما
تحریریه دات‌هوش

وابستگی مدل‌ها به داده‌های ایستا نشان می‌دهد که حتی با رسیدن به استدلال‌های پیچیده، مدل‌ها همچنان در برابر «پویایی حقیقت» ناتوان‌اند. این یافته ثابت می‌کند که هرگونه استقرار مدل زبانی در حوزه‌های حساس (High-stakes) بدون لایه‌ی Grounding زنده، نه تنها ریسک توهم، بلکه ریسک ترویج آگاهانه‌ی خطاهای علمی را دارد. در واقع، دقت مدل در بازیابی DOI را نباید با صحت علمی محتوا اشتباه گرفت.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.