پرش به محتوای اصلی
پرش به محتوای مقاله

MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی

·۱۹ خرداد ۱۴۰۵۲ دقیقه مطالعه
MedSci Skills: شناسایی ۱۰۰٪ خطاهای پزشکی با جایگزینی LLM با گیت‌های قطعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی کامل مکانیسم Self-Critique (که خود مبتنی بر احتمال بود) با یک سیستم چندلایه از گیت‌های قطعی (Deterministic) که منجر به شناسایی ۱۰۰ درصدی خطاهای تزریق‌شده در متون پزشکی شد.

اعتماد به توانایی مدل‌های زبانی در بازبینی متون پزشکی، یک قمار خطرناک است؛ زیرا فصاحت زبانی این مدل‌ها دقیقاً همان چیزی است که توهمات مرگبار را می‌پوشاند.

به نقل از گزارش منتشرشده در ۹ ژوئن ۲۰۲۶، معماری MedSci Skills با هدف حذف توهمات بالینی (Clinical Hallucinations) معرفی شده است. این سیستم به جای تکیه بر احتمال، از یک رویکرد «قطعیت در هر جای ممکن» برای تأیید متون علمی استفاده می‌کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی چارچوب CAHL و بهینه‌سازی شکاف میان برنامه‌ریز و اجراکننده اشاره کردیم، مشکل اساسی در گزارش‌های پزشکی، «شکاف تأیید» است. در محیط‌های حساس، تکیه بر یک مدل زبانی برای نقد خروجی‌های خودش ناکافزاری است، زیرا نقاط کور مدل در همان توهمات با اعتمادبه‌نفس او نهفته است.

طبق مستندات این پروژه، سیستم از یک هماهنگ‌کننده (Orchestrator) برای مدیریت ۴۳ مهارت تخصصی استفاده می‌کند. هسته این نوآوری، تاکسونومی گیت‌های یکپارچگی (Integrity Gates) است که ارزان‌ترین و قابل‌اعتمادترین بررسی‌ها را در اولویت قرار می‌دهد:

  • لایه قطعی (Deterministic Tier): شامل ۲۱ آشکارساز کتابخانه‌ای که با استفاده از بررسی‌های تکرارپذیر (مانند هشِ محتوا) واقعیات را تأیید می‌کنند.
  • لایه متنی (Prose Tier): پروب‌های مبتنی بر مدل زبانی بزرگ (LLM) که تنها زمانی به کار می‌روند که تفسیر انسانی اجتناب‌ناپذیر باشد.
  • توقف در صورت شکست (Halt-on-Failure): مکانیزم سخت‌گیرانه‌ای که در صورت شکست هر یک از بررسی‌های یکپارچگی، کل گردش کار را متوقف می‌کند.

بر اساس بررسی‌های انجام‌شده روی خط لوله‌های STARD، PRISMA و STROBE، گیت‌های قطعی توانستند ۲۷ مورد از ۲۷ خطای تزریق‌شده را بدون هیچ‌گونه مثبت‌کاذب (False Positive) شناسایی کنند. در مقابل، یک بازبین LLM تک-پرامپت تنها ۱۱ مورد از این خطاها را یافت و عمدتاً در شناسایی خطاهای کتابشناختی و نقص‌های کد تولیدشده شکست خورد.

این چرخش از «مدل-به‌عنوان-داور» به «کد-به‌عنوان-داور»، فرض بنیادین حسابرسی هوش مصنوعی در علم را تغییر می‌دهد. این معماری با ایجاد یک ردپای قابل‌حسابرسی و تکرارپذیر، شواهدی را فراهم می‌کند که انسان‌ها برای تأیید بازتولیدپذیری یک مقاله به آن نیاز دارند، به جای آنکه صرفاً به ادعای کیفیت یک مدل اعتماد کنند.

گام بعدی شما

  • بررسی آرشیو MedSci Skills (v3.8.0) که تحت مجوز MIT منتشر شده تا گیت‌های قطعی را در خط لوله‌های پیش‌نویس علمی پیاده‌سازی کنید.
  • جایگزینی مراحل خود-ارزیابی (Self-critique) در سیستم‌های RAG پزشکی با لایه‌های تأیید کد-محور.
  • تحلیل اثر توقف‌های سخت‌گیرانه (Halt-on-Failure) بر نرخ پذیرش متون در محیط‌های عملیاتی.

اما این رویکرد در مواجهه با داده‌های غیرساختاریافته چه چالشی دارد؟ تحلیل ما از محدودیت‌های لایه‌های قطعی را در گزارش بعدی بخوانید.

چرا این موضوع مهم است؟

این رویکرد با تکیه بر اعتبار (Authority) متدهای بازرسی کد، مدل‌های زبانی را از مقام «قاضی» به مقام «نویسنده» تنزل داده و نظارت نهایی را به دست الگوریتم‌های قطعی می‌سپارد. این تغییر، اعتماد (Trust) به مقالات تولیدشده توسط هوش مصنوعی را از سطح «احتمال» به سطح «اثبات» ارتقا می‌دهد.

تأثیر برای ایران

این معماری به دلیل مجوز MIT، برای پژوهشگران هوش مصنوعی در ایران در دسترس است و می‌تواند استانداردهای بازبینی مقالات پزشکی در دانشگاه‌های داخلی را ارتقا دهد.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که MedSci Skills در واقع «توجیه ریاضی» تخصص را جایگزین «تخمینی زبانی» می‌کند. این خبر این فرض را در میدان می‌شکند که برای افزایش دقت، تنها راه، بزرگ‌تر کردن مدل یا مهندسی پرامپت است؛ در حالی که راهکار واقعی، بازگشت به سیستم‌های قاعده‌مند (Rule-based) در لایه‌های حساس است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.