تصور کنید یک پزشک بر اساس تشخیص هوش مصنوعی، درمان یک بیمار را تغییر دهد، اما مدل در واقع به جای بیماری، برند دستگاه رادیولوژی را شناسایی کرده باشد. این کابوس، دلیل اصلی شکست مدلهای پزشکی در لحظه خروج از آزمایشگاه و ورود به کلینیکهای واقعی است.
به نقل از دانشگاه بریستول (University of Bristol)، در ۲۱ سپتامبر ۲۰۲۶ چارچوبی معرفی شد که مدلهای هوش مصنوعی را مانند داروهای شیمیایی میبیند؛ یعنی پیش از هرگونه استفاده روی بیمار، باید یک «بسته اطلاعاتی» ساختاریافته ارائه دهند. همانطور که در تحلیلهای قبلی ما دربارهی سوگیری دادهها اشاره کردیم، مدلهای زبانی و تشخیصی اغلب در محیطهای کنترلشده میدرخشند اما در دنیای واقعی فرو میپاشند. این چالشها در حالی رخ میدهد که پیشبینیهایی مبنی بر پیشی گرفتن هوش مصنوعی از پزشکان در ۵ وظیفه کلیدی پزشکی تا سال ۲۰۳۰ وجود دارد که ضرورت استانداردهای سختگیرانه را دوچندان میکند.
بسیاری از این سامانهها در تستهای اولیه موفق به نظر میرسند، اما در عمل شکست میخورند چون به جای شناسایی آسیبهای واقعی، «میانبرهایی» در دادههای آموزشی پیدا میکنند. این وضعیت شبیه به مدیریت داروهایی است که مکانیسم بیولوژیکی آنها کاملاً شناخته شده نیست؛ صنعت دارو برای استفاده از یک ترکیب، نیازی ندارد هر تعامل مولکولی را بفهمد، به شرطی که پروتکلهای سختگیرانهای برای دوز، زمانبندی و گروههای بیمار داشته باشد. در همین راستا، بحث بر سر کیفیت دادههای آموزشی شدت یافته است، بهویژه پس از افشای طرحهای جنجالی برای تبدیل پروندههای محرمانه شرکتهای ورشکسته به دادههای آموزشی که ابهامات اخلاقی جدیدی را ایجاد کرد.
ابزار پیشنهادی با نام «مجموعه یادگیری» (Learning Ensemble)، توسعهدهندگان را موظف میکند سه حوزه حیاتی را مستند کنند:
۱. محدودیتهای سیستم
توسعهدهندگان باید سختافزار هدف، کلینیکهای مورد نظر و ماهیت دقیق دادههای آموزشی را مشخص کنند. طبق گزارش یک مطالعه در سال ۲۰۲۱، هوش مصنوعی تشخیص کووید-۱۹ در کلینیکهای جدید شکست خورد، چون به جای بیماری ریه، جزئیات تصادفی تصاویر را یاد گرفته بود.
۲. قابلیت اطمینان جمعیتشناختی
صحت (Accuracy) — که مثل نمره کل یک امتحان است و لزوماً ضعفهای تکتک درسها را نشان نمیدهد — معیاری فریبنده است. این چارچوب، اثبات کارایی مدل روی گروههای متنوع بیماران را میطلبد. این اقدام پس از یافتههای سال ۲۰۲۱ صورت گرفت که نشان داد مدلهای رادیولوژی برای جمعیتهای محروم، دقت بسیار کمتری دارند.
۳. هدف بالینی
موفقیت فنی لزوماً به معنای کاربرد بالینی نیست. برای مثال، یک مدل بیماران آسمی مبتلا به پنومونی را «کمخطر» ارزیابی کرد، چون در دادههای آموزشی نرخ بقای آنها بیشتر بود؛ دلیلش هم ساده بود: بخشهای اورژانس با این بیماران تهاجمیتر برخورد میکنند. چنین نتیجهای برای اولویتبندی بیماران (Triage) کاملاً بیفایده است.
این چرخش راهبردی، صنعت را از خوشبینی به «جعبههای سیاه» دور کرده و به سمت فرهنگ تأیید سیستماتیک میبرد. با اجبار توسعهدهندگان به استفاده از زبان مشترکی برای بیان محدودیتها، میتوان از فجایع پزشکی پیش از رسیدن به بالین بیمار جلوگیری کرد.
گام بعدی شما
- اگر توسعهدهنده ابزارهای سلامت هستید، مستندات مدل خود را با متدولوژی «بسته اطلاعاتی» بازبینی کنید.
- دستورالعملهای آتی FDA یا EMA را برای پذیرش استانداردهای نرمافزاری به عنوان تجهیزات پزشکی دنبال کنید.
- در ارزیابی مدلها، به جای تکیه بر صحت کلی، روی تحلیل خطا در گروههای خاص تمرکز کنید.
اما این استانداردها تنها بخشی از ماجراست؛ چالشهای سختافزاری برای اجرای این مدلهای سنگین در کلینیکهای کوچک را در گزارش بعدی بررسی خواهیم کرد.




گفتگو