تصور کنید پزشکی با تجربه در برابر یک مدل هوش مصنوعی قرار بگیرد و در تشخیص یک بیماری نادر، مدل با اختلاف فاحشی پیروز شود. این رویای قدیمی اکنون به واقعیت تبدیل شده، اما با یک هشدار مرگبار: هوش مصنوعی در محیط آزمایشگاه نابغه است، اما در محیط کلینیک میتواند فاجعهبار باشد.
طبق گزارشهای منتشر شده از یک آزمایش در سال ۲۰۲۶ در پاکستان، GPT-4o به تنهایی به امتیاز ۸۲.۹٪ در استدلال تشخیصی رسید؛ عددی که در برابر امتیاز ۷۱.۴٪ پزشکانی که از این ابزار استفاده میکردند، بسیار چشمگیر است. این شکاف ثابت میکند که دیگر «هوش خام» گلوگاه پیشرفت هوش مصنوعی در پزشکی نیست، بلکه خطر واقعی در نقطه اتصال مدل و پزشک نهفته است.
سالهاست جامعه پزشکی به هوش مصنوعی به چشم ابزاری برای ترکیب تاریخچه پیچیده بیمار و یافتههای آزمایشگاهی نگاه میکند. فرض بر این بود که یک مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — میتواند ساعتها تحقیق دستی را جایگزین کند. پیش از این، بررسی یک پرونده پیچیده ممکن بود سه ساعت زمان ببرد تا پزشک تصمیم بگیرد چه چیزی اهمیت دارد و در مرحله بعد چه اتفاقی باید بیفتد. اما به گزارش unite.ai، تبدیل یک چتبات به یک سامانه بالینی در حال شکست است، چون بخش سخت ماجرا هوش مدل نیست، بلکه کاربرد آن است.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، فاصله میان توانایی تئوریک و اجرای عملی همیشه یک حفره امنیتی یا عملیاتی ایجاد میکند.
هزینه پیادهسازی
ساخت یک سامانه بالینی قابلاعتماد بسیار دشوارتر از استقرار یک هوش مصنوعی عمومی است. در یک پروژه توسعه، مهندسان نرمافزار در کنار تیمی ۱۰ نفره از پزشکان کار کردند. با وجود هوش بالای مدل، این پروژه به حدود یک سال زمان و یک میلیون دلار سرمایهگذاری نیاز داشت و با این حال، همچنان در مرحله ساخت و توسعه قرار داشت. چالش اصلی، ظرفیت مدل نبود، بلکه نحوه بهکارگیری عملیاتی این هوش در یک محیط واقعی پزشکی بود.
پارادوکس مهندسی پرامپت
بسیاری از ارائهدهندگان خدمات بهداشتی تصور میکنند راه حل در مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که میداند چطور از یک مشاور باتجربه بهترین جواب را بگیرد — است. آنها فکر میکنند اگر پزشک تبدیل به یک اپراتور حرفهای AI شود، سامانه قابلاعتماد میشود. در واقع، اجبار پزشک به ایفای نقش یک توسعهدهنده آماتور، یک شکست سیستمی در تکنولوژی است، نه کمبود آموزش. این موضوع یادآور چالشهای مشابه در دنیای برنامهنویسی است، جایی که اتکای بیش از حد به دستیارهای هوش مصنوعی بدون نظارت مهندسی دقیق میتواند منجر به خطاهای سیستمی بحرانی شود.
تفاوت عملکردی شدیدی در نحوه تعامل کاربران با هوش مصنوعی وجود دارد. یک کاربر حرفهای (Power User) فقط سؤال نمیپرسد؛ او با مدل بحث میکند، پیشفرضهایش را به چالش میکشد، زمینههای فراموششده را به مدل یادآوری میکند و چارچوب بحث را تغییر میدهد. این روش برای نوشتن یک متن تبلیغاتی یک پیروزی در بهرهوری است، اما وقتی موضوع یک بیمار باشد، تبدیل به یک متغیر خطرناک میشود. در میان بیش از ۷۰ هزار متخصص، بسیاری از نظر بالینی نابغه هستند اما در استخراج اطلاعات مفید از یک سامانه AI ضعیف عمل میکنند. این دو، مهارتهای کاملاً متفاوتی هستند.
شکاف عملکردی
دادههای حاصل از چندین آزمایش، الگوی تکرارشوندهای را نشان میدهد که در آن هوش مصنوعی از تیم «انسان + AI» باهوشتر است:
- آزمون تصادفی ۲۰۲۴: ۵۰ پزشک با پروندههای تشخیصی دشوار روبرو شدند. کسانی که از GPT-4 استفاده کردند ۷۶٪ و کسانی که از منابع سنتی استفاده کردند ۷۴٪ امتیاز گرفتند؛ تفاوتی که از نظر آماری معنادار نبود. اما GPT-4 وقتی به تنهایی کار کرد، ۱۶ درصد از گروه سنتی پیشی گرفت.
- تکرار آزمایش در بریتانیا (۲۰۲۶): این مطالعه شکاف مشابهی را یافت. پزشکان با کمک AI پیشرفت کردند اما همچنان بیش از ۲۱ درصد پایینتر از مدل زبانی بزرگی بودند که به طور مستقل عمل میکرد.
- مطالعه پاکستان (۲۰۲۶): همانطور که ذکر شد، GPT-4o امتیاز ۸۲.۹٪ را در برابر ۷۱.۴٪ پزشکان آموزشدیدهای به دست آورد که آموزشهای خاصی را دیده بودند.
این نتایج نشان میدهد در برخی وظایف شناختی، AI همین حالا از یک پزشک فردی بهتر است. هیچ انسانی نمیتواند تمام اختلالات نادر، تداخلات دارویی یا مقالات پزشکی را در لحظهای که مرتبط میشوند به یاد آورد، اما AI این اطلاعات را بدون خستگی پردازش میکند.
خطر «جعبه پرامپت خالی»
مدلهای زبانی عمومی، تحلیلگرهای قطعی (Deterministic Parsers) نیستند. وقتی پزشک گزارشی با ۱۵۰ شاخص را آپلود میکند، مدل ممکن است خروجی را به زیبایی سازماندهی کند اما در سکوت، ۵۰ مقدار حیاتی را نادیده بگیرد. چون سامانه اعلام نمیکند چه چیزی را از قلم انداخته، یک مقدار گمشده که نیاز به ارزیابی فوری دارد، تبدیل به یک نقطه کور مرگبار میشود.
سیستمی که اعتراف کند چیزی را نمیداند، فقط «ناکارآمد» است؛ اما سیستمی که نداند چه چیزی را گم کرده، «خطرناک» است. برای حل این مشکل، توسعهدهندگان باید فراتر از LLM بروند. کار بالینی به بازتولیدپذیری و منطق قطعی نیاز دارد؛ قوانینی که به اندازه کافی صریح باشند تا نرمافزار بتواند آنها را اجرا کند.
مهندسی در برابر واقعیت بالینی
ساخت این سامانهها باعث تلاقی دو زبان متفاوت میشود. مهندسان به قوانین صریح نیاز دارند، در حالی که پزشکان در دنیای «بله، مگر در مورد...» زندگی میکنند. بیولوژی انسان با استثنائات، اصلاحکنندهها و توضیحات متضاد تعریف میشود. گاهی همکاری این دو گروه شبیه این است که یکی با زبان اشاره حرف بزند و دیگری به زبان Klingon.
برای پیشرفت، سامانهها باید این موارد را داشته باشند:
- استخراج دادههای قابلاعتماد برای مدیریت دقیق گزارشهای متراکم پزشکی.
- دانش ساختاریافته و کنترلهای قطعی.
- حفاظهایی که بتوانند روابط را در کل تاریخچه یک بیمار ارزیابی کنند.
- توانایی تشخیص زمانی که پنج یافته بهتنهایی معمولی، در کنار هم اهمیت حیاتی پیدا میکنند.
پزشک سایبورگ
هوش مصنوعی میتواند پرونده را بخواند، اما انسان باید «اتاق را بخواند». پزشک متوجه لرزش صدای بیمار یا تغییر روایت او در میان جمله میشود. او میداند وقتی بیماری که عادت دارد علائمش را کوچک جلوه دهد میگوید «حالم خوب است»، در واقع منظورش این نیست. این تعامل انسانی یک لایه تزئینی نیست، بلکه منبع اصلی دادههای بالینی است که هرگز وارد پرونده دیجیتال نمیشود.
آینده پزشکی جایگزینی پزشک با چتبات نیست، بلکه خلق «پزشک سایبورگ» است. سامانهای که حافظه و تشخیص الگوی ماشین را با قضاوت و تردید انسان ترکیب کند.
این تغییر یعنی ارزشمندترین نوآوری دیگر خودِ مدل بنیادی نیست. برد واقعی در اطراف مدل اتفاق میافتد: اینکه دادهها چگونه تأیید شوند، چه دانشی تغذیه شود، سامانه اجازه استنباط چه چیزهایی را داشته باشد و انسان در کجای چرخه باقی بماند.
باید از پرسیدن این سؤال که آیا AI جایگزین پزشکان میشود دست برداریم. رقابت حافظه تمام شده است. هدف اکنون ساخت سامانههایی است که پیچیدگی در دل تکنولوژی باشد، نه در پرامپت پزشک.
گام بعدی شما
- اگر در حوزه سلامت فعال هستید، به جای تمرکز بر مهندسی پرامپت، روی ابزارهای استخراج داده قطعی (Deterministic Extraction) سرمایهگذاری کنید.
- در ارزیابی ابزارهای AI پزشکی، نرخ «دادههای نادیده گرفته شده» را به جای «صحت کلی» معیار قرار دهید.
- برای کاهش خطای انسانی، مدلهای استدلالی را به عنوان لایه دوم بررسی (Double-check) به کار ببرید، نه به عنوان تصمیمگیرنده اول.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو