پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف ۱۱ درصدی دقت GPT-4o در برابر پزشکان در تشخیص‌های پزشکی

·۱۳ مهر ۱۴۰۵۵ دقیقه مطالعه
تحلیل
هوش مصنوعی از پزشک شما باهوش‌تر است. بخش ترسناک این نیست.
هوش مصنوعی از پزشک شما باهوش‌تر است. بخش ترسناک این نیست.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

کشف یک پدیده متناقض: مدل‌های زبانی در تشخیص‌های پزشکی به تنهایی دقیق‌تر از پزشکانی هستند که از همان مدل‌ها کمک می‌گیرند؛ این یعنی رابط کاربری فعلی (Chat) مانع بهره‌وری متخصص است.

تصور کنید پزشکی با تجربه در برابر یک مدل هوش مصنوعی قرار بگیرد و در تشخیص یک بیماری نادر، مدل با اختلاف فاحشی پیروز شود. این رویای قدیمی اکنون به واقعیت تبدیل شده، اما با یک هشدار مرگبار: هوش مصنوعی در محیط آزمایشگاه نابغه است، اما در محیط کلینیک می‌تواند فاجعه‌بار باشد.

طبق گزارش‌های منتشر شده از یک آزمایش در سال ۲۰۲۶ در پاکستان، GPT-4o به تنهایی به امتیاز ۸۲.۹٪ در استدلال تشخیصی رسید؛ عددی که در برابر امتیاز ۷۱.۴٪ پزشکانی که از این ابزار استفاده می‌کردند، بسیار چشمگیر است. این شکاف ثابت می‌کند که دیگر «هوش خام» گلوگاه پیشرفت هوش مصنوعی در پزشکی نیست، بلکه خطر واقعی در نقطه اتصال مدل و پزشک نهفته است.

سال‌هاست جامعه پزشکی به هوش مصنوعی به چشم ابزاری برای ترکیب تاریخچه پیچیده بیمار و یافته‌های آزمایشگاهی نگاه می‌کند. فرض بر این بود که یک مدل زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیارد‌ها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — می‌تواند ساعت‌ها تحقیق دستی را جایگزین کند. پیش از این، بررسی یک پرونده پیچیده ممکن بود سه ساعت زمان ببرد تا پزشک تصمیم بگیرد چه چیزی اهمیت دارد و در مرحله بعد چه اتفاقی باید بیفتد. اما به گزارش unite.ai، تبدیل یک چت‌بات به یک سامانه بالینی در حال شکست است، چون بخش سخت ماجرا هوش مدل نیست، بلکه کاربرد آن است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، فاصله میان توانایی تئوریک و اجرای عملی همیشه یک حفره امنیتی یا عملیاتی ایجاد می‌کند.

هزینه پیاده‌سازی

ساخت یک سامانه بالینی قابل‌اعتماد بسیار دشوارتر از استقرار یک هوش مصنوعی عمومی است. در یک پروژه توسعه، مهندسان نرم‌افزار در کنار تیمی ۱۰ نفره از پزشکان کار کردند. با وجود هوش بالای مدل، این پروژه به حدود یک سال زمان و یک میلیون دلار سرمایه‌گذاری نیاز داشت و با این حال، همچنان در مرحله ساخت و توسعه قرار داشت. چالش اصلی، ظرفیت مدل نبود، بلکه نحوه به‌کارگیری عملیاتی این هوش در یک محیط واقعی پزشکی بود.

پارادوکس مهندسی پرامپت

بسیاری از ارائه‌دهندگان خدمات بهداشتی تصور می‌کنند راه حل در مهندسی پرامپت (Prompt Engineering) — هنر سؤال درست پرسیدن، مثل کسی که می‌داند چطور از یک مشاور باتجربه بهترین جواب را بگیرد — است. آن‌ها فکر می‌کنند اگر پزشک تبدیل به یک اپراتور حرفه‌ای AI شود، سامانه قابل‌اعتماد می‌شود. در واقع، اجبار پزشک به ایفای نقش یک توسعه‌دهنده آماتور، یک شکست سیستمی در تکنولوژی است، نه کمبود آموزش. این موضوع یادآور چالش‌های مشابه در دنیای برنامه‌نویسی است، جایی که اتکای بیش از حد به دستیارهای هوش مصنوعی بدون نظارت مهندسی دقیق می‌تواند منجر به خطاهای سیستمی بحرانی شود.

تفاوت عملکردی شدیدی در نحوه تعامل کاربران با هوش مصنوعی وجود دارد. یک کاربر حرفه‌ای (Power User) فقط سؤال نمی‌پرسد؛ او با مدل بحث می‌کند، پیش‌فرض‌هایش را به چالش می‌کشد، زمینه‌های فراموش‌شده را به مدل یادآوری می‌کند و چارچوب بحث را تغییر می‌دهد. این روش برای نوشتن یک متن تبلیغاتی یک پیروزی در بهره‌وری است، اما وقتی موضوع یک بیمار باشد، تبدیل به یک متغیر خطرناک می‌شود. در میان بیش از ۷۰ هزار متخصص، بسیاری از نظر بالینی نابغه هستند اما در استخراج اطلاعات مفید از یک سامانه AI ضعیف عمل می‌کنند. این دو، مهارت‌های کاملاً متفاوتی هستند.

شکاف عملکردی

داده‌های حاصل از چندین آزمایش، الگوی تکرارشونده‌ای را نشان می‌دهد که در آن هوش مصنوعی از تیم «انسان + AI» باهوش‌تر است:

  • آزمون تصادفی ۲۰۲۴: ۵۰ پزشک با پرونده‌های تشخیصی دشوار روبرو شدند. کسانی که از GPT-4 استفاده کردند ۷۶٪ و کسانی که از منابع سنتی استفاده کردند ۷۴٪ امتیاز گرفتند؛ تفاوتی که از نظر آماری معنادار نبود. اما GPT-4 وقتی به تنهایی کار کرد، ۱۶ درصد از گروه سنتی پیشی گرفت.
  • تکرار آزمایش در بریتانیا (۲۰۲۶): این مطالعه شکاف مشابهی را یافت. پزشکان با کمک AI پیشرفت کردند اما همچنان بیش از ۲۱ درصد پایین‌تر از مدل زبانی بزرگی بودند که به طور مستقل عمل می‌کرد.
  • مطالعه پاکستان (۲۰۲۶): همان‌طور که ذکر شد، GPT-4o امتیاز ۸۲.۹٪ را در برابر ۷۱.۴٪ پزشکان آموزش‌دیده‌ای به دست آورد که آموزش‌های خاصی را دیده بودند.

این نتایج نشان می‌دهد در برخی وظایف شناختی، AI همین حالا از یک پزشک فردی بهتر است. هیچ انسانی نمی‌تواند تمام اختلالات نادر، تداخلات دارویی یا مقالات پزشکی را در لحظه‌ای که مرتبط می‌شوند به یاد آورد، اما AI این اطلاعات را بدون خستگی پردازش می‌کند.

خطر «جعبه پرامپت خالی»

مدل‌های زبانی عمومی، تحلیل‌گرهای قطعی (Deterministic Parsers) نیستند. وقتی پزشک گزارشی با ۱۵۰ شاخص را آپلود می‌کند، مدل ممکن است خروجی را به زیبایی سازماندهی کند اما در سکوت، ۵۰ مقدار حیاتی را نادیده بگیرد. چون سامانه اعلام نمی‌کند چه چیزی را از قلم انداخته، یک مقدار گم‌شده که نیاز به ارزیابی فوری دارد، تبدیل به یک نقطه کور مرگبار می‌شود.

سیستمی که اعتراف کند چیزی را نمی‌داند، فقط «ناکارآمد» است؛ اما سیستمی که نداند چه چیزی را گم کرده، «خطرناک» است. برای حل این مشکل، توسعه‌دهندگان باید فراتر از LLM بروند. کار بالینی به بازتولیدپذیری و منطق قطعی نیاز دارد؛ قوانینی که به اندازه کافی صریح باشند تا نرم‌افزار بتواند آن‌ها را اجرا کند.

مهندسی در برابر واقعیت بالینی

ساخت این سامانه‌ها باعث تلاقی دو زبان متفاوت می‌شود. مهندسان به قوانین صریح نیاز دارند، در حالی که پزشکان در دنیای «بله، مگر در مورد...» زندگی می‌کنند. بیولوژی انسان با استثنائات، اصلاح‌کننده‌ها و توضیحات متضاد تعریف می‌شود. گاهی همکاری این دو گروه شبیه این است که یکی با زبان اشاره حرف بزند و دیگری به زبان Klingon.

برای پیشرفت، سامانه‌ها باید این موارد را داشته باشند:

  • استخراج داده‌های قابل‌اعتماد برای مدیریت دقیق گزارش‌های متراکم پزشکی.
  • دانش ساختاریافته و کنترل‌های قطعی.
  • حفاظ‌هایی که بتوانند روابط را در کل تاریخچه یک بیمار ارزیابی کنند.
  • توانایی تشخیص زمانی که پنج یافته به‌تنهایی معمولی، در کنار هم اهمیت حیاتی پیدا می‌کنند.

پزشک سایبورگ

هوش مصنوعی می‌تواند پرونده را بخواند، اما انسان باید «اتاق را بخواند». پزشک متوجه لرزش صدای بیمار یا تغییر روایت او در میان جمله می‌شود. او می‌داند وقتی بیماری که عادت دارد علائمش را کوچک جلوه دهد می‌گوید «حالم خوب است»، در واقع منظورش این نیست. این تعامل انسانی یک لایه تزئینی نیست، بلکه منبع اصلی داده‌های بالینی است که هرگز وارد پرونده دیجیتال نمی‌شود.

آینده پزشکی جایگزینی پزشک با چت‌بات نیست، بلکه خلق «پزشک سایبورگ» است. سامانه‌ای که حافظه و تشخیص الگوی ماشین را با قضاوت و تردید انسان ترکیب کند.

این تغییر یعنی ارزشمندترین نوآوری دیگر خودِ مدل بنیادی نیست. برد واقعی در اطراف مدل اتفاق می‌افتد: اینکه داده‌ها چگونه تأیید شوند، چه دانشی تغذیه شود، سامانه اجازه استنباط چه چیزهایی را داشته باشد و انسان در کجای چرخه باقی بماند.

باید از پرسیدن این سؤال که آیا AI جایگزین پزشکان می‌شود دست برداریم. رقابت حافظه تمام شده است. هدف اکنون ساخت سامانه‌هایی است که پیچیدگی در دل تکنولوژی باشد، نه در پرامپت پزشک.

گام بعدی شما

  • اگر در حوزه سلامت فعال هستید، به جای تمرکز بر مهندسی پرامپت، روی ابزارهای استخراج داده قطعی (Deterministic Extraction) سرمایه‌گذاری کنید.
  • در ارزیابی ابزارهای AI پزشکی، نرخ «داده‌های نادیده گرفته شده» را به جای «صحت کلی» معیار قرار دهید.
  • برای کاهش خطای انسانی، مدل‌های استدلالی را به عنوان لایه دوم بررسی (Double-check) به کار ببرید، نه به عنوان تصمیم‌گیرنده اول.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته‌ها بر اساس اعتبار آزمایش‌های بالینی ۲۰۲۶ نشان می‌دهد که گلوگاه پزشکی دیگر هوش مدل نیست، بلکه ایمنی رابط کاربری است. این موضوع باعث تغییر استراتژی شرکت‌های HealthTech از توسعه مدل‌های بزرگ‌تر به سمت ساخت لایه‌های نظارتی قطعی می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای پیشرفته و نبود زیرساخت‌های داده‌ای متمرکز در ایران، استقرار این سامانه‌ها در سطح کلینیکی فعلاً با چالش جدی روبروست و بیشتر در سطح پژوهشی کاربرد دارد.

·نگاه ما
تحریریه دات‌هوش

برتری مدل در حالت تک‌نفره نسبت به تیم «انسان+AI» نشان می‌دهد که هوش مصنوعی در حال حاضر به جای کمک به متخصص، باعث ایجاد اتکای بیش از حد (Over-reliance) یا تداخل در فرآیند تصمیم‌گیری می‌شود. این یک هشدار جدی است که ابزارهای AI فعلی برای محیط‌های حساس، به جای رابط‌های چت‌محور، به ساختارهای سخت‌گیرانه و منطق برنامه‌نویسی‌شده نیاز دارند تا از نقاط کور مرگبار جلوگیری شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.