پرش به محتوای اصلی
پرش به محتوای مقاله

دقت تشخیص AMIE گوگل در محیط واقعی کلینیک به ۹۰٪ رسید

·۱۸ مهر ۱۴۰۵۵ دقیقه مطالعه
مطالعه امکان‌سنجی AMIE گوگل برای مراقبت‌های اولیه در لنست منتشر شد
مطالعه امکان‌سنجی AMIE گوگل برای مراقبت‌های اولیه در لنست منتشر شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین استقرار واقعی یک مدل مکالمه‌محور در محیط کلینیک که در آن AI نه به عنوان ابزار کمکی پزشک، بلکه به عنوان لایه اول پذیرش بیمار عمل کرده و صحت ۹۰ درصدی را ثبت کرده است.

تصور کنید پیش از آنکه بیمار قدم به اتاق معاینه بگذارد، وضعیت بالینی او با دقت شناسایی شده باشد. طبق مطالعه‌ای بالینی که در ۸ اکتبر ۲۰۲۶ در نشریه The Lancet منتشر شد، گوگل و مرکز پزشکی Beth Israel Deaconess (BIDMC) ثابت کردند که هوش مصنوعی مکالمه‌محور می‌تواند پذیرش بیماران در مراکز مراقبت‌های فوریتی را به‌صورت ایمن مدیریت کند و کیفیت تشخیص آن با پزشکان مراقبت‌های اولیه برابری می‌کند.

این تحول در حالی رخ می‌دهد که سیستم‌های بهداشتی با فرسودگی شدید کادر درمان و ناکارآمدی در جمع‌آوری داده‌ها دست‌وپنجه نرم می‌کنند. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی کاربردهای تخصصی مدل‌های زبانی در علوم پزشکی اشاره کردیم، اکنون ریسک‌ها از لایه‌ی لحن ارتباطی به لایه‌ی صحت بالینی منتقل شده است. هدف نهایی این است که نقش پزشک از یک «جمع‌آوری‌کننده داده» به یک «تأییدکننده داده» تبدیل شود.

دامنه و بستر مطالعه

به نقل از گوگل، این نخستین مقاله این شرکت است که در مجله اصلی The Lancet چاپ می‌شود. این پژوهش که در ClinicalTrials.gov پیش‌ثبت شده بود، تحت پروتکل‌های تاییدشده توسط هیئت بررسی سازمانی اجرا شد. بیماران پذیرفتند که مشارکت یا عدم مشارکت آن‌ها در این طرح، هیچ تأثیری بر کیفیت مراقبت‌های دریافتی‌شان نخواهد داشت.

تمرکز مطالعه بر بیماران بزرگسالی بود که برای شکایات غیر اورژانسی و گذرا مراجعه کرده بودند. اگرچه توزیع جنسیتی و نژادی نمونه‌ها با دموگرافی کلی کلینیک همخوانی داشت، اما شرکت‌کنندگان به‌طور کلی جوان‌تر بودند. از میان ۱٬۴۵۲ بازدید در دوره مطالعه، بیش از نیمی از بیماران بالای ۶۰ سال بودند؛ گروه سنی که در نمونه‌های مورد بررسی توسط هوش مصنوعی کمتر حضور داشتند.

طراحی سیستم و پروتکل‌های ایمنی

سامانه‌ای با نام Articulate Medical Intelligence Explorer (AMIE) در یک مطالعه تک‌مرکزی از آوریل تا نوامبر ۲۰۲۵ مستقر شد. بیماران تا پنج روز پیش از وقت ملاقات خود، از طریق یک رابط متنی امن، علائم و تاریخچه پزشکی خود را گزارش می‌کردند. AMIE این تاریخچه‌ها را جمع‌آوری کرده، تشخیص‌های احتمالی را برای بحث با پزشک پیشنهاد می‌داد و در نهایت خلاصه‌ای را برای بررسی پزشک تهیه می‌کرد.

ایمنی سیستم از طریق نظارت سخت‌گیرانه و لحظه‌ای مدیریت شد:

  • ۱۱۴ بیمار ثبت‌نام کردند که ۹۸ نفر آن‌ها فرآیند را کامل کرده و در وقت ملاقات حاضر شدند.
  • پزشکان متخصص داخلی تمام جلسات را از طریق ویدیو و اشتراک‌گذاری صفحه به‌صورت زنده رصد می‌کردند.
  • ناظران موظف بودند در چهار حالت خاص مداخله کنند: خطر آسیب به خود یا دیگران، پریشانی عاطفی شدید، احتمال آسیب بالینی یا درخواست صریح بیمار برای پایان جلسه.
  • هیچ‌یک از مکالمات نیازی به توقف ایمنی نداشتند، هرچند پزشکان یک مورد توهم (Hallucination) شناسایی کردند و در ۵ مورد نیاز به شفاف‌سازی دیدند.

پیتر برودور، یکی از نویسندگان اصلی مقاله، بیان کرد که این مطالعه به تعیین ویژگی‌های پایه در مکالمات واقعی کمک می‌کند. BIDMC معتقد است این نخستین مطالعه آینده‌نگر از یک هوش مصنوعی مکالمه‌محور در مواجهه مستقیم با بیمار در مراقبت‌های اولیه است.

عملکرد تشخیصی

بر اساس گزارش تیم پژوهشی، AMIE در تشخیص‌های تفریقی دقت بالایی داشت. این مدل در ۹۰٪ موارد توانست تشخیص نهایی (که ۸ هفته بعد از طریق بررسی پرونده تأیید شد) را در بین ۷ احتمال اول خود قرار دهد.

سایر معیارهای صحت عبارت بودند از:

  • ۷۵٪ صحت در بین ۳ احتمال اول.
  • ۵۶٪ صحت به عنوان محتمل‌ترین تشخیص واحد.
  • ثبات بالا در زیرمجموعه ۴۶ بیماری که تشخیص آن‌ها با آزمایشات آزمایشگاهی، میکروبیولوژی، پاتولوژی یا تصویربرداری تأیید شده بود.

در یک مقایسه تصادفی و کور، پانل‌هایی متشکل از سه ارزیاب بالینی، عملکرد مدل را با پزشکان مقایسه کردند. آن‌ها کیفیت کلی تشخیص‌های تفریقی، مناسب بودن و ایمنی طرح‌های مدیریتی را در هر دو گروه مشابه یافتند. با این حال، پزشکان در معیارهای «کاربردی بودن» و «مقرون‌به‌صرفه بودن» به‌طور معناداری برتر بودند. این رویکرد در تحلیل ریسک بیماری‌ها پیشرو است، مشابه آنچه در مدل Aladynoulli هاروارد برای پیش‌بینی ریسک صدها بیماری مشاهده شد.

اثرات انسانی و عملیاتی

نگرش بیماران پس از تعامل با AMIE به‌طور معناداری مثبت‌تر شد و این حس حتی پس از ملاقات با پزشک نیز پابرجا ماند. بیماران از توانایی سیستم در گوش دادن و توضیح اطلاعات تمجید کردند، هرچند نگرانی‌ها درباره محرمانگی و صداقت چت‌بات همچنان وجود داشت.

برای پزشکان، تأثیرات بیشتر در لایه عملیاتی بود:

  • در ۴۴ مورد که پزشکان پیش از ملاقات خلاصه تولیدشده توسط هوش مصنوعی را خوانده بودند، ۷۵٪ اعلام کردند که این کار به آماده‌سازی آن‌ها کمک کرده است.
  • ۵۷٪ از این پزشکان گفتند که خلاصه AI بر رویکرد بالینی آن‌ها تأثیر گذاشته است.
  • مصاحبه‌های کیفی نشان داد که پویایی ملاقات از «جمع‌آوری داده» به «تأیید داده» تغییر کرده و فضای بیشتری برای تصمیم‌گیری مشترک ایجاد شده است.

با این حال، یکی از پزشکان به جنبه منفی اشاره کرد و یک تعامل را «تا حدی مضر» توصیف کرد، زیرا بیمار پس از اینکه AMIE احتمال لنفوم را در لیست تشخیص‌ها آورد، دچار اضطراب شده بود.

محدودیت‌های فنی و تأمین مالی

گوگل دلیل شکاف در کاربردی بودن و مقرون‌به‌صرفه بودن را سه نقص کلیدی دانست: عدم دسترسی به پرونده‌های الکترونیک سلامت (EHR)، ناتوانی در انجام معاینات فیزیکی و نبود ورودی‌های چندوجهی (Multimodal) مانند ظاهر کلی بیمار.

پژوهشگران تأکید کردند که به‌دلیل تک‌مرکزی بودن مطالعه و نبود مقایسه‌های کنترل‌شده، این نتایج را نباید به عنوان ادعای اثربخشی کمی در برابر گردش‌کارهای استاندارد پذیرفت. محدودیت‌های دیگر شامل رابط متنی (بدون صوت/تصویر) و اثرات بررسی‌نشده سواد دیجیتال و سلامت بیماران بود.

این مطالعه توسط Alphabet تأمین مالی شد. نتایج ابتدا در ۹ مارس ۲۰۲۶ در arXiv و در ۱۱ مارس ۲۰۲۶ در حساب گوگل ریسرچ منتشر شد. این موفقیت در ادامه‌ی زنجیره‌ای از دستاوردهای گوگل در پیش‌بینی‌های بهداشتی است، از جمله مدل پیش‌بینی بستری‌های آنفلوانزا که دقت بالایی در سطح ملی آمریکا نشان داد.

این دستاورد، محک هوش مصنوعی پزشکی را از پرسش‌وپاسخ‌های ساده به گردش‌کارهای بالینی یکپارچه تغییر می‌دهد. با بر عهده گرفتن فاز جمع‌آوری داده، AI به پزشک اجازه می‌دهد بر استدلال‌های پیچیده تمرکز کند، به شرطی که نرخ توهم در مقیاس وسیع، ناچیز باقی بماند.

گام بعدی شما

  • بررسی مستندات AMIE برای درک نحوه ساختاردهی به خلاصه‌های بالینی جهت کاهش بار اداری پزشکان.
  • رصد توسعه قابلیت‌های چندوجهی در مدل‌های پزشکی برای جایگزینی معاینات بصری اولیه.
  • تحلیل اثرات روان‌شناختی ارائه تشخیص‌های احتمالی حساس (مانند سرطان) توسط AI پیش از حضور پزشک.

اما چالش اصلی، ادغام این مدل‌ها با سیستم‌های میراثی پرونده‌های الکترونیک سلامت است — به تحلیل ما درباره پروتکل‌های تبادل داده پزشکی مراجعه کنید.

چرا این موضوع مهم است؟

این مطالعه با تکیه بر اعتبار The Lancet، ثابت می‌کند که AI می‌تواند در لایه تشخیص بالینی با متخصصان برابری کند. این امر منجر به کاهش فرسودگی پزشکان و افزایش دقت در غربالگری‌های اولیه می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای پیشرفته گوگل، استقرار چنین سیستمی در ایران فعلاً دشوار است؛ اما مدل‌های بازمتن می‌توانند برای اتوماسیون پذیرش در کلینیک‌های داخلی بهینه شوند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی جمع‌آوری داده با تأیید داده، بزرگ‌ترین تغییر پارادایم در رابطه پزشک-بیمار است. اگرچه AMIE در کاربردی بودن شکست خورد، اما این شکست ناشی از محدودیت دسترسی به داده‌هاست، نه ضعف در استدلال. این نشان می‌دهد که گلوگاه آینده پزشکی نه در هوش مدل‌ها، بلکه در باز شدن دسترسی به زیرساخت‌های بسته EHR است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.