پرش به محتوای اصلی
پرش به محتوای مقاله

۴ مدل تخصصی OpenEvidence برای ارتقای تشخیص‌های پزشکی

·۱۲ شهریور ۱۴۰۵۴ دقیقه مطالعه
پیش‌نمایش مدل هوش مصنوعی پزشکی داروین توسط OpenEvidence رونمایی شد
پیش‌نمایش مدل هوش مصنوعی پزشکی داروین توسط OpenEvidence رونمایی شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین مدل هوش مصنوعی که در یک نسخه اصلاح‌شده از MedQA نمره کامل کسب کرد و معرفی سیستم «بودجه تفکر» برای انتخاب بین سرعت و عمق تحلیل در محیط کلینیکی.

تصور کنید دستیاری دارید که تمام متون پزشکی جهان را خوانده و هیچ سوالی از او سخت نیست. این رویای پزشکان با رسیدن مدل Darwin به امتیاز ۱۰۰٪ در محک MedQA (یک آزمون استاندارد پزشکی) به واقعیت نزدیک‌تر شد. امتیاز ۱۰۰٪، یعنی یک نمره کامل، اکنون سقف جدیدی برای هوش مصنوعی بالینی تعریف کرده است.

به نقل از گزارش OpenEvidence، این شرکت در ۳ سپتامبر ۲۰۲۶ خانواده‌ای از مدل‌های جست‌وجوی پزشکی را عرضه کرد که به‌جای تمرکز صرف بر دقت، بر اساس «زمان استدلال» و «عمق تحلیل» دسته‌بندی شده‌اند. در واقع، این مدل‌ها به پزشکان اجازه می‌دهند بسته به فوریت مورد، «بودجه تفکر» مدل را تعیین کنند.

هوش مصنوعی زاینده (Generative AI) — مثل آشپزی که دستورالعمل‌ها را حفظ کرده اما گاهی در جزئیات اشتباه می‌کند — در حوزه پزشکی با چالشی بزرگ روبروست: موازنه بین سرعت پاسخ‌دهی و دقت سخت‌گیرانه. اکثر مدل‌های زبانی بزرگ (LLM) عمومی، پاسخ‌های سریعی می‌دهند که ممکن است فاقد استنادهای عمیق باشند، در حالی که ابزارهای تخصصی اغلب برای محیط شلوغ یک کلینیک بیش از حد کند به نظر می‌رسند. OpenEvidence با ارائه یک سیستم لایه‌بندی شده، این مشکل را حل کرده است. این رویکرد تخصصی در حالی رخ می‌دهد که در سطح کلان، پذیرش گسترده مدل‌های وزن‌باز توسط گوگل مسیر را برای توسعه مدل‌های متنوع و بهینه‌شده در اکوسیستم AI هموار کرده است.

زمینه و نام‌گذاری مدل‌ها

سه مدل عملیاتی این پلتفرم نام خود را از چهره‌های برجسته تاریخ پزشکی گرفته‌اند تا کارکردشان را بهتر نشان دهند. مدل Osler به نام ویلیام اسلر نام‌گذاری شده است؛ پزشکی که آموزش پزشکی را از تالارهای سخنرانی به بالین بیمار منتقل کرد. او نام سریع‌ترین مدل این مجموعه است. مدل Sackett به نام دیوید ساکت، پدر پزشکی مبتنی بر شواهد (EBM)، نام‌گذاری شده و برای مدل‌هایی طراحی شده است که باید شواهد مختلف را با هم بسنجند. در نهایت، مدل Snow به نام جان اسنو نام‌گذاری شده است؛ کسی که با ردیابی شیوع وبا در خیابان براد در سال ۱۸۵۴ به یک پمپ آب واحد، بیماری‌شناسی مدرن (اپیدمیولوژی) را بنیان نهاد. این مدل برای عمیق‌ترین تحقیقات طراحی شده است.

لایه‌ی عملیاتی (Production Tier)

در حال حاضر سه مدل به‌صورت رایگان برای پزشکان تأیید شده از طریق وب‌سایت openevidence.com و اپلیکیشن‌های موبایل در دسترس است. پزشکان می‌توانند با استفاده از یک انتخاب‌گر مدل (Model Selector) در رابط کاربری، بین این سه سطح جابه‌جا شوند. OpenEvidence تأکید می‌کند که هر سه مدل از یک استاندارد دقت بالینی پیروی می‌کنند و تنها تفاوت آن‌ها در عمق جست‌وجو و زمان استنتاج است:

  • Osler: سریع‌ترین مدل است که پاسخ‌ها را در حدود ۵ ثانیه ارائه می‌دهد. این مدل جانشین نسخه قبلی OpenEvidence است و به‌عنوان مدل پیش‌فرض پلتفرم عمل می‌کند.
  • Sackett: یک مدل جست‌وجوی عمیق‌تر است که حدود ۳۰ ثانیه برای هر پاسخ زمان می‌برد و برای سوالاتی که پاسخ آن‌ها به وزن شواهد بستگی دارد، بهینه شده است.
  • Snow: جانشین قابلیت Deep Consult و متمرکزترین مدل عملیاتی است. این مدل حدود ۵ دقیقه زمان نیاز دارد تا یک بررسی کامل در متون پزشکی انجام داده و یک گزارش مفصل تولید کند.

پیش‌نمایش پژوهشی داروین (Darwin)

اما ستاره این معرفی، مدل Darwin است. این مدل که پیشرفته‌ترین مدل شرکت است و فعلاً دسترسی به آن محدود به پژوهشگران و شرکای سازمانی است، نخستین مدل هوش مصنوعی است که در یک مجموعه اصلاح‌شده از ۶۶۰ سوال محک MedQA، نمره کامل ۱۰۰٪ کسب کرده است.

داروین همچنین رکوردهای جدیدی (SOTA) در سایر محک‌های کلیدی ثبت کرده است:

  • MedXpertQA: امتیاز ۷۲.۸٪ (۷.۷ واحد بالاتر از قوی‌ترین خط پایه یا Baseline).
  • HealthBench Professional: امتیاز ۸۲.۷٪ (۱۲.۱ واحد بالاتر از مدل رقیب بعدی).
  • NOHARM: امتیاز ۸۷.۲٪ در معیار F1 با وزن‌دهی به شدت خطا (در حالی که نزدیک‌ترین خط پایه ۰.۷۴۰ بود).

متدولوژی محک‌ها و ارزیابی

در مورد متدولوژی ارزیابی، OpenEvidence در یک پست فنی جزئیات را توضیح داده است. برای MedQA، آن‌ها ابتدا با بازبینی مجدد ۱۲۷۳ سوال توسط پزشکان شروع کردند. پس از حذف موارد مبهم یا اطلاعات ناقص و انجام یک بررسی دوم در اوت ۲۰۲۶ توسط سه پزشک، به مجموعه نهایی ۶۶۰ سوال رسیدند.

سایر جزئیات تست‌ها عبارتند از:

  • MedXpertQA: بر روی کل بخش متنی (Text split) شامل ۲۴۵۰ سوال ارزیابی شد و زیرمجموعه‌های چندوجهی (Multimodal) حذف شدند.
  • HealthBench Professional: از ۴۱۰ مورد از ۵۲۵ تکلیف استفاده شد. پاسخ‌ها توسط مدل Claude Opus 4.8 با بودجه تفکر حداکثری ۳۲,۰۰۰ توکن نمره داده شدند.
  • NOHARM: با استفاده از یک بسته متن‌باز رسمی روی یک زیرمجموعه باز ۳۰ موردی ارزیابی شد. دقت وزن‌دار بر اساس شدت برای داروین ۰.۹ گزارش شده است.

OpenEvidence مدل داروین را در برابر خط‌های پایه‌ای از جمله Claude Fable 5 (با تفکر تطبیقی)، GPT-5.6-sol (استدلال پیش‌فرض) و Gemini 3.7-flash (استدلال پیش‌فرض) مقایسه کرد.

ایمنی و دسترسی

دسترسی به داروین به‌دلیل «ریسک استفاده دوگانه» (Dual-use risk) به‌شدت کنترل می‌شود و تنها از طریق درخواست رسمی امکان‌پذیر است. به باور شرکت، مدلی که قادر به استدلال در سطح پیشرو در ویروس‌شناسی، ایمونولوژی و ژنتیک انسانی است، می‌تواند به‌طور بالقوه تحقیقات مرتبط با سلاح‌های بیولوژیک یا ویرایش ژنتیکی سلول‌های زایشی (Germline editing) را خارج از نظارت‌های علمی تسریع کند.

در حال حاضر دسترسی تنها به پژوهشگران معتبر هوش مصنوعی، همکاران پژوهشی و شرکای سازمانی مانند «سازمان ملی بیماری‌های نادر» (NORD) محدود است که از داروین برای سخت‌ترین پرونده‌های خود استفاده می‌کند.

این استراتژی نشان می‌دهد صنعت در حال حرکت از «مدل‌های همه‌فن‌حریف» به سمت «پروفایل‌های استدلالی تخصصی» است. تفکیک قابلیت‌های پرخطر داروین از کاربردهای روزمره اسلر، تعادلی میان سودمندی بالینی و ایمنی جهانی ایجاد می‌کند. برای یک پزشک، این یعنی هوش مصنوعی از یک چت‌بات ساده به یک دستیار پژوهشی مقیاس‌پذیر تبدیل شده است. شما اکنون می‌توانید تصمیم بگیرید که آیا یک مورد نیاز به بررسی ۵ ثانیه‌ای دارد یا یک غوص عمیق ۵ دقیقه‌ای.

OpenEvidence قصد دارد این خانواده را به مدل‌های تخصصی‌تر گسترش دهد و این مسیر با حوزه‌های انکولوژی، رادیولوژی و ژنتیک بالینی آغاز می‌شود. باید منتظر ادغام تدریجی قابلیت‌های داروین در مدل‌های عملیاتی بود، مشروط بر اینکه پادمان‌های ایمنی تایید شوند.

گام بعدی شما

  • اگر پزشک هستید، در openevidence.com ثبت‌نام کنید تا دسترسی به مدل‌های رایگان را فعال کنید.
  • در پرونده‌های پیچیده، به‌جای مدل پیش‌فرض، از مدل Snow برای استخراج گزارش‌های عمیق استفاده کنید.
  • منتظر عرضه مدل‌های تخصصی در حوزه‌های انکولوژی و رادیولوژی باشید که به‌زودی منتشر می‌شوند.

اما داستان سخت‌افزاری این تحول و نحوه مدیریت هزینه‌های استنتاج در مدل‌های عمیق، حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار داده‌های بازبینی‌شده توسط پزشکان، اعتماد به AI در محیط‌های بالینی را افزایش می‌دهد. همچنین مدل‌سازی لایه‌بندی شده، راهکاری عملی برای مدیریت ریسک‌های بیولوژیکی در مدل‌های استدلالی پیشرفته است.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی به APIهای پیشرفته و تحریم‌ها، استفاده از این ابزار برای پزشکان ایرانی نیازمند ابزارهای تغییر آی‌پی است، اما دسترسی رایگان برای پزشکان تأییدشده یک فرصت پژوهشی است.

·نگاه ما
تحریریه دات‌هوش

دستیابی به امتیاز ۱۰۰٪ در MedQA نشان می‌دهد که سقف توانایی مدل‌های تخصصی بسیار بالاتر از مدل‌های عمومی است. جالب اینجاست که OpenEvidence به‌جای رقابت بر سر «دقت مطلق»، مفهوم «بودجه تفکر» را به کاربر بازگردانده است. این رویکرد احتمالاً به استانداردی تبدیل می‌شود که در آن کاربر تصمیم می‌گیرد چقدر هزینه محاسباتی برای رسیدن به پاسخ پرداخت کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.