پرش به محتوای اصلی
پرش به محتوای مقاله

دانشگاه میشیگان: مدل NeuroVFM دقت تریاژ پزشکی را به ۹۲.۶٪ رساند

·۲۲ تیر ۱۴۰۵۵ دقیقه مطالعه
نوروVFM: مدل بنیادین تصویربرداری عصبی آموزش‌دیده با Vol-JEPA روی داده‌های بالینی MRI و CT بررسی‌نشده
نوروVFM: مدل بنیادین تصویربرداری عصبی آموزش‌دیده با Vol-JEPA روی داده‌های بالینی MRI و CT بررسی‌نشده
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از متد Vol-JEPA برای یادگیری بدون نظارت از داده‌های حجمی (Volumetric) پزشکی؛ رویکردی که باعث شد دقت تریاژ از ۷۱٪ (مدل‌های عمومی) به ۹۲٪ برسد بدون اینکه یک برچسب دستی زده شود.

دقت تشخیص‌های پزشکی در مقیاس وسیع، دیگر وابسته به ارتشی از متخصصانی نیست که ساعت‌ها وقت خود را صرف برچسب‌گذاری دستی داده‌ها کنند. مدل NeuroVFM ثابت کرد که می‌توان با یادگیری مستقیم از جریان داده‌های خام بیمارستانی، به دقتی رسید که حتی پیشرفته‌ترین مدل‌های زبانی دنیا را به حاشیه براند.

طبق اعلام تیم پژوهشی دانشگاه میشیگان در نشریه Nature Medicine، این مدل بنیادی (Foundation Model) بینایی، یک مدل جامع است که توانسته است به صحت ۹۲.۶ درصدی در تریاژ تصاویر عصبی بالینی دست یابد. این دستاورد در حالی رخ داده که مدل از رویکردی به نام «یادگیری سیستم سلامت» (health system learning) استفاده می‌کند تا مستقیماً از داده‌های واقعی و بدون پالایش بالینی درس بگیرد و اثبات کند که پیش‌بینی در فضای نهان برای تصویربرداری عصبی، بسیار قدرتمندتر از نظارت‌های مبتنی بر زبان است.

زمینه: چالش داده‌های بالینی

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت داده‌های پزشکی و چالش‌های حریم خصوصی اشاره کردیم، دسترسی به داده‌های تصویربرداری عصبی در مجموعه‌های داده عمومی اینترنتی بسیار دشوار است؛ زیرا اسکن‌های MRI و CT حاوی ویژگی‌های شناسایی چهره هستند. این شکاف باعث می‌شود مدل‌های عمومی هوش مصنوعی در وظایف مربوط به تصویربرداری مغزی عملکرد ضعیفی داشته باشند.

برای عبور از این مانع، پژوهشگران از مجموعه داده UM-NeuroImages استفاده کردند؛ آرشیوی عظیم که شامل بیش از دو دهه مراقبت‌های روتین در مرکز پزشکی میشیگان است. تیم تحقیق مدل را بر روی ۵.۲۴ میلیون حجم MRI و CT که از ۵۶۶,۹۱۵ مطالعه استخراج شده بود، آموزش دادند.

این رویکرد «یادگیری سیستم سلامت» به مدل اجازه می‌دهد تا از داده‌های پالایش‌نشده‌ای که در جریان عملیات عادی بالینی تولید می‌شوند، یاد بگیرد. با این روش، مدل از گلوگاه‌های رایج مانند نیاز به گزارش‌های رادیولوژی جفت‌شده و تمرکز محدود بر بیماری‌های خاص (که در طبقه‌بندی‌های سنتی رایج است) رهایی می‌یابد. این رویکرد در واقع پاسخی به چالش‌های کیفیت داده است، چرا که دقت در قطعه‌بندی تصاویر پزشکی همواره به عنوان سدی در برابر خطاهای احتمالی هوش مصنوعی در حوزه سلامت شناخته شده است.

جزئیات: معماری و مکانیسم Vol-JEPA

قلب تپنده این سیستم، الگوریتمی به نام Vol-JEPA است. این الگوریتم یک روش یادگیری خود-نظارتی (self-supervised) و صرفاً بینایی است. Vol-JEPA در واقع گسترشی از متدهای پیشین I-JEPA و V-JEPA برای تصاویر پزشکی حجمی است که نشان‌دهنده روند گسترش یادگیری‌های سبک JEPA در حوزه تصویربرداری پزشکی است. این مدل به جای بازسازی پیکسل‌ها، تلاش می‌کند بازنمایی‌ها را در یک فضای نهان (Latent Space) یادگرفته‌شده پیش‌بینی کند. به گزارش نویسندگان مقاله، این سازوکار نیاز به برچسب‌ها، متن گزارش‌ها یا رمزگذارهای وکسلی (voxel decoders) را کاملاً حذف می‌کند.

مکانیزم یادگیری Vol-JEPA در ۵ گام کلیدی اجرا می‌شود:

  • توکن‌سازی (Tokenization): هر حجم سه‌بعدی به قطعات (patch) غیرهم‌پوشان ۴×۱۶×۱۶ وکسلی تقسیم می‌شود.
  • تفکیک (Splitting): حجم تصویر به یک بخش کوچک «بستر دیدنی» (visible context) و یک بخش بزرگتر «هدف ماسک‌شده» (masked target) تقسیم می‌گردد.
  • پردازش (Processing): یک رمزگذار دانش‌آموز (Student Encoder) قطعات بستر را پردازش می‌کند، در حالی که یک پیش‌بین (Predictor)، لایه‌های نهان بستر را با رمزگذاری‌های موقعیتی هدف ترکیب می‌کند تا لایه‌های مناطق ماسک‌شده را تخمین بزند.
  • هدایت (Guidance): یک رمزگذار استاد (Teacher Encoder) که در واقع میانگین متحرک نمایی (EMA) رمزگذار دانش‌آموز است، لایه‌های هدف واقعی (ground-truth) را تولید می‌کند. آموزش مدل با کمینه کردن یک خطای L1 نرم (smooth L1 loss) بین این لایه‌ها صورت می‌گیرد و گرادینت‌ها در مسیر رمزگذار استاد متوقف می‌شوند.
  • تمرکز (Focus): ماسک‌گذاری به‌طور ویژه روی پیش‌زمینه (بافت‌های حیاتی) با استفاده از ماسک‌های پیش‌محاسبه‌شده‌ی سر (head masks) متمرکز است. نسبت بستر برای MRIها ۲۵٪ و برای CTها ۲۰٪ است که با ۲۰٪ حذف قطعات (patch dropout) تقویت شده است. این کار مانع از آن می‌شود که رمزگذار به میان‌برهای پس‌زمینه تکیه کند.

عملکرد فنی و محک‌ها

مدل NeuroVFM در ۱۵۶ تکلیف تشخیصی، شامل ۷۴ مورد MRI و ۸۲ مورد CT مورد آزمایش قرار گرفت. برای اندازه‌گیری دقیق، تیم تحقیق تمامی رمزگذارها را منجمد (freeze) کرده و پروب‌های توجهی (attentive probes) یکسانی را در سطح مطالعه آموزش دادند.

نتایج کلیدی عبارتند از:

  • امتیازات AUROC: مدل به امتیاز ۹۲.۶۸ برای CT و ۹۲.۴۹ برای MRI رسید و در نقطه انتهایی تجمیعی، تمامی مدل‌های پایه را پشت سر گذاشت.
  • شکاف مقایسه‌ای: از آنجایی که مدل‌های PRIMA، HLIP و NeuroMAE از داده‌های آموزشی یکسانی استفاده می‌کنند، تفاوت‌ها مستقیماً نشان‌دهنده کیفیت هدف (objective) است. NeuroVFM حدود ۱.۵۵ امتیاز بهتر از NeuroMAE (که بر بازسازی وکسل متمرکز است)، ۰.۹۸ امتیاز بیشتر از HLIP (که بر نظارت گزارش متمرکز است) و ۲.۸۸ امتیاز بیشتر از BiomedCLIP عمل کرد.
  • کارایی: آموزش این مدل به کمتر از ۱,۰۰۰ ساعت واحد پردازش گرافیکی (GPU) نیاز داشت. سرعت استنتاج آن بیش از ۷ برابر سریع‌تر از بیس‌لاین 3DINO بود و در حافظه یکسان، توانست دسته‌های (batch) ۱۶ برابر بزرگتری را جای دهد.

رمزگذار پایه دارای ۸۵.۸ میلیون پارامتر است و یک نسخه کوچک‌تر با ۲۱.۷ میلیون پارامتر نیز در دسترس است.

ادغام پایین‌دستی و تریاژ

فراتر از تشخیص ساده، تیم تحقیق توکن‌های بصری منجمد شده را با مدل Qwen3-14B در ساختاری شبیه به LLaVA-1.5 ادغام کردند تا سیستم NeuroVFM-LLaVA را خلق کنند. این سیستم قادر است یافته‌های کلیدی ساختاریافته را تولید کرده و سطح فوریت بیمار را به سه دسته «عادی» (unremarkable)، «روتین» یا «فوری» (urgent) تقسیم کند.

در یک مطالعه آینده‌نگر (prospective) مخفیانه یک‌هفته‌ای روی ۱,۱۵۵ مورد، صحت تریاژ NeuroVFM معادل ۹۲.۶٪ بود، در حالی که GPT-5 تنها ۷۱.۲٪ دقت داشت. تکان‌دهنده‌تر آنکه، نرخ خطای مدل در شناسایی یافته‌های بحرانی (miss rate) تنها ۱۳.۵٪ (۲۱ مورد از ۱۵۵) بود، اما این نرخ برای GPT-5 به ۵۰.۳٪ (۷۸ مورد از ۱۵۵) رسید. علاوه بر این، تولید گزارش با NeuroVFM بیش از ۲۴ برابر ارزان‌تر و ۲۳ برابر کم‌کربن‌تر از GPT-5 است.

این پروفایل عملکردی، این پیش‌فرض را که AI پزشکی با دقت بالا نیازمند مجموعه‌های داده عظیم، پالایش‌شده و برچسب‌دار است، تغییر می‌دهد. NeuroVFM نشان داد که یک فضای نهان مشترک، امکان انتقال بین‌مدالیته‌ها (cross-modal transfer) را فراهم می‌کند؛ به گونه‌ای که یک پروب آموزش‌دیده روی CT، هنگام اجرا روی MRI، افت امتیاز AUROC کمتر از ۵ واحد داشت.

پیاده‌سازی و استقرار

با وجود این دستاوردها، نویسندگان تاکید کرده‌اند که به دلیل نرخ حساسیت ۸۶.۵ درصدی، این مدل صرفاً برای «حمایت از تصمیم پزشک» است و نباید جایگزین غربالگری مستقل شود. وزن‌های این مدل تحت لایسنس CC-BY-NC-SA-4.0 منتشر شده است (برخی نیازمند تأیید ایمیل سازمانی هستند) و فعلاً تاییدیه FDA را دریافت نکرده است.

شما می‌توانید پیاده‌سازی این مدل را از طریق مخزن رسمی گیت‌هاب بررسی کنید. این استک نیازمند FlashAttention-2 (نسخه ۲.۶.۳) است که باید از منبع (source) ساخته شود. کد تحت لایسنس MIT ارائه شده و یک API برای بارگذاری رمزگذارها، سرهای تشخیصی و ژنراتورهای VLM برای یافته‌های اولیه و تریاژ فراهم می‌کند.

از نقاط قوت مدل می‌توان به پایداری عملکرد در برابر تولیدکنندگان مختلف دستگاه‌ها، شدت‌های میدان مغناطیسی و زیرگروه‌های دموگرافیک اشاره کرد. با این حال، محدودیت‌هایی در رابطه با سوگیری مجموعه داده، معماری و هدف وجود دارد، زیرا نتایج از یک سیستم سلامت دانشگاهی واحد استخراج شده‌اند.

گام بعدی شما

  • توسعه‌دهندگان ابزارهای Health-Tech باید مستندات گیت‌هاب NeuroVFM را برای بررسی APIهای بارگذاری رمزگذارها مطالعه کنند.
  • اگر از مدل‌های VLM برای تحلیل تصویر استفاده می‌کنید، استراتژی «پیش‌بینی فضای نهان» را جایگزین «بازسازی پیکسل» کنید.
  • بررسی کنید که آیا داده‌های خام سازمان شما (بدون برچسب) می‌تواند به عنوان منبع یادگیری بنیادی به‌کار رود یا خیر.

اما چالش اصلی اکنون در سخت‌افزار است؛ برای اجرای بهینه این مدل، شما به FlashAttention-2 نیاز دارید — به بررسی ما درباره بهینه‌سازی‌های حافظه در تراشه‌های جدید مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار داده‌های واقعی بیمارستانی، تکیه بر مجموعه‌های داده‌های برچسب‌گذاری‌شده و گران‌قیمت را می‌شکند. نتیجه آن، دموکراتیزه شدن ابزارهای تریاژ دقیق است که هزینه‌ها و کربن‌زایی استنتاج را به شدت کاهش می‌دهد.

تأثیر برای ایران

این مدل به دلیل وزن‌های باز (Open Weights)، فرصت تحلیل داده‌های تصویربرداری مراکز درمانی ایران را بدون نیاز به هزینه‌های گزاف API فراهم می‌کند؛ هرچند دسترسی به برخی نسخه‌ها نیازمند ایمیل سازمانی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی نظارت متنی (Report-based) با پیش‌بینی فضای نهان در تصاویر پزشکی، یک چرخش پارادایم است. این رویکرد ثابت می‌کند که برای داده‌های تخصصی چون MRI، یادگیری ساختاری از خودِ سیگنال بصری بسیار قدرتمندتر از تکیه بر توصیفات زبانی پزشکان است که ذاتاً ناقص و ذهنی (Subjective) هستند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.