تصور کنید میخواهید دادههای «قند خون ناشتا» و «گلوکز، ناشتا» را در یک نمودار واحد دنبال کنید، اما سیستم آنها را دو شاخص متفاوت میبیند. برای حل این چالش بدون نیاز به اصلاح دستی، MyVitals اکنون از یک پایپلاین تطبیق چهارلایه برای یادگیری خودکار اصطلاحات پزشکی استفاده میکند؛ موضوعی که در گزارش فنی ۳ سپتامبر ۲۰۲۶ در وبسایت dev.to منتشر شد.
مدیریت دادههای پزشکی بهدلیل تفاوت در اختصارات و کاراکترهای یونیکد آزمایشگاههای مختلف، بهشدت دشوار است. برای مثال، یک کاربر ممکن است گزارشی با عبارت «HCT» و دیگری با «PCV / Haematocrit» داشته باشد. بدون یک دیکشنری هوشمند، اپلیکیشن اینها را به عنوان دو معیار مجزا میشناسد و قابلیت ردیابی سلامت در طول زمان — که ارزش اصلی این پلتفرم است — از بین میرود.
همانطور که در تحلیلهای قبلی ما دربارهی استانداردهای تبادل دادههای سلامت اشاره کردیم، یکپارچهسازی دادههای ناهمگون بزرگترین سد در مسیر سلامت دیجیتال است. این چالش مشابه رویکردی است که پلتفرم Lamarck برای تبدیل نویز دادههای زیستی به تحلیلهای سلامت به کار گرفت تا دقت تشخیصها را افزایش دهد. برای عبور از این سد، MyVitals یک سلسلهمراتب سختگیرانه برای تطبیق دادهها به کار میگیرد:
- لایه ۱: تطبیق دقیق نامهای مستعار — نامهای خام را نرمالسازی کرده و با مستعارهای شناختهشده مقایسه میکند.
- لایه ۲: تطبیق حدس استاندارد — حدس مدل استخراج را با دیکشنری چک میکند تا از ایجاد ورودیهای تکراری جلوگیری شود.
- لایه ۳: شباهت فازی — با استفاده از ضرایب Dice و مقایسه مجموعه توکنها، شباهتها را میسنجد؛ البته با حفاظهایی برای جلوگیری از خطاهای بحرانی (مثلاً برای اینکه «HDL» با «non-HDL Cholesterol» یکی نشود).
- لایه ۴: پشتیبان مدل زبانی بزرگ — یک فرآیند دستهای و زمانبندیشده با هوش مصنوعی زاینده (Generative AI) — شبیه به مشاور ارشدی که سختترین پروندهها را بررسی میکند — که موارد پیچیده را پیش از ثبت نهایی بررسی میکند. این استفاده از مدلهای زبانی برای پاکسازی دادهها، یادآور معماری CannyCart در بهرهگیری از Claude به عنوان نرمالساز دادهها برای اصلاح خطاهای بارکد است.
به نقل از گزارش فنی مذکور، کشف یک باگ بحرانی منجر به ایجاد لایه دوم شد. پیش از این، حدس مدل فقط برای نامگذاری ورودیهای جدید استفاده میشد و باعث میشد معیارهای تکراری مثل «Hematocrit» و «hematocrit_1» ایجاد شوند. طبق اعلام تیم توسعه، اصلاح این مورد باعث ادغام ۱۴ گروه تکراری و کاهش تعداد کل معیارها از ۱۲۶ به ۱۱۲ شد.
نرمالسازی واحدها چالش دیگری بود. تیم متوجه شد ۱۵ مورد از ۲۷ خوانش «غیرقابل تبدیل»، صرفاً بهدلیل تفاوت در رندر فونتها بود؛ جایی که µg/dL، μg/dL و ug/dL متفاوت تشخیص داده میشدند. آنها یک نرمالساز واحد پیاده کردند که این پیشوندها را یکسان میبیند، اما بهشدت در برابر تبدیل واحدهای اساساً متفاوت مثل mg/dL و mmol/L مقاومت میکند.
این معماری، مزیت رقابتی را از «توانایی خواندن PDF» به «دقت بیشتر با هر آپلود» تغییر میدهد. با اضافه کردن هر نام خامِ موفق به عنوان یک مستعار جدید، دیکشنری در سطح کل کاربران بهطور ارگانیک رشد میکند.
برای توسعهدهندگان ابزارهای سلامت، این یک درس حیاتی است: صحت باید بر جامعیت غلبه کند. در نمودارهای پزشکی، یک ادغام اشتباه بسیار خطرناکتر از داشتن یک ردیف داده اضافی است.
گام بعدی شما
- اگر توسعهدهنده هستید، در طراحی سیستمهای تطبیق داده، لایههای «سریع و ارزان» را پیش از لایههای «هوشمند و گران» قرار دهید.
- برای تست این قابلیت، گزارشهای قدیمی خود را در پلتفرم MyVitals آپلود کنید تا یکپارچگی دادهها را ببینید.
- بررسی کنید که آیا در دادههای شما نیز تفاوتهای ظاهری فونت (مانند یونیکدها) باعث ایجاد دادههای تکراری شده است یا خیر.
اما بهینهسازی هزینههای استنتاج در این مدلهای لایهای حتی جذابتر است — به تحلیل ما دربارهی مدلهای کوچک زبانی مراجعه کنید.




گفتگو