پیدا کردن علت دقیق یک بیماری ژنتیکی نادر اغلب به بنبست میرسد، زیرا پژوهشگران نمیتوانند «ماده تاریک» ژنوم را تفسیر کنند. در ۸ اکتبر ۲۰۲۶، شرکت ایلومینا (Illumina) مدل SpliceAI2 را از طریق آزمایشگاه BioInsight AI Lab عرضه کرد که طبق اعلام این شرکت، در تحلیل مجموعهدادههای بیماریهای نادر، ۱۷٪ گونههای مرتبط با بیماری را بیشتر از مدلهای رقیب شناسایی میکند.
تفسیر ژنوم مدتهاست با چالش «گونههای با اهمیت نامشخص» (Variants of Uncertain Significance) دستوپنجه نرم میکند؛ جهشهای ژنتیکی که اثر بیولوژیکی آنها ناشناخته است. در حالی که توالییابی اگزوم سنتی اغلب جهشهای عمیق در مناطق اینترونیک را نادیده میگیرد، SpliceAI2 بر مکانیسم اسپلایسینگ RNA (RNA Splicing) تمرکز میکند که برای کشف دارو و پژوهشهای سرطان ارثی حیاتی است.
زمینه و اهداف راهبردی
به نقل از بیانیه شرکت، SpliceAI2 بخشی از یک مجموعه گستردهتر شامل PromoterAI و PrimateAI-3D است. این ابزارها در کنار هم به پژوهشگران اجازه میدهند تا تعداد گونههای دارای اثر بیولوژیکی پیشبینیشده را تا دو برابر افزایش دهند. همانطور که در تحلیلهای پیشین ما درباره مدلهای بنیادی بیولوژیک اشاره کردیم، هدف نهایی این است که بخشهای تفسیرناپذیر ژنوم به حداقل برسد.
رامی مهیو، نایبرئیس ارشد BioInsight، تأکید کرد که پیشبینی اثر گونهها اولویت اصلی این آزمایشگاه است. کایل فار، معاون این مرکز، بیان کرد که ایلومینا در حال پیشبرد هوش مصنوعی است تا بهطور سیستماتیک سهمی از ژنوم را که غیرقابل تفسیر باقی مانده، کوچک کند.
مدل SpliceAI2 جایگزین نسخه اولیه SpliceAI شد که در سال ۲۰۱۹ عرضه شده بود. مدل نسل اول در بیش از ۳۴۰۰ مقاله علمی مورد استناد قرار گرفت و در توصیههای تفسیر گونههای اسپلایسینگ توسط ClinGen استفاده شد. مدل جدید بر روی مجموعهدادهای آموزش دیده است که بیش از ۱۰۰ برابر بزرگتر از نسل پیشین خود است.
معماری فنی و آموزش
برخلاف نسخه ۲۰۱۹، SpliceAI2 تنها پیشبینی نمیکند که آیا یک سلول در موقعیتی خاص اسپلایسینگ انجام میدهد یا خیر، بلکه به سه پرسش پیچیده پاسخ میدهد:
- کدام موقعیتها در یک ژن به عنوان سایتهای اسپلایسینگ عمل میکنند و با چه فرکانسی؟
- کدام سایتهای اسپلایسینگ از طریق اتصالات اسپلایسینگ به هم متصل میشوند؟
- کدام ایزوفرمهای ترانسکریپت RNA کامل تولید میشوند؟
این مدل ۱۹۶,۶۰۸ جفتباز از توالی ژنوم را با استفاده از حدود ۱۳ میلیون پارامتر (Parameters) قابل آموزش پردازش میکند. آموزش این مدل بهصورت سرتاسری (End-to-End) روی ۳۱۴,۷۴۵ نمونه توالییابی RNA از انسان و ۹ گونه پستاندار دیگر انجام شده که بیش از ۴۶ میلیون اتصال اسپلایسینگ مشاهدهشده را پوشش میدهد.
برای افزایش دقت، آزمایشگاه ۳۳۰ نمونه توالییابی RNA با خوانش بلند (Long-read) از پروژه عمومی ENCODE را ادغام کرد. این اقدام باعث شد مدل بتواند فراوانترین ترانسکریپت را برای ۸۲٪ از ژنهای آزمایشی بازسازی کند، در حالی که این عدد بدون دادههای خوانش بلند ۷۸٪ بود.
مکانیسمهای پیشرفته و تنظیم دقیق
مدل SpliceAI2 از یک چارچوب تنظیم دقیق (Fine-tuning) استفاده میکند که پیشبینیها را بر اساس سطح بیان ۱۴۷ پروتئین متصلشونده به RNA شرطی میکند. این قابلیت به مدل اجازه میدهد تفاوتهای اسپلایسینگ خاص هر بافت را در ۴۸ بافت مختلف (بر اساس دادههای GTEx) با استفاده از ۱۵ میلیون اندازهگیری مصرف سایتهای اسپلایسینگ تفکیکی ثبت کند.
نکته قابل توجه این است که مدل بهطور مستقل موتیفهای توالی را که توسط تنظیمکنندههای واقعی اسپلایسینگ شناسایی میشوند، یاد گرفته است، بدون اینکه صراحتاً این روابط به آن آموزش داده شده باشد. این چارچوب بعدها برای تحلیل وضعیتهای بیماری خاص، از جمله دیستروفی میوتونیک و تومورهای جهشیافته SF3B1، بهینه شد.
محکها و اعتبارسنجی
در مقایسههای مستقیم، SpliceAI2 از مدلهای Pangolin و AlphaGenome متعلق به گوگل دیپمایند پیشی گرفت. تستهای مستقل دانشگاه آکسفورد نشان داد که SpliceAI2 در تشخیص گونههای اسپلایسینگ رمزگونه (Cryptic) در GTEx به امتیاز auPRC برابر با ۰.۷۷ رسید، در حالی که بهترین مدل رقیب امتیاز ۰.۶۶ را کسب کرد.
سایر معیارهای عملکرد عبارتند از:
- همبستگی اسپیرمن ۰.۶۳ در مقابل ۰.۴۷ در کمیسازی مصرف سایت اسپلایسینگ.
- auROC برابر با ۰.۷۶ در مقابل ۰.۷۳ در طبقهبندی جایگاههای صفات کمی اسپلایسینگ.
- همبستگی اسپیرمن ۰.۵۹ در مقابل ۰.۵۵ در محک OpenSplice.
ایلومینا گزارش داد که این مدل کمیسازی مصرف سایتهای اسپلایسینگ را ۳۴٪ نسبت به بهترین مدل رقیب بهبود بخشیده است.
اعتبارسنجی با استفاده از پروژه ۱۰۰,۰۰۰ ژنوم Genomics England روی ۷۵۰۴ فرد نشان داد که مدل ۱۳۳ گونه اضافی را در نسبت شانس ثابت ۲ بازیابی کرد، در حالی که این عدد برای رقیب ۱۱۴ بود. بهطور خاص، SpliceAI2 در بازه اطمینان ۲ برابر، ۳۳٪ و در بازه ۴ برابر، ۶۶٪ گونههای مرتبط با بیماری را بیشتر از نسخه اولیه شناسایی کرد.
اعتبارسنجی در مقیاس جمعیت روی ۶۲۷,۰۰۰ ژنوم از gnomAD، TOPMed و UK Biobank نیز انجام شد. دادههای ۳۶,۷۶۴ شرکتکننده همبستگی پیرسون شدیدی (-۰.۵۰) را بین امتیازات بالای SpliceAI2 و سطوح پایینتر پروتئین پلاسما نشان داد که قویترین همبستگی در میان تمام مدلهای ارزیابیشده بود.
کاربردهای بالینی
کاربرد این مدل در موارد فردی به اثبات رسید، از جمله شناسایی یک گونه فقدان-دهنده PEX1 مرتبط با دیستروفی میله-مخروطی و یک گونه دهنده رمزگونه PKD1 مرتبط با بیماری کیستیک کلیه. تقریباً نیمی از گونههای اسپلایسینگ رمزگونه شناساییشده در مناطق عمیق اینترونیک قرار داشتند؛ گونههایی که بیش از ۵۰ جفتباز در اینترونها هستند و معمولاً توسط توالییابی اگزوم نادیده گرفته میشوند.
در حال حاضر SpliceAI2 در پلتفرم BioInsight، شامل DRAGEN Annotation، Emedgene و Illumina Connected Insights ادغام شده است. برای استفادههای آکادمیک، کد منبع و وزنهای باز (Open Weights) مدل از طریق گیتهاب و Hugging Face در دسترس است و برای نصب از طریق PyPy به یک واحد پردازش گرافیکی (GPU) با قابلیت CUDA نیاز دارد.
طبق مستندات مخزن، امتیاز spliceai2_summary_score بین ۰ تا ۱ است. آستانههای توصیهشده ۰.۱ برای بازخوانی (Recall) بالا، ۰.۲۵ برای تعادل بین دقت و بازخوانی، و ۰.۵ برای دقت (Precision) بالا است.
این چرخش به سمت تحلیل در سطح ترانسکریپت تنها با استفاده از توالیهای DNA، نیاز به دادههای RNA از بافتهایی که نمونهبرداری (بیوپسی) از آنها غیرممکن است را از بین میبرد. ایلومینا با کوچک کردن سیستماتیک بخشهای تفسیرناپذیر ژنوم، به سمتی میرود که «اهمیت نامشخص» به جای یک گلوگاه، به یک اتفاق نادر تبدیل شود.
پژوهشگران اکنون باید فایلهای VCF موجود خود را با پیشبینیهای محاسبهشده SpliceAI2 برای ۴ میلیارد گونه تکنوکلئوتیدی ممکن در بدنههای ژنی انسان و ۱۵۰ میلیون ایندل (Indel) مشاهدهشده در جمعیتهای انسانی ارزیابی کنند تا محرکهای بیماریزای از دست رفته را کشف کنند.
گام بعدی شما
- پژوهشگران ژنتیک باید فایلهای VCF قدیمی خود را با استفاده از مدل SpliceAI2 بازبینی کنند تا گونههای بیماریزای نادیده گرفته شده را بیابند.
- توسعهدهندگان ابزارهای بیوانفورماتیک میتوانند از وزنهای باز مدل در Hugging Face برای ادغام در خط لولههای تحلیل دادههای ژنومیک استفاده کنند.
- بررسی مستندات آستانههای امتیازدهی (۰.۱ تا ۰.۵) برای تنظیم تعادل بین دقت و بازخوانی در پروژههای تشخیص بالینی.
اما تأثیر این مدل بر کاهش هزینههای تشخیص بیماریهای نادر حتی چشمگیرتر است — به تحلیل ما درباره آینده توالییابی نسل سوم مراجعه کنید.




گفتگو