پرش به محتوای اصلی
پرش به محتوای مقاله

«دقت بیشتر در RNA»؛ هدف ایلومینا از معرفی SpliceAI2

·۱۶ مهر ۱۴۰۵۵ دقیقه مطالعه
مدل SpliceAI2 شرکت Illumina برای تفسیر نوع‌گونه‌های اسپلایسی معرفی شد
مدل SpliceAI2 شرکت Illumina برای تفسیر نوع‌گونه‌های اسپلایسی معرفی شد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

توانایی پیش‌بینی دقیق اسپلایسینگ RNA تنها با استفاده از توالی DNA، بدون نیاز به داده‌های RNA بافتی؛ این یعنی حذف یکی از سخت‌ترین موانع عملیاتی در تشخیص بیماری‌های ژنتیکی.

پیدا کردن علت دقیق یک بیماری ژنتیکی نادر اغلب به بن‌بست می‌رسد، زیرا پژوهشگران نمی‌توانند «ماده تاریک» ژنوم را تفسیر کنند. در ۸ اکتبر ۲۰۲۶، شرکت ایلومینا (Illumina) مدل SpliceAI2 را از طریق آزمایشگاه BioInsight AI Lab عرضه کرد که طبق اعلام این شرکت، در تحلیل مجموعه‌داده‌های بیماری‌های نادر، ۱۷٪ گونه‌های مرتبط با بیماری را بیشتر از مدل‌های رقیب شناسایی می‌کند.

تفسیر ژنوم مدت‌هاست با چالش «گونه‌های با اهمیت نامشخص» (Variants of Uncertain Significance) دست‌وپنجه نرم می‌کند؛ جهش‌های ژنتیکی که اثر بیولوژیکی آن‌ها ناشناخته است. در حالی که توالی‌یابی اگزوم سنتی اغلب جهش‌های عمیق در مناطق اینترونیک را نادیده می‌گیرد، SpliceAI2 بر مکانیسم اسپلایسینگ RNA (RNA Splicing) تمرکز می‌کند که برای کشف دارو و پژوهش‌های سرطان ارثی حیاتی است.

زمینه و اهداف راهبردی

به نقل از بیانیه شرکت، SpliceAI2 بخشی از یک مجموعه گسترده‌تر شامل PromoterAI و PrimateAI-3D است. این ابزارها در کنار هم به پژوهشگران اجازه می‌دهند تا تعداد گونه‌های دارای اثر بیولوژیکی پیش‌بینی‌شده را تا دو برابر افزایش دهند. همان‌طور که در تحلیل‌های پیشین ما درباره مدل‌های بنیادی بیولوژیک اشاره کردیم، هدف نهایی این است که بخش‌های تفسیرناپذیر ژنوم به حداقل برسد.

رامی مهیو، نایب‌رئیس ارشد BioInsight، تأکید کرد که پیش‌بینی اثر گونه‌ها اولویت اصلی این آزمایشگاه است. کایل فار، معاون این مرکز، بیان کرد که ایلومینا در حال پیشبرد هوش مصنوعی است تا به‌طور سیستماتیک سهمی از ژنوم را که غیرقابل تفسیر باقی مانده، کوچک کند.

مدل SpliceAI2 جایگزین نسخه اولیه SpliceAI شد که در سال ۲۰۱۹ عرضه شده بود. مدل نسل اول در بیش از ۳۴۰۰ مقاله علمی مورد استناد قرار گرفت و در توصیه‌های تفسیر گونه‌های اسپلایسینگ توسط ClinGen استفاده شد. مدل جدید بر روی مجموعه‌داده‌ای آموزش دیده است که بیش از ۱۰۰ برابر بزرگ‌تر از نسل پیشین خود است.

معماری فنی و آموزش

برخلاف نسخه ۲۰۱۹، SpliceAI2 تنها پیش‌بینی نمی‌کند که آیا یک سلول در موقعیتی خاص اسپلایسینگ انجام می‌دهد یا خیر، بلکه به سه پرسش پیچیده پاسخ می‌دهد:

  • کدام موقعیت‌ها در یک ژن به عنوان سایت‌های اسپلایسینگ عمل می‌کنند و با چه فرکانسی؟
  • کدام سایت‌های اسپلایسینگ از طریق اتصالات اسپلایسینگ به هم متصل می‌شوند؟
  • کدام ایزوفرم‌های ترانسکریپت RNA کامل تولید می‌شوند؟

این مدل ۱۹۶,۶۰۸ جفت‌باز از توالی ژنوم را با استفاده از حدود ۱۳ میلیون پارامتر (Parameters) قابل آموزش پردازش می‌کند. آموزش این مدل به‌صورت سرتاسری (End-to-End) روی ۳۱۴,۷۴۵ نمونه توالی‌یابی RNA از انسان و ۹ گونه پستاندار دیگر انجام شده که بیش از ۴۶ میلیون اتصال اسپلایسینگ مشاهده‌شده را پوشش می‌دهد.

برای افزایش دقت، آزمایشگاه ۳۳۰ نمونه توالی‌یابی RNA با خوانش بلند (Long-read) از پروژه عمومی ENCODE را ادغام کرد. این اقدام باعث شد مدل بتواند فراوان‌ترین ترانسکریپت را برای ۸۲٪ از ژن‌های آزمایشی بازسازی کند، در حالی که این عدد بدون داده‌های خوانش بلند ۷۸٪ بود.

مکانیسم‌های پیشرفته و تنظیم دقیق

مدل SpliceAI2 از یک چارچوب تنظیم دقیق (Fine-tuning) استفاده می‌کند که پیش‌بینی‌ها را بر اساس سطح بیان ۱۴۷ پروتئین متصل‌شونده به RNA شرطی می‌کند. این قابلیت به مدل اجازه می‌دهد تفاوت‌های اسپلایسینگ خاص هر بافت را در ۴۸ بافت مختلف (بر اساس داده‌های GTEx) با استفاده از ۱۵ میلیون اندازه‌گیری مصرف سایت‌های اسپلایسینگ تفکیکی ثبت کند.

نکته قابل توجه این است که مدل به‌طور مستقل موتیف‌های توالی را که توسط تنظیم‌کننده‌های واقعی اسپلایسینگ شناسایی می‌شوند، یاد گرفته است، بدون اینکه صراحتاً این روابط به آن آموزش داده شده باشد. این چارچوب بعدها برای تحلیل وضعیت‌های بیماری خاص، از جمله دیستروفی میوتونیک و تومورهای جهش‌یافته SF3B1، بهینه شد.

محک‌ها و اعتبارسنجی

در مقایسه‌های مستقیم، SpliceAI2 از مدل‌های Pangolin و AlphaGenome متعلق به گوگل دیپ‌مایند پیشی گرفت. تست‌های مستقل دانشگاه آکسفورد نشان داد که SpliceAI2 در تشخیص گونه‌های اسپلایسینگ رمزگونه (Cryptic) در GTEx به امتیاز auPRC برابر با ۰.۷۷ رسید، در حالی که بهترین مدل رقیب امتیاز ۰.۶۶ را کسب کرد.

سایر معیارهای عملکرد عبارتند از:

  • همبستگی اسپیرمن ۰.۶۳ در مقابل ۰.۴۷ در کمی‌سازی مصرف سایت اسپلایسینگ.
  • auROC برابر با ۰.۷۶ در مقابل ۰.۷۳ در طبقه‌بندی جایگاه‌های صفات کمی اسپلایسینگ.
  • همبستگی اسپیرمن ۰.۵۹ در مقابل ۰.۵۵ در محک OpenSplice.

ایلومینا گزارش داد که این مدل کمی‌سازی مصرف سایت‌های اسپلایسینگ را ۳۴٪ نسبت به بهترین مدل رقیب بهبود بخشیده است.

اعتبارسنجی با استفاده از پروژه ۱۰۰,۰۰۰ ژنوم Genomics England روی ۷۵۰۴ فرد نشان داد که مدل ۱۳۳ گونه اضافی را در نسبت شانس ثابت ۲ بازیابی کرد، در حالی که این عدد برای رقیب ۱۱۴ بود. به‌طور خاص، SpliceAI2 در بازه اطمینان ۲ برابر، ۳۳٪ و در بازه ۴ برابر، ۶۶٪ گونه‌های مرتبط با بیماری را بیشتر از نسخه اولیه شناسایی کرد.

اعتبارسنجی در مقیاس جمعیت روی ۶۲۷,۰۰۰ ژنوم از gnomAD، TOPMed و UK Biobank نیز انجام شد. داده‌های ۳۶,۷۶۴ شرکت‌کننده همبستگی پیرسون شدیدی (-۰.۵۰) را بین امتیازات بالای SpliceAI2 و سطوح پایین‌تر پروتئین پلاسما نشان داد که قوی‌ترین همبستگی در میان تمام مدل‌های ارزیابی‌شده بود.

کاربردهای بالینی

کاربرد این مدل در موارد فردی به اثبات رسید، از جمله شناسایی یک گونه فقدان-دهنده PEX1 مرتبط با دیستروفی میله-مخروطی و یک گونه دهنده رمزگونه PKD1 مرتبط با بیماری کیستیک کلیه. تقریباً نیمی از گونه‌های اسپلایسینگ رمزگونه شناسایی‌شده در مناطق عمیق اینترونیک قرار داشتند؛ گونه‌هایی که بیش از ۵۰ جفت‌باز در اینترون‌ها هستند و معمولاً توسط توالی‌یابی اگزوم نادیده گرفته می‌شوند.

در حال حاضر SpliceAI2 در پلتفرم BioInsight، شامل DRAGEN Annotation، Emedgene و Illumina Connected Insights ادغام شده است. برای استفاده‌های آکادمیک، کد منبع و وزن‌های باز (Open Weights) مدل از طریق گیت‌هاب و Hugging Face در دسترس است و برای نصب از طریق PyPy به یک واحد پردازش گرافیکی (GPU) با قابلیت CUDA نیاز دارد.

طبق مستندات مخزن، امتیاز spliceai2_summary_score بین ۰ تا ۱ است. آستانه‌های توصیه‌شده ۰.۱ برای بازخوانی (Recall) بالا، ۰.۲۵ برای تعادل بین دقت و بازخوانی، و ۰.۵ برای دقت (Precision) بالا است.

این چرخش به سمت تحلیل در سطح ترانسکریپت تنها با استفاده از توالی‌های DNA، نیاز به داده‌های RNA از بافت‌هایی که نمونه‌برداری (بیوپسی) از آن‌ها غیرممکن است را از بین می‌برد. ایلومینا با کوچک کردن سیستماتیک بخش‌های تفسیرناپذیر ژنوم، به سمتی می‌رود که «اهمیت نامشخص» به جای یک گلوگاه، به یک اتفاق نادر تبدیل شود.

پژوهشگران اکنون باید فایل‌های VCF موجود خود را با پیش‌بینی‌های محاسبه‌شده SpliceAI2 برای ۴ میلیارد گونه تک‌نوکلئوتیدی ممکن در بدنه‌های ژنی انسان و ۱۵۰ میلیون ایندل (Indel) مشاهده‌شده در جمعیت‌های انسانی ارزیابی کنند تا محرک‌های بیماری‌زای از دست رفته را کشف کنند.

گام بعدی شما

  • پژوهشگران ژنتیک باید فایل‌های VCF قدیمی خود را با استفاده از مدل SpliceAI2 بازبینی کنند تا گونه‌های بیماری‌زای نادیده گرفته شده را بیابند.
  • توسعه‌دهندگان ابزارهای بیوانفورماتیک می‌توانند از وزن‌های باز مدل در Hugging Face برای ادغام در خط لوله‌های تحلیل داده‌های ژنومیک استفاده کنند.
  • بررسی مستندات آستانه‌های امتیازدهی (۰.۱ تا ۰.۵) برای تنظیم تعادل بین دقت و بازخوانی در پروژه‌های تشخیص بالینی.

اما تأثیر این مدل بر کاهش هزینه‌های تشخیص بیماری‌های نادر حتی چشمگیرتر است — به تحلیل ما درباره آینده توالی‌یابی نسل سوم مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار علمی پروژه ENCODE و داده‌های عظیم جمعیت، نرخ تشخیص بیماری‌های نادر را به‌طور ملموسی افزایش می‌دهد. این پیشرفت باعث می‌شود تشخیص‌های پزشکی از حالت حدس و گمان درباره گونه‌های نامشخص خارج شده و به تصمیمات داده‌محور تبدیل شود.

تأثیر برای ایران

این ابزار برای پژوهشگران ژنتیک و بیوانفورماتیک در ایران که به داده‌های RNA دسترسی محدودی دارند، فرصتی برای تحلیل دقیق‌تر داده‌های DNA موجود است. دسترسی به مدل از طریق Hugging Face، مسیر ادغام آن در پروژه‌های تحقیقاتی داخلی را تسهیل می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز ایلومینا بر حذف «ماده تاریک» ژنوم نشان می‌دهد که رقابت در بیوانفورماتیک از توالی‌یابی ساده به سمت تفسیر معنایی عمیق حرکت کرده است. حذف نیاز به داده‌های RNA برای پیش‌بینی اسپلایسینگ، یک جهش عملیاتی است که دسترسی به تشخیص‌های دقیق را از آزمایشگاه‌های مجهز به بیوپسی به هر کلینیکی که توالی DNA دارد گسترش می‌دهد. این مدل در واقع نقش یک مترجم را ایفا می‌کند که زبان رمزگذاری شده در مناطق غیرکدکننده را به اثرات بالینی ترجمه می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.