پرش به محتوای اصلی
پرش به محتوای مقاله

چطور PISA نویزهای محیطی را از مدل‌های ژنومیک حذف می‌کند؟

·۴ شهریور ۱۴۰۵۴ دقیقه مطالعه
روش هوش مصنوعی محتوای یادگیری مدل‌های ژنومی از DNA را آشکار و سوگیری پنهان آزمایشی را فاش می‌کند.
روش هوش مصنوعی محتوای یادگیری مدل‌های ژنومی از DNA را آشکار و سوگیری پنهان آزمایشی را فاش می‌کند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متد PISA که برخلاف ابزارهای قبلی، اثرات مثبت و منفی سوگیری را خنثی نمی‌کند، بلکه آن‌ها را با رزولوشن بالا تفکیک کرده و اجازه می‌دهد نویز آزمایشگاهی به‌صورت ریاضی از سیگنال بیولوژیکی تفریق شود.

تصور کنید یک میکروسکوپ داشته باشید که نه تنها تصویر را بزرگ می‌کند، بلکه لایه‌های غبار روی لنز را به‌صورت ریاضی حذف می‌کند تا حقیقتِ زیرین را ببیند. متد PISA (تخصیص اثر توالی به‌صورت جفتی یا Pairwise Influence by Sequence Attribution) دقیقاً همین کار را برای مدل‌های شبکه عصبی (Neural Network) در حوزه ژنومیک انجام می‌دهد. در حالی که شبکه‌های عصبی توالی-به-عملکرد برای مدت‌ها به عنوان «جعبه‌های سیاه» عمل می‌کردند، این روش جدید آن‌ها را به نقشه‌هایی با رزولوشن بالا از اثرات بیولوژیکی تبدیل می‌کند.

به نقل از مؤسسه تحقیقات پزشکی Stowers، این تکنیک اجازه می‌دهد مدل‌های یادگیری عمیق به‌صورت «باز-به-باز» (base-by-base) بازرسی شوند تا سوگیری‌های پنهان آزمایشگاهی از داده‌های ژنومیک حذف گردند. مدل‌های ژنومیک معمولاً نتایجی مانند اتصال فاکتورهای رونویسی یا سازماندهی نوکلئوزوم‌ها را از روی DNA خام پیش‌بینی می‌کنند، اما به‌ندرت توضیح می‌دهند که «چرا» یک پیش‌بینی خاص صورت گرفته است. PISA این مشکل را با ردیابی یک پیش‌بینی در یک موقعیت دقیق ژنومیکی و بازگرداندن آن به تمام بازهای دیگر که بر آن اثر گذاشته‌اند حل می‌کند و بدین ترتیب یک نقشه دوبعدی از ویژگی‌های آموخته‌شده ایجاد می‌کند.

طبق مقاله‌ای که در اوت ۲۰۲۶ در نشریه Nature Communications منتشر شد و در ۲۵ اوت ۲۰۲۶ توسط مؤسسه اعلام گردید، این مطالعه توسط جولیا زایتلینگر در Stowers و با همکاری آنشول کوندaje از دانشگاه استنفورد هدایت شده است. این همکاری با رویکردهای پیشرو در استنفورد همسو است، جایی که پژوهشگران از هوش مصنوعی برای طراحی دقیق ساختارهای بیولوژیکی استفاده می‌کنند؛ برای مثال، طراحی ویروس‌های هدفمند توسط AI گامی در جهت کنترل دقیق‌تر تعاملات بیولوژیکی است. چارلز مک‌آنانی، پژوهشگر AI در Stowers، نویسنده اول این مقاله است. PISA در محیط BPReveal عمل می‌کند که توسعه‌ای از چارچوب BPNet است و نخستین بار در سال ۲۰۲۱ توسط این تیم معرفی شد.

زمینه و توسعه

توسعه PISA از یک مسیر دقیق تکرار و بازبینی همتا عبور کرد. پیش‌نویس این اثر ابتدا در ۸ آوریل ۲۰۲۵ در bioRxiv منتشر شد. در جریان فرآیند بازبینی همتا، تیم پژوهشی دامنه تحقیقات خود را گسترش داد؛ به گونه‌ای که تحلیل‌های مربوط به دامنه‌های کروماتین پس از انتشار نسخه اصلاح‌شده در ۵ ژانویه ۲۰۲۶ به مقاله اضافه شد.

این دستاورد در زمانی رخ می‌دهد که صنعت به شدت روی مدل‌های توالی بزرگ‌تر سرمایه‌گذاری می‌کند. برای مثال، AlphaGenome گوگل دیپ‌مایند که در اوایل ۲۰۲۶ منتشر شد و در مقدمه مقاله PISA به آن استناد شده است، اثرات متغیرهای تنظیمی را در سراسر ژنوم پیش‌بینی می‌کند. در حالی که AlphaGenome بر «پیش‌بینی» متمرکز است، PISA بر «تفسیر» تأکید دارد؛ یعنی درک این موضوع که مدل واقعاً از کدام ویژگی‌های توالی برای رسیدن به نتیجه استفاده کرده است.

حذف نویزهای آزمایشگاهی

تیم پژوهشی PISA را روی MNase-seq آزمایش کردند؛ آزمونی که برای نقشه‌برداری از نوکلئوزوم‌ها (ساختارهایی که هنگام پیچیدن DNA دور پروتئین‌های هیستون شکل می‌گیرند) استفاده می‌شود. در این آزمایش، از یک آنزیم برای بریدن DNAهای در معرض قرار گرفته استفاده می‌شود، در حالی که DNAهای محافظت‌شده توسط نوکلئوزوم دست‌نخورده باقی می‌مانند. با این حال، این آنزیم برخی توالی‌ها را به دیگران ترجیح می‌دهد، به این معنا که داده‌های حاصل شامل دو سیگنال هم‌پوشان هستند: واقعیت بیولوژیکی و سوگیری آزمایشگاهی.

ابزارهای تفسیری پیشین، این اثرات را در مقادیر تک‌بعدی ادغام می‌کردند و باعث می‌شد اثرات مثبت و منفی یکدیگر را خنثی کرده و در نهایت ناپدید شوند. اما PISA رزولوشن کامل را حفظ می‌کند و اجازه می‌دهد ترجیحات توالیِ آنزیم به‌صورت یک اثر انگشت مجزا ظاهر شود. جولیا زایتلینگر این قابلیت را به «میکروسکوپ فراتفکیک‌پذیری» (Super-resolution microscopy) تشبیه کرد و اشاره کرد که افزودن پیکسل‌ها به پژوهشگران اجازه می‌دهد چیزهایی را ببینند که پیش از این نامرئی بودند.

پژوهشگران توانستند مراحل زیر را اجرا کنند:

  • استخراج ریاضی اثر سوگیری (Bias Signature) از نقشه‌ها.
  • آموزش یک مدل مجزا که تنها بر روی داده‌های سوگیری متمرکز باشد.
  • تفریق آن سوگیری از مدل اصلی برای رسیدن به مدل دومی که فقط بیولوژی زیرین را آموخته است.

کشف بیولوژی پنهان

پس از حذف سوگیری، PISA توالی‌های DNA را آشکار کرد که نوکلئوزوم‌ها را با اثراتی مکان‌یابی می‌کنند که تا صدها باز در هر دو جهت گسترش می‌یابند. بسیاری از این اثرات نامتقارن بودند، به این معنا که یک سمت توالی را متفاوت از سمت دیگر تحت تأثیر قرار می‌دادند.

این نامتقارنی منجر به کشف هزاران مرز دامنه‌ی کروماتین شد؛ مرزهایی که تعیین می‌کنند کدام توالی‌های تنظیمی به کدام ژن‌ها دسترسی داشته باشند. این مرزها معمولاً با روش‌های سه-بعدی کروماتین که نیاز به عمق توالی‌یابی بسیار بالایی دارند نقشه‌برداری می‌شوند، اما PISA آن‌ها را تنها از داده‌های نوکلئوزوم و اغلب با دقتی بالاتر از داده‌های سه-بعدی استخراج کرد.

برای اعتبارسنجی این یافته‌ها، تیم اقدامات زیر را انجام داد:

  • استفاده از مدل‌های بیولوژی‌محور برای طراحی توالی‌های DNA مصنوعی.
  • پیش‌بینی پیکربندی‌های خاص نوکلئوزوم برای این طراحی‌های مصنوعی.
  • تست تجربی زیرمجموعه‌ای از این طراحی‌ها در آزمایشگاه برای تأیید اینکه پیش‌بینی‌ها درست بوده‌اند.

محدودیت‌های فنی و کاربردها

از منظر فنی، این دستاورد فرضیات میدان را درباره «داده‌های پاک» تغییر می‌دهد. ثابت شد که نویزهای ظاهری در مجموعه‌داده‌های ژنومیک، در واقع ترکیبی از سوگیری و بیولوژی پنهان هستند که می‌توان آن‌ها را از طریق تخصیص با رزولوشن بالا تفکیک کرد. اکنون گلوگاه اصلی دیگر قدرت محاسباتی نیست، بلکه کمبود آزمایشگاه‌هایی است که هم در یادگیری عمیق و هم در بیولوژی تجربی تسلط داشته باشند.

در حالی که پژوهشگران اشاره کردند که شناسایی یک متغیر در مرز دامنه، بیشتر یک «مکانیسم» را پیشنهاد می‌دهد تا یک «دارو»، اما توانایی بازرسی و اصلاح مدل‌های ژنومیک، چارچوب جدیدی برای بیولوژی مصنوعی فراهم می‌کند. نویسندگان صراحتاً ذکر کردند که این یک مقاله متدولوژی و ژنومیک است و ارتباط با بیماری‌ها، مسیر آینده است نه نتیجه فعلی.

این متد حتی از آزمایشگاه زایتلینگر فراتر رفته است. این روش توسط یکی از همکاران در یک بسته نرم‌افزاری مجزا پیاده‌سازی شده و توسط نِشِت اوزل، عصب‌شناس مؤسسه Stowers، برای پاسخ به یک پرسش بیولوژیکی متفاوت به کار گرفته شده است.

گام بعدی شما

  • بررسی مستندات BPReveal برای درک نحوه پیاده‌سازی تخصیص اثر در مدل‌های توالی.
  • تحلیل مجدد مجموعه‌داده‌های قدیمی ژنومیک با متد PISA برای یافتن سیگنال‌های بیولوژیکی که پیش‌تر «نویز» تلقی می‌شدند.
  • دنبال کردن ادغام PISA در سایر چارچوب‌های توالی-به-عملکرد برای شناسایی سوگیری‌های مشابه در سایر آزمون‌های ژنومیک.

اما تأثیر این دقت در شناسایی متغیرهای ژنتیکی بر توسعه داروهای شخصی‌سازی‌شده حتی حیاتی‌تر است — به تحلیل ما درباره‌ی مدل‌های پیش‌بینی پروتئین مراجعه کنید.

چرا این موضوع مهم است؟

این متد با تکیه بر اعتبار علمی نشریه Nature Communications، ابزاری برای حذف خطاهای سیستماتیک آزمایشگاهی فراهم می‌کند که پیش از این مانع از درک دقیق مکانیسم‌های ژنتیکی بود. این تغییر در تفسیرپذیری، دقت نقشه‌برداری از ژنوم را بدون نیاز به سخت‌افزارهای گران‌قیمت افزایش می‌دهد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و بیوانفورماتیک در ایران اهمیت دارد تا بازار مصرف؛ چرا که متدولوژی‌های بازمنبعی مانند PISA فرصتی برای ارتقای تحلیل داده‌های ژنومیک در مراکز تحقیقاتی داخلی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

این دستاورد نشان می‌دهد که در داده‌های بیولوژیکی، «نویز» لزوماً به معنای داده‌های بی‌ارزش نیست، بلکه می‌تواند حاوی اطلاعات ساختاری باشد که مدل‌های ساده‌تر قادر به تفکیک آن نیستند. PISA با تبدیل مدل از یک پیش‌بین به یک ابزار تشریحی، پارادایم آموزش مدل‌های ژنومیک را از «بیشترین داده» به «دقیق‌ترین تفکیک» تغییر می‌دهد. به نظر ما، این رویکرد در آینده به استانداردی برای هر مدلی تبدیل می‌شود که با داده‌های آزمایشگاهیِ دارای سوگیری (Bias) سروکار دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.