پرش به محتوای اصلی
پرش به محتوای مقاله

آیا تحلیل اسکن‌های مغزی می‌تواند تصاویر دیده‌شده توسط انسان را بازسازی کند؟

·۹ مهر ۱۴۰۵۷ دقیقه مطالعه
ابزار هوش مصنوعی تصویر ذهنی را از روی اسکن مغز بازسازی می‌کند
ابزار هوش مصنوعی تصویر ذهنی را از روی اسکن مغز بازسازی می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ساخت نخستین رمزگشای جهانی مغز که نیاز به داده‌های کالیبراسیون را ۹۷٪ کاهش داده و می‌تواند تصاویر را با دقت ساختاری (نه فقط تشخیص کلی) بازسازی کند.

تصور کنید روزی برسد که پزشکان بتوانند دقیقاً همان تصویری را که در ذهن یک بیمار فلج است، روی نمایشگر ببینند. این رویای علمی-تخیلی اکنون به دلیل یک ابزار جدید رمزگشایی از مغز، به واقعیت نزدیک‌تر شده است.

طبق اعلام مؤسسه علمی وایزمن (Weizmann Institute of Science) در رهووت اسرائیل، تیمی به سرپرستی میکال ایرانی سیستمی ساخته است که می‌تواند ساختار و موقعیت واقعی یک ورودی بصری را بازسازی کند. در حالی که اکثر ابزارهای تصویربرداری مغزی صرفاً اشیاء را شناسایی می‌کنند، این ابزار با تحلیل اسکن‌های مغزی، حدس می‌زند که فرد به چه چیزی نگاه می‌کند و آن تصویر را با دقتی خیره‌کننده بازسازی می‌کند. جالب‌تر اینکه این سیستم به‌صورت معکوس نیز عمل می‌کند؛ یعنی می‌تواند فعالیت مغزی فرد را بر اساس تصویری که در حال مشاهده آن است، پیش‌بینی کند.

سال‌هاست که عصب‌شناسان برای رمزگشایی از ذهن انسان تلاش می‌کنند، اما نتایج اولیه اغلب تار، مبهم و غیرقابل تشخیص بود. در این مسیر، این حوزه همواره با یک تضاد یا سبک-سنگین کردن (trade-off) میان وضوح اسکن‌ها و حجم عظیم داده‌های مورد نیاز برای آموزش مدل برای هر فرد خاص دست‌وپنجه نرم می‌کرد. همان‌طور که پیش‌تر در پوشش خبری خود درباره رقابت‌های بقای عوامل هوش مصنوعی برای یافتن توجیه تجاری و جذب مشتریان پرداخت، این پژوهش اکنون به سراغ بنیادی‌ترین مرز بیولوژیکی رفته است: رابط میان فعالیت‌های عصبی و تصاویر دیجیتال. این تلاش برای درک آگاهی و پردازش ذهنی، در کنار پژوهش‌های دیگری قرار می‌گیرد که در آن عامل‌های هوش مصنوعی به‌طور مستقل دربارهٔ وجود خود پرسیدند و مرزهای ادراک ماشین را به چالش کشیدند.

تکامل تکنولوژیک و زمینه پژوهش

تلاش‌ها برای بازسازی تصاویر ذهنی سال‌هاست که جریان دارد. تلاش‌های اولیه تصاویری تولید می‌کرد که درک آن‌ها بسیار دشوار بود. پیشرفت‌های اخیر از دو جبهه رخ داده است: بهبود خودِ اسکن‌های fMRI و ارتقای ابزارهای هوش مصنوعی که برای تفسیر نتایج به کار می‌روند.

تکنولوژی fMRI (تصویربرداری تشدیدی مغناطیسی عملکردی) از یک آهنربای غول‌پیکر برای ردیابی جریان خون اکسیژن‌دار در مغز استفاده می‌کند. مناطقی که در اسکن «روشن» می‌شوند، به عنوان مناطق فعال در نظر گرفته می‌شوند. با این حال، این اسکن‌ها معمولاً دقت بسیار بالایی ندارند. در اسکنرهای استاندارد، یک واحد کوچک از فعالیت یا «وکسل» (voxel) حدود ۳ میلی‌متر مکعب است و تقریباً ۱۶ هزار نورون را در بر می‌گیرد.

تیم میکال ایرانی از مجموعه‌داده‌های جدیدتری استفاده کرد که با اسکنرهای با وضوح (Resolution) بالاتر جمع‌آوری شده بودند. در این داده‌ها، هر وکسل تنها ۱ میلی‌متر مکعب از نورون‌ها را پوشش می‌دهد. این افزایش جزئیات (Granularity) به هوش مصنوعی اجازه می‌دهد تا تفاوت‌های ظریف‌تر فعال‌سازی عصبی را تشخیص دهد و از شناسایی ساده اشیاء فراتر رود. برای مثال، در حالی که مدل‌های قبلی می‌توانستند تشخیص دهند که تصویر یک «موز» است، اما قادر نبودند ساختار دقیق آن یا موقعیت آن را در میدان دید فرد بازسازی کنند. این رویکرد یادگیری بصری، شباهت‌های ساختاری با مدل‌هایی دارد که با تخیل بصری داخلی گره‌های استدلال فضایی هوش مصنوعی را گشودند.

سازوکار رمزگشای مغز

ابزار هوش مصنوعی تصویر ذهنی را از اسکن مغز بازسازی می‌کند

پژوهشگران برای رسیدن به این دقت بالا، یک «رمزگشای مغزی» (Brain Decoder) با دو شاخه مجزا طراحی کردند:

  • پیش‌بینی ساختار (Structure Prediction): این شاخه چیدمان فضایی تصویر را تعیین می‌کند؛ مثلاً اینکه رنگ‌های خاص در کجای تصویر قرار گرفته‌اند.
  • پیش‌بینی محتوا (Content Prediction): این شاخه اشیای واقعی موجود در تصویر را شناسایی می‌کند؛ مثلاً تشخیص اینکه تصویر «دسته‌ای موز روی یک بشقاب» است.

خروجی این پیش‌بینی‌ها به یک مدل انتشار (Diffusion Model) تزریق می‌شود. مدل‌های انتشار نوعی از هوش مصنوعی هستند که بیشتر به دلیل خلق ویدیو و تصویر از طریق پاک‌سازی تدریجی یک توده نویزی از پیکسل‌ها شناخته می‌شوند. این فرآیند به سیستم اجازه می‌دهد تا بازنمایی بسیار دقیق‌تری از آنچه فرد واقعاً دیده است، تولید کند.

حل معضل کمبود داده

یکی از بزرگ‌ترین موانع در حوزه Neuro-AI، کمبود داده‌های جفت‌شده (تصاویری که با اسکن‌های مغزی متناظر باشند) است. تیم ایرانی برای دور زدن این مشکل، یک سیستم دو-مدلی توسعه داد. آن‌ها ابتدا مدل را روی داده‌های موجود از ۸ نفر آموزش دادند که هر کدام حدود ۹ هزار تصویر را هنگام حضور در یک اسکنر fMRI با وضوح بالا تماشا کرده بودند.

سپس آن‌ها یک «رمزگذار» (Encoder) ساختند که فعالیت مغزی را بر اساس یک تصویر پیش‌بینی می‌کند، و یک «رمزگشا» (Decoder) که دقیقاً برعکس این کار را انجام می‌دهد. با آموزش این مدل‌ها در یک حلقه (Loop)، تیم توانست از تصاویری استفاده کند که هرگز در واقعیت به هیچ انسانی در اسکنر نشان داده نشده بود. این فرآیند به ترتیب زیر عمل می‌کند:

۱. با یک تصویر جدید شروع می‌شود (مثلاً تصویر یک پلنگ).
۲. از رمزگذار استفاده می‌شود تا پیش‌بینی کند که اسکن fMRI مغز برای آن تصویر چگونه خواهد بود.
۳. از رمزگشا استفاده می‌شود تا تصویر را از روی آن اسکن پیش‌بینی‌شده بازسازی کند.

از طریق آموزش‌های مکرر، این مدل‌ها به طرز چشمگیری بهبود می‌یابند. به گفته پژوهشگران، تقریباً ۷۰٪ از داده‌های آموزشی آن‌ها از تصاویری بود که در ابتدا با اسکن‌های fMRI جفت نشده بودند. این حلقه سنتتیک به مدل اجازه داد تا الگوهای کلی نحوه پردازش اطلاعات بصری توسط مغز انسان را بیاموزد.

نقشه‌برداری جهانی از مغز

تیم با ترکیب داده‌های چندین مطالعه مختلف، مناطقی از مغز را شناسایی کرد که عملکردهای مشترکی در افراد مختلف دارند. آن‌ها کشف کردند مناطقی خاص در مغز وجود دارد که به طور مداوم به تصاویر غذا واکنش می‌دهند، در حالی که مناطق دیگر به تصاویر ورزشی پاسخ می‌دهند.

این کشف منجر به ساخت یک «رمزگذار جهانی مغز» (Universal Brain Encoder) شد که می‌تواند روی اسکن یک فرد جدید با کمترین میزان کالیبراسیون کار کند. به طور سنتی، بازسازی تصاویر از مغز یک سوژه جدید، به حدود ۴۰ ساعت داده fMRI نیاز داشت. با توجه به اینکه هزینه تصویربرداری fMRI بین ۶۰۰ تا ۱۰۰۰ دلار در هر ساعت است، این فرآیند برای اکثر مطالعات از نظر مالی و جسمی غیرممکن بود.

رمزگشای ایرانی این نیاز را به تنها ۱ ساعت داده کاهش داد. این بهره‌وری، ابزار مذکور را برای استفاده‌های بالینی گسترده‌تر و تحقیقات علمی سریع‌تر کاربردی می‌کند. این یافته‌ها ماه گذشته در کنفرانس علوم اعصاب محاسباتی شناختی (Cognitive Computational Neuroscience) در نیویورک ارائه شد.

محدودیت‌ها و شکست‌ها

این سیستم هنوز کامل نیست. میکال ایرانی در یک تماس تصویری (Zoom) به شکست‌های خاصی اشاره کرد؛ مثلاً در یک مورد، مدل یک «کیک» را به شکل توده‌ای از «سه ساندویچ» بازسازی کرد. در موردی دیگر، تصویری از یک «سگ در وان حمام» به اشتباه به عنوان یک «بز در وان حمام» تفسیر شد. با وجود این خطاها، تیم گزارش داده است که نتایج آن‌ها با اختلاف قابل توجهی از مدل‌های پیشرو (State-of-the-art) پیشین بهتر است.

کاربردهای درمانی و آینده

ایرانی اکنون در حال برنامه‌ریزی است تا از تصاویر ایستا فراتر رفته و وارد حوزه ویدیو و صدا شود. هدف نهایی این است که بتوان آنچه مردم به آن فکر می‌کنند، تصور می‌کنند یا حتی در خواب می‌بینند را بازسازی کرد. اگرچه توانایی بازسازی محتوای رویاها هنوز وجود ندارد، اما تیم در تلاش است تا به این هدف دست یابد.

پتانسیل‌های درمانی این فناوری بسیار زیاد است:

  • سندرم محبوس شدن (Locked-in Syndrome): این ابزار می‌تواند به افرادی که کاملاً فلج هستند اجازه دهد تنها با استفاده از فعالیت‌های مغزی خود ارتباط برقرار کنند.
  • پژوهش‌های روان‌شناختی: دانشمندان می‌توانند از آن برای گشودن رمز و رازهای ذهن استفاده کنند؛ مثلاً بصری کردن اینکه فلش‌بک‌های PTSD (اختلال استرس پس از سانحه) در واقع چگونه به نظر می‌رسند.
  • درمان‌های عصبی: جودی ایلس، متخصص اخلاق عصبی و استاد نورولوژی در دانشگاه بریتیش کلمبیا، پتانسیل درمانی این ابزار برای افرادی با شرایط عصبی را «بسیار هیجان‌انگیز» توصیف می‌کند. در این راستا، بحث بر سر نیاز مدل‌های هوش مصنوعی به استانداردهای سخت‌گیرانه داروسازی برای افزایش دقت بالینی اهمیت بیشتری می‌یابد تا ایمنی بیماران تضمین شود.

اخلاقیات و حریم خصوصی ذهنی

در حالی که پتانسیل درمانی بالا است، ریسک‌های حریم خصوصی بسیار تکان‌دهنده است. تامی اسپراگ، عصب‌شناس دانشگاه کالیفرنیا در سانتا باربارا، هشدار می‌دهد که توانایی استخراج پنهانی افکار می‌تواند کابوس‌های علمی-تخیلی ۱۵۰ سال پیش را به واقعیت تبدیل کند. او معتقد است این رویکرد احتمالاً برای پیش‌بینی تصاویری که فرد به آن‌ها فکر می‌کند (حتی اگر در حال تماشای آن‌ها نباشد) نیز به خوبی عمل خواهد کرد.

مارسلو اینکا از دانشگاه فنی مونیخ اشاره می‌کند که حرکت به سمت EEG (الکتروانسفالوگرافی) یک «تغییر بازی» (Gamechanger) خواهد بود. برخلاف آهنرباهای حجیم fMRI، دستگاه‌های EEG از کلاه‌های پوشیدنی حاوی الکترود یا حتی هدفون برای اندازه‌گیری فعالیت الکتریکی مغز استفاده می‌کنند. هنگامی که این دستگاه‌ها با مغز کاربر کالیبره شوند، شرکت‌ها می‌توانند بدون رضایت صریح کاربر، اطلاعات را استخراج کنند.

اینکا همچنین هشدار می‌دهد که دادگاه‌ها ممکن است در نهایت اجازه دهند بازسازی‌های تصاویر ذهنی به عنوان مدرک قانونی استفاده شوند. او خاطرنشان می‌کند که اگرچه این پژوهش با نیت خیر انجام شده، اما می‌تواند برای «مصارف تجاری مشکل‌ساز از نظر اخلاقی و اجتماعی» به کار گرفته شود. میکال ایرانی با پذیرش پتانسیل سوءاستفاده در مورد EEG، همچنان بر کاربردهای مثبت تمرکز دارد و می‌گوید: «من سعی می‌کنم فقط به چیزهای خوب فکر کنم.»

گام بعدی شما

  • اگر در حوزه سلامت دیجیتال یا BCI فعالیت می‌کنید، مقالات مربوط به «Universal Brain Encoder» را دنبال کنید تا با استانداردهای جدید کالیبراسیون آشنا شوید.
  • بررسی کنید که چگونه مدل‌های انتشار (Diffusion Models) در حال تبدیل شدن به لایه نهایی برای تبدیل داده‌های حسگر به تصویر هستند.
  • درباره قوانین حریم خصوصی داده‌های بیومتریک در منطقه خود مطالعه کنید، زیرا استخراج داده‌های ذهنی به زودی به یک چالش حقوقی تبدیل می‌شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ برای درک اینکه چگونه تراشه‌های جدید پردازش عصبی این سرعت را ممکن می‌کنند، تحلیل ما درباره NPUها را بخوانید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر تخصص عصب‌شناسان و مهندسان AI، امکان ارتباط مستقیم مغز و ماشین را برای بیماران فلج فراهم می‌کند. اعتبار این پژوهش از استفاده از اسکنرهای با وضوح بالا و مدل‌های انتشار پیشرفته نشأت می‌گیرد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان مهندسی پزشکی در ایران اهمیت دارد تا بازار مصرف؛ چراکه دسترسی به اسکنرهای fMRI با وضوح بالا در محیط‌های پژوهشی محدود است.

·نگاه ما
تحریریه دات‌هوش

کاهش زمان کالیبراسیون از ۴۰ ساعت به ۱ ساعت، نقطه عطف این خبر است؛ چراکه فناوری را از محیط آزمایشگاهی به محیط کلینیکی منتقل می‌کند. این پیشرفت نشان می‌دهد که مدل‌های AI در حال یادگیری «زبان مشترک» مغز انسان هستند و دیگر نیازی نیست برای هر فرد از صفر شروع کنیم. به نظر ما، حرکت بعدی این فناوری به سمت EEG خواهد بود که حریم خصوصی ذهنی را به یکی از بزرگ‌ترین چالش‌های حقوقی دهه آینده تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.