پرش به محتوای اصلی
پرش به محتوای مقاله

مختصات سلسله‌مراتبی؛ راهکار زیست‌شناسی برای رفع شکاف اطلاعاتی ژنوم

·۲۴ مرداد ۱۴۰۵۳۵ دقیقه مطالعه۱ بازدید
تحلیل
آیا یک دانشمند کامپیوتر می‌تواند مغز بسازد؟
آیا یک دانشمند کامپیوتر می‌تواند مغز بسازد؟
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ارائه مدل ریاضی برای اثبات اینکه سیم‌کشی مغز از نظر اطلاعاتی در ژنوم غیرممکن است و معرفی «مختصات نسبی» به عنوان تنها راهکار مقیاس‌پذیر برای ساخت شبکه‌های عصبی عظیم.

۱۰ به توان ۱۰ بیت؛ این تقریباً تمام ظرفیت دستورالعمل‌هایی است که ژنوم برای فراهم کردن دستورات ساخت مغز انسان در اختیار دارد، در حالی که نتیجهٔ این فرآیند، معماری‌ای است که تقریباً شامل ۱۰ به توان ۱۰ نورون و ۱۰ به توان ۱۴ اتصال است. این شکاف عظیم اطلاعاتی به این معناست که مغز نمی‌تواند با استفاده از یک لیست ساده از سیم‌کشی‌ها ساخته شود؛ بلکه به یک برنامهٔ الگوریتمی به‌شدت فشرده نیاز دارد.

به نقل از تحلیلی فنی که در ۱۵ اوت ۲۰۲۶ در stankerstjens.github.io منتشر شد، طراحی مغز را نمی‌توان با کالبدشکافی و تکه‌تکه کردن آن بازیافت کرد، بلکه تنها با پرسش از این موضوع می‌توان به آن دست یافت که یک ژنوم تحت محدودیت‌های محاسباتی سخت، چگونه باید آن را مشخص کند. این رویکرد، رشد عصبی را به عنوان یک مسئلهٔ مهندسی می‌بیند: نوشتن برنامه‌ای که یک تک‌سلول اجرا می‌کند تا در بازهٔ زمانی رشد تکاملی یک‌ساله، مغزی را بسازد. این برنامه باید آن‌قدر کوچک باشد که در ژنوم جای بگیرد و آن‌قدر سریع باشد که در زمان رشد تکمیل شود.

برای پژوهشگران هوش مصنوعی، این یک بینش حیاتی است. یادگیری ماشین مدرن بر ماتریس‌های وزن عظیم متکی است که روی دیسک ذخیره می‌شوند یا مجموعه داده‌های آموزشی دارند که چندین مرتبه بزرگ‌تر از مدل نهایی هستند. در مقابل، زیگوت اولیه حاوی توصیفی فشرده است که به یک شبکهٔ کاربردی تبدیل می‌شود؛ موضوعی که مسیری را به سوی الگوریتم‌های بهینه‌تر برای سامانه‌های مصنوعی باز می‌کند. دانشمند علوم کامپیوتر در این تمرین، وظیفه‌ای را در روح آثار تورینگ، فون نویمان، وادینگتون و برنر فرموله می‌کند و ژنوم را نه توصیفی از یک موجود زنده، بلکه مجموعه‌ای از دستورالعمل‌ها برای ساختن یک موجود می‌بیند.

مسئله و محدودیت‌ها

در یک برنامهٔ رشد، برنامه‌نویس نمی‌تواند نورون‌ها را از بیرون جای‌گذاری کند. در عوض، مجموعه‌ای از دستورالعمل‌ها را در یک سلول اولیه بارگذاری می‌کند. این سلول تقسیم می‌شود و هر سلول دختر همان برنامه را به ارث می‌برد. هر نمونه از برنامه تنها می‌تواند اطلاعات محلی را بخواند: وضعیت داخلی خودش و سیگنال‌های مولکولی همسایگانی که همان کد را اجرا می‌کنند. این فرآیند توزیع‌شده و بازگشتی است.

این برنامه باید دو محدودیت سخت را برآورده کند:

  • محدودیت اطلاعات: ژنوم انسان حدود ۳ ضربدر ۱۰ به توان ۹ جفت‌باز دارد. با چهار باز نوکلئوتیدی، هر جفت‌باز ۲ بیت را نمایندگی می‌کند که در مجموع حدود ۶ ضربدر ۱۰ به توان ۹ بیت می‌شود. یک سقف سخاوتمندانه برای این مقدار ۱۰ به توان ۱۰ بیت است، با این فرض که هیچ افزونگی وجود نداشته باشد و هر بیت صرفاً به سیم‌کشی مغز اختصاص یابد. این بودجه در گونه‌های مختلف به‌طور قابل‌توجهی ثابت است؛ برای مثال، تفاوت اندازه ژنوم انسان و کرم C. elegans کمتر از دو مرتبه بزرگی است، اما تعداد نورون‌های آن‌ها بیش از هشت مرتبه تفاوت دارد.
  • محدودیت زمان: طول کل آکسون‌ها و زمان رشد به دلیل نرخ‌های رشد محدود، با هم متناسب هستند. هر استراتژی viable (پایدار) باید طول کل آکسون و زمان رشد را به‌صورت زیرخطی نسبت به تعداد نورون‌ها نگه دارد تا بتواند در بازه زمانی مورد نیاز به پایان برسد.

شکست استراتژی‌های سادهٔ سیم‌کشی

برای درک نحوه سیم‌کشی واقعی مغز، این تحلیل سه استراتژی تئوریک را در برابر این محدودیت‌ها ارزیابی می‌کند.

استراتژی اول، «رویکرد هویت»، به هر نورون یک برچسب منحصربه‌فرد می‌دهد و لیستی از برچسب‌های هدف را در ژنوم ذخیره می‌کند. این روش در دو جبهه شکست می‌خورد:

  • زمان: بدون نقشه، مخروط رشد باید سلول‌ها را به‌صورت سیستماتیک جست‌وجو کند، مثل پیدا کردن یک کتاب در کتابخانه‌ای بدون ترتیب. برای مغز انسان با n≈۱۰ به توان ۱۰ نورون در حجمی معادل ۱۳۰۰ سانتی‌متر مکعب (حدود ۱۵ سانتی‌متر عرض)، میانگین فاصله سلول‌ها حدود ۵۰ میکرومتر است. یک جست‌وجوی O(n) نیازمند رشد حدود ۵۰۰ کیلومتر آکسون برای هر هدف است که فراتر از توان تولید یک نورون در چند هفته یا ماه است.
  • فضا: برچسب‌گذاری ۱۰ به توان ۱۰ سلول به log2(n) بیت برای هر برچسب (حدود ۳۳ بیت) نیاز دارد. با m≈۱۰ به توان ۴ هدف برای هر نورون، فضای ذخیره‌سازی کل به n x m x log n یا O(nm log n) می‌رسد. برای مغز انسان، این مقدار حدود ۳ ضربدر ۱۰ به توان ۱۵ بیت است که ۳۰۰ هزار برابر بیشتر از ظرفیت ژنوم است.

علوم اعصاب تکاملی نیز به نتیجه مشابهی درباره فرضیه شیمی‌دوستی اسپری رسید. اگرچه جست‌وجو برای مولکول‌های هویت، تنوع زیادی را آشکار کرد — مانند Dscam1 در مگس سرکه که بیش از ۱۰,۰۰۰ ایزوفرم تولید می‌کند و پروتوکادهرین‌های مهره‌داران که کدهای ترکیبی می‌سازند — اما این تنوع بیشتر برای مدیریت «اجتناب از خود» (self-avoidance) در سطح محلی است، نه برای انتخاب هدف در سطح جهانی.

استراتژی دوم، «رویکرد راهنما»، از توالی نقاط نشانه برای هدایت آکسون‌ها استفاده می‌کند. مخروط رشد به جای سرگردانی، دنباله‌ای از نشانه‌ها را دنبال می‌کند (مثلاً «برو به نشانه A، سپس B، سپس C»).

  • زمان: این روش مشکل ناوبری را حل می‌کند. یک پیاده‌روی هدایت‌شده در حجم سه‌بعدی بسیار کوتاه‌تر از جست‌وجوی جامع است. طول آکسون برای هر هدف از O(n) به O(n^(1/3)) کاهش می‌یابد، زیرا n نورون در فضای سه‌بعدی تنها به اندازه ریشه سوم n در فاصله عرض سلولی از هم قرار دارند.
  • فضا: مشکل ذخیره‌سازی بدتر می‌شود. دستورات برای هر نقطه شروع خاص هستند. اگر هر مسیر به k نقطه نیاز داشته باشد، ژنوم باید n x m x k برچسب را ذخیره کند. پیچیدگی فضا به O(nmk log n) می‌رسد که دستورالعمل‌ها را به اندازه ضریب k افزایش می‌دهد.

مدل راهنما توضیح می‌دهد که آکسون‌ها چگونه از خط وسط عبور می‌کنند یا وارد مناطق هدف می‌شوند، اما توضیح نمی‌دهد که آن نقاط چگونه مشخص شده‌اند. اگر هر نشانه یک مارکر مستقل و ad hoc (موردی) باشد، استدلال مقیاس‌پذیری آن را رد می‌کند.

راهکار مختصاتی

تنها راهکار عملی، استراتژی سوم یعنی «رویکرد مختصاتی» است. مغز به جای راهنماهای تصادفی، از یک سیستم مختصات داخلی سیستماتیک استفاده می‌کند که در حین تقسیم سلولی ایجاد می‌شود.

یک شبکه دکارتی خارجی (x, y, z) غیرقابل اجراست چون به یک چارچوب مرجع جهانی و خط‌کشی نیاز دارد که در بافت وجود ندارد. در عوض، مغز از مختصات نسبی استفاده می‌کند. هر بار که یک سلول پیش‌ساز تقسیم می‌شود، سلول‌های دختر یک آدرس باینری را به ارث می‌برند. پس از d = log2(n) دور تقسیم، هر سلول آدرسی منحصربه‌فرد دارد که ساختار فضایی بافت را منعکس می‌کند.

در این سیستم، درخت تقسیم آینهٔ بافت است: سلول‌هایی که پیشوند مشترک دارند، از یک جد مشترک هستند و نزدیک هم قرار دارند. هر بیت متناظر با یک محور فضایی است (مثلاً بیت ۱ برای چپ-راست، بیت ۲ برای قدامی-خلفی، بیت ۳ برای داخلی-خارجی). در اصطلاحات بیولوژیکی، این بیت‌ها تمایزات مولکولی مانند فاکتورهای رونویسی هستند که در یک دودمان بیان می‌شوند اما در دیگری نه.

قوانین سیم‌کشی دیگر لیست‌هایی از اهداف نیستند، بلکه تبدیل‌های فشرده روی این آدرس‌ها هستند. برای مثال، قانون اتصال یک نورون به شریک متقابلش در سمت دیگر مغز، تنها یک «تغییر بیت» (bit flip) در اولین بیت آدرس است. این کار را می‌توان با یک ماسک باینری نوشت — یک الگوی باینری که مشخص می‌کند کدام بیت‌ها باید تغییر کنند.

این استراتژی از نظر محاسباتی بهینه است:

  • هزینه اطلاعات: قوانین به جای هر نورون، برای هر نوع سلول (t ≈ ۱۰ به توان ۳ نوع) ذخیره می‌شوند. با m=۱۰ به توان ۴ هدف برای هر نوع، فضای ذخیره‌سازی کل O(tm log n) یا حدود ۳ ضربدر ۱۰ به توان ۸ بیت می‌شود که به‌راحتی در بودجه ۱۰ به توان ۱۰ بیتی ژنوم جای می‌گیرد.
  • هزینه زمان: ناوبری با بررسی یک بیت از آدرس هدف در هر نقطه انشعاب انجام می‌شود و آدرس کامل در O(log n) مقایسه بیت خوانده می‌شود. طول مسیر فیزیکی همچنان O(n^(1/3)) باقی می‌ماند.

این سیستم مختصاتی یک ویژگی مولکولی دائمی است. شواهد نشان می‌دهد عضلاتی که عصب‌زدایی شده‌اند، ترجیحاً توسط آکسون‌های حرکتی از قطعات نخاعی با موقعیت مشابه بازسازی می‌شوند. این سلسله‌مراتب از گرادیان‌های مورفوژن، شبکه‌های تنظیم‌کننده ژنی و دودمان سلولی ایجاد می‌شود. کارهای اخیر نشان می‌دهد که یک درخت دودمانی، فضای جهانی از آدرس‌های مولکولی را نصب می‌کند؛ ساختاری که در الگوهای بیان ژن در کل مغز موش و ماهی زبرا مشاهده شده است.

نقش نویز و پلاستیسیته

در حالی که سیستم مختصاتی نقشه را ارائه می‌دهد، اتصال نهایی توسط تصادفی‌بودن (stochasticity) و پلاستیسیته اصلاح می‌شود. برای مغزهای بزرگ‌تر، رشد یک توزیع از نمودارها را مشخص می‌کند نه یک نمودار واحد؛ به همین دلیل حتی دوقلوهای همسان هم سیم‌کشی یکسانی ندارند.

نویز به عنوان یک «منبع رایگان» استفاده می‌شود. برای مثال، اگر نورونی در ناحیه A به ۱۰ ورودی غیرمرتبط از ناحیه B نیاز دارد، یک قانون ساده («به هر کاندید با احتمال ۱۰/n متصل شو») این کار را بدون نیاز به اینکه نورون‌ها صریحاً با همسایگان خود مذاکره کنند تا از همبستگی اجتناب کنند، انجام می‌دهد.

برای جلوگیری از خطاهای مرگبار ناشی از نویز، زیست‌شناسی از «کانال‌سازی» (canalization) استفاده می‌کند، مفهومی که توسط وادینگتون مطرح شد. مسیرهای رشد در کانال‌های گسسته مرتب می‌شوند. تا زمانی که نوسانات در این «دیواره‌ها» بمانند، خروجی ثابت می‌ماند. هزینه این استواری این است که دیواره‌ها باید در ژنوم مشخص شده باشند.

سپس پلاستیسیته تنظیم نهایی را انجام می‌دهد. این تحلیل دو نوع پلاستیسیته را تفکیک می‌کند:

۱. پلاستیسیته داخلی: از فعالیت‌های خودبه‌خودی (مانند موج‌های شبکیه‌ای که قبل از باز شدن چشم‌ها در شبکیه حرکت می‌کنند) برای اصلاح پاسخ مشخص‌شده در ژنوم استفاده می‌کند. این یک قانون مبتنی بر رقابت است (مثلاً «سیناپس‌های هم‌زمان فعال را تقویت کن») که اطلاعات جدیدی فراتر از ژنوم اضافه نمی‌کند.
۲. پلاستیسیته وابسته به تجربه: اطلاعات را از محیط خارجی وارد می‌کند تا جاهای خالی را پر کند که ژنوم عمداً باز گذاشته است، مانند چهره اعضای خانواده یا زبان مادری. ژنوم پیش‌فرض‌ها (مانند ساختار کلی زبان انسانی) و قوانین پردازش داده‌ها را فراهم می‌کند.

پیامدها برای تفسیرپذیری مکانیکی

این چارچوب، بدبینی رایج در «تفسیرپذیری مکانیکی» (Mechanistic Interpretability) را به چالش می‌کشد. آزمایش‌های فکری قبلی توسط لازب‌نیک (آیا یک بیولوژیست می‌تواند یک رادیو را تعمیر کند؟) و جوناس و کوردینگ (آیا یک عصب‌شناس می‌تواند یک ریزپردازنده را بفهمد؟) پیشنهاد می‌کردند که چون این روش‌ها نمی‌توانند منطق سامانه‌های مهندسی ساده را بازسازی کنند، نمی‌توانند مغز را از طریق سیم‌کشی و فعالیت توضیح دهند.

این مشکل در هوش مصنوعی نیز وجود دارد. در مدل‌های زبانی بزرگ (LLM)، پژوهشگران واحدهایی را یافته‌اند که پل گلدن گیت را نمایندگی می‌کنند، اما توضیح اینکه مدل چگونه به عنوان شبیه‌ساز تفکر رفتار می‌کند، دشوار باقی مانده است. مسئله، طول توصیف است. وزن‌های یک LLM فشرده‌سازی یک مجموعه داده آموزشی عظیم (بیشتر اینترنت) هستند.

با این حال، این تحلیل استدلال می‌کند که خواندن وزن‌های یک شبکه آموزش‌دیده، سخت‌ترین راه است. راه آسان‌تر، خواندن برنامهٔ رشد است. چون ژنوم نسخه به‌شدت فشرده‌ای از شبکه نهایی است، منطق سیستم در برنامه رشد بسیار دسترس‌پذیرتر از ۱۰ به توان ۱۴ اتصال نهایی است. این رویکرد مهندسی‌شده به زیست‌شناسی، مشابه تلاش‌های اخیر در طراحی مولکولی است که در آن هوش مصنوعی برای خلق ویروس‌های هدفمند با قابلیت کشتن باکتری‌ها به کار گرفته شد تا دقت عملیاتی در سطح میکروسکوپی افزایش یابد.

با نگاه به مکانیسم‌های مولکولی — مورفوژن‌ها، فاکتورهای رونویسی و نشانه‌های هدایت — به عنوان گام‌هایی در یک الگوریتم، پژوهشگران می‌توانند تشخیص دهند کدام ویژگی‌های رشد مغز ضرورت‌های محاسباتی هستند و کدام‌ها اتفاقات تکاملی. تکامل تجربه میلیون‌ها سال را در ژنوم فشرده کرده، رشد آن را به یک شبکه تبدیل می‌کند و پلاستیسیته اصلاحات سریع را زمانی که جهان سریع‌تر از تکامل حرکت می‌کند، فراهم می‌سازد.

گام بعدی شما

  • بررسی مقالات مربوط به «تفسیرپذیری مکانیکی» برای درک تفاوت بین تحلیل وزن‌ها و تحلیل الگوریتم‌های تولید مدل.
  • مطالعه مفاهیم «کانال‌سازی» (Canalization) در زیست‌شناسی برای یافتن ایده‌هایی جهت افزایش استواری (Robustness) در شبکه‌های عصبی مصنوعی.
  • تحلیل ساختار سلسله‌مراتبی در مدل‌های ترنسفورمر برای یافتن شباهت‌های احتمالی با سیستم مختصات نسبی مغز.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این یافته با تکیه بر اعتبار تحلیل‌های محاسباتی زیست‌شناسی، نشان می‌دهد که بهره‌وری در مقیاس عظیم نیازمند جایگزینی نقشه‌های مستقیم با قوانین تبدیل است. این موضوع می‌تواند منجر به طراحی مدل‌های هوش مصنوعی شود که با پارامترهای بسیار کمتر، ساختارهای پیچیده‌تری را بازسازی کنند.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و علوم اعصاب محاسباتی در ایران اهمیت دارد تا بازار مصرف؛ چرا که مسیرهای جدیدی برای بهینه‌سازی معماری مدل‌ها پیشنهاد می‌کند.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از تحلیل «وضعیت نهایی» (وزن‌ها) به تحلیل «فرآیند تولید» (الگوریتم رشد)، کلید حل معمای تفسیرپذیری در مدل‌های عظیم است. اگر منطق یک سیستم در کد فشرده‌ساز آن نهفته باشد، تلاش برای استخراج معنا از تریلیون‌ها پارامتر، شبیه به تلاش برای درک یک برنامه کامپیوتری از طریق بررسی ولتاژ ترانزیستورهاست. این رویکرد پیشنهاد می‌کند که برای درک واقعی LLMها، باید به جای وزن‌ها، به دنبال «قوانین فشرده‌سازی» در مرحله آموزش بگردیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.