پرش به محتوای اصلی
پرش به محتوای مقاله

Sakana AI با روش «پخش خطا» آموزش شبکه‌های عصبی بدون پس‌انتشار را ممکن کرد

·۲۷ تیر ۱۴۰۵۶ دقیقه مطالعه
پخش خطای ساکانا AI شبکه‌های دو جریانه سازگار با DALL-E را آموزش می‌دهد: ۹۶.۷٪ MNIST و ۶۱.۷٪ CIFAR-10 بدون پس‌انتشار
پخش خطای ساکانا AI شبکه‌های دو جریانه سازگار با DALL-E را آموزش می‌دهد: ۹۶.۷٪ MNIST و ۶۱.۷٪ CIFAR-10 بدون پس‌انتشار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین پیاده‌سازی موفق پخش خطا (Error Diffusion) در شبکه‌های کانولوشنی و اثبات برتری آن نسبت به پس‌انتشار در تکالیف خاص یادگیری تقویتی بدون نیاز به وزن‌های منفی.

تصور کنید بتوانیم شبکه‌های عصبی را بدون استفاده از پیچیدگی‌های ریاضی پس‌انتشار و دقیقا مشابه ساختار بیولوژیکی مغز آموزش دهیم. این دستاورد جدید Sakana AI نه تنها یک کمال‌گرایی نظری، بلکه گامی عملی به سوی سخت‌افزارهای محاسباتی بهینه است.

پس‌انتشار (Backpropagation) موتور محرک یادگیری عمیق است، اما یک اشکال بیولوژیکی بنیادی دارد: مغز انسان نمی‌تواند ماتریس‌های وزن را برای ارسال خطا به عقب ترانه (Transpose) کند. این الزام ایجاد می‌کند که در سیستم‌های بیولوژیکی، ارسال سیگنال خطا به لایه‌های قبلی غیرممکن باشد. این مسئله که به «مشکل انتقال وزن» (Weight Transport Problem) معروف است، همواره مانعی جدی برای ایجاد مدل‌های کاملاً سازگار با بیولوژی بوده است. Sakana AI در مقاله جدیدی با عنوان «Diffusing Blame»، مکانیزمی را معرفی کرده که این محدودیت را به‌طور کامل حذف می‌کند؛ این کار از طریق آموزش شبکه‌هایی صورت می‌گیرد که از «اصل دیل» پیروی می‌کنند.

این پژوهش در زمانی منتشر می‌شود که کل حوزه هوش مصنوعی به دنبال قوانین یادگیری هستیم که هم از نظر بیولوژیکی پذیرفتنی باشند و هم از نظر سخت‌افزاری کارآمد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی همکاری‌های Sakana AI با Nvidia Nemotron اشاره کردیم، این آزمایشگاه اکنون از لایه‌های کاربردی فاصله گرفته و به سراغ مکانیک‌های بنیادی یادگیری نورون‌ها رفته است. برای متخصصان رایانش نورومورفیک (Neuromorphic Computing)، این دستاورد معادل جابه‌جایی از یک شبیه‌سازی نرم‌افزاری از یک مدار به یک طرح‌بندی فیزیکی است که در واقعیت کار می‌کند.

مکانیزم پخش خطا (Error Diffusion)

طبق گزارش Marktechpost، هسته‌ی این رویکرد روش «پخش خطا» (Error Diffusion یا ED) است؛ یک قانون یادگیری محلی که اولین بار در سال ۲۰۰۰ توسط کانکئو (Kaneko) پیشنهاد شد. برخلاف پس‌انتشار استاندارد، به‌روزرسانی هر وزن در ED تنها به سه سیگنال وابسته است: فعالیت پیش‌سیناپسی (Presynaptic activity)، مشتق فعال‌ساز پس‌سیناپسی (Postsynaptic activation derivative) و یک علامت خطای جهانی واحد (Single global error sign).

از آنجایی که ED از وزن‌های ترانه شده و ماتریس‌های بازخورد تصادفی اجتناب می‌کند، به‌طور طبیعی با «اصل دیل» (Dale's principle) سازگار است. طبق این اصل بیولوژیکی، هر نورون یا صرفاً تحریک‌کننده (Excitatory) است یا صرفاً بازدارنده (Inhibitory)، و نمی‌تواند هر دو نقش را همزمان ایفا کند.

معماری دو-جریانی (DFA)

برای رعایت محدودیت‌های بیولوژیکی، تیم پژوهشی معماری دو-جریانی (Dual-Stream Architecture یا DFA) را طراحی کرد. در این ساختار، هر لایه به دو مسیر مجزا تقسیم می‌شود:

  • یک جریان تحریک‌کننده (p)
  • یک جریان بازدارنده (n)

در این تنظیمات، عبور پیش‌رو (Forward pass) برای محاسبه پیش‌فعال‌سازها از منطق ریاضی زیر پیروی می‌کند:

  • $p_i = \phi_i( +p_{i-1} Wpp − n_{i-1} Wnp + bp )$
  • $n_i = \phi_i( +n_{i-1} Wnn − p_{i-1} Wpn + bn )$

در این معادلات، تمام چهار ماتریس وزن ($Wpp, Wnp, Wnn, Wpn$) به‌صورت عنصر-به-عنصر غیرمنفی باقی می‌مانند. تنها استثنائات، سوگیری‌های $bp$ و $bn$ هستند، زیرا آن‌ها نیازی به غیرمنفی بودن ندارند. ماهیت بازدارنده‌ی شبکه نه از طریق یادگیری وزن‌های منفی، بلکه از طریق علامت‌های نفی ساختاری قبل از $Wnp$ و $Wpn$ ایجاد می‌شود. این طراحی مستلزم وجود چهار زیر‌ماتریس وزن در هر لایه است که در نتیجه باعث می‌شود تعداد پارامترها تقریباً ۴ برابر افزایش یابد؛ برای مثال، یک شبکه با ۳۲ میلیون پارامتر در مقابل ۸ میلیون پارامتر در یک لایه تک-جریانی استاندارد.

مقیاس‌پذیری و نوآوری‌ها

پژوهشگران برای اینکه ED بتواند مسائل چند-کلاسی (Multi-class) را مدیریت کند و از محدودیت‌های طبقه‌بندی دوتایی و داده‌های MNIST فراتر رود، از «مسیریابی خطای پیمانه‌ای» (Modulo Error Routing) استفاده کردند. با اختصاص یک کانال خروجی ثابت به هر واحد پنهان $i$ از طریق مسیریابی $r(i) = i \pmod C$ (که در آن $C$ بُعد خروجی است)، شبکه می‌تواند مؤلفه‌های خاص خطا را به واحدهای خاص هدایت کند. در حالی که DFA از ماتریس‌های بازخورد تصادفی استفاده می‌کند، ED از این تناظر ساختاریافته بهره می‌برد.

برای اینکه این سیستم در مجموعه‌داده‌های پیچیده‌ای مانند CIFAR-10 کار کند، Sakana AI سه نوآوری کلیدی را پیاده‌سازی کرد:

۱. عرض سیگموئیدهای لایه‌محور: آن‌ها از تابع $\phi_i(z) = 1/(1 + e^{−2z/\alpha_i})$ استفاده کردند. از آنجایی که مشتق سیگموئید سیگنال خطا را کنترل می‌کند، تضعیف سیگنال بسیار شدید است؛ تحلیل‌های پس‌ینی نشان داد که از لایه خروجی تا اولین لایه پنهان، ۲۵ برابر افت سیگنال رخ می‌دهد. برای جلوگیری از اشباع زودرس، مقدار $\alpha = 3.0$ برای لایه‌های کانولوشن CIFAR-10 و $\alpha = 6.0$ برای لایه‌های کاملاً متصل (FC) تنظیم شد.

۲. خطای کلاس مرکز-دسته (Batch-centered class error): تیم پژوهشی میانگین هر دسته کوچک (Mini-batch) را به ازای هر کلاس تفریق کرد. این کار تضمین می‌کند که خطای «یک-در-برابر-همه» (one-vs-all) در کل دسته برای هر کلاس دارای میانگین صفر باشد. این اقدام باعث کاهش سرکوب مداومی می‌شود که به دلیل عدم توازن ۹ به ۱ در اهداف کلاس‌های چندگانه ایجاد می‌گردد.

۳. مقداردهی اولیه نامتقارن: وزن‌های تحریک‌کننده ۱.۵ برابر و وزن‌های بازدارنده ۰.۵ برابر مقیاس شدند. این کار یک نسبت مقیاس مورد انتظار ۳:۱ بین جریان‌های تحریکه و بازدارنده ایجاد می‌کند، هرچند لایه خروجی همچنان متقارن باقی ماند.

نتایج بنچمارک‌ها

در نتایج منتشر شده در سال ۲۰۲۶، متد ED پیشنهادی به صحت ۹۶.۷٪ در MNIST و ۶۱.۷٪ در CIFAR-10 دست یافت. در مقابل، بدون استفاده از سه نوآوری ذکر شده، مدل «Seed ED» (که از $\alpha = 1.0$، خطای خام و مقداردهی متقارن استفاده می‌کرد) به شدت سقوط کرد و به ترتیب به ۵۰.۴٪ و ۱۱.۶٪ رسید.

اگرچه معماری DFA نمرات بالاتری کسب کرد (۹۷.۶٪ در MNIST و ۶۹.۱٪ در CIFAR-10)، اما DFA با استفاده از تقریباً ۲.۸۴ میلیون وزن منفی، اصل دیل را نقض می‌کند. نکته حائز اهمیت این است که این نخستین باری است که پخش خطا (Error Diffusion) با موفقیت در شبکه‌های کانولوشن به کار گرفته می‌شود. پیش از این، فوجیتا (۲۰۲۶) با استفاده از یک MLP تخت شده به صحت ۵۵.۲٪ در CIFAR-10 رسیده بود، که بدان معناست که این رویکرد جدید جهشی قابل توجه در قابلیت‌ها ایجاد کرده است، حتی اگر هنوز پایین‌تر از روش‌های استاندارد مبتنی بر گرادیان باشد.

تحلیل معکوس اثرات (Ablation)

یک یافته جالب در این مطالعه این است که اهمیت سه نوآوری مذکور بسته به نوع تکلیف (Task) معکوس می‌شود. در MNIST، حذف عرض‌های لایه‌محور فاجعه‌بار است و باعث افت ۷۱.۴ واحد درصدی می‌شود و صحت را به سطح حدس تصادفی می‌کشاند، در حالی که مرکز-دسته کردن خطا تأثیر بسیار کمی دارد (۰.۳- واحد درصد).

اما در CIFAR-10، ترتیب تغییر می‌کند. حذف خطای مرکز-دسته باعث بیشترین افت (۴۷.۹- واحد درصد) می‌شود و باعث می‌گردد چهار مورد از پنج بذر (Seed) مدل کاملاً فروپاشی کنند. این معکوس شدن نشان می‌دهد که گلوگاه‌های تخصیص اعتبار (Credit Assignment) بسته به تکلیف متفاوت هستند و در ارزیابی‌های تک-بنچمارکی نامرئی می‌مانند.

ورود به یادگیری تقویتی (RL)

تیم همچنین ED را با بهینه‌سازی سیاست تقریبی (PPO) ترکیب کرد تا مدل ED-PPO را خلق کند. این مدل در محیط‌های Brax locomotion و Craftax مورد آزمایش قرار گرفت و بسیار مؤثر عمل کرد. برای خطای خروجی سیاست (Policy-output)، مسیریابی بر اساس کانال خروجی انجام شد و برای شبکه مقدار اسکالر (Scalar value network)، خطا به تمام واحدها پخش گردید.

نکته مهم این است که ED-PPO هر سه نوآوری مربوط به طبقه‌بندی را به‌طور کامل حذف کرد. در تکلیف HalfCheetah، مدل ED-PPO با امتیاز ۵۴۹۴، به‌طور معناداری از BP-PPO با امتیاز ۳۵۲۰ پیشی گرفت ($p < 0.001$) و با DFA-PPO برابر شد. در تکلیف Ant نیز عملکردش با هر دو مدل برابری کرد. در محیط Craftax، مدل DFA-PPO با امتیاز ۱۹.۸ ضعیف‌ترین روش بود، در حالی که BP-PPO امتیاز ۲۷.۰ کسب کرد؛ این موضوع نشان می‌دهد که بازخوردهای تصادفی مورد استفاده در طبقه‌بندی، در محیط‌های یادگیری تقویتی باز (Open-ended) شکست می‌خورند.

تحلیل سخت‌افزاری و پراکندگی (Sparsity)

برای جامعه فنی، این تغییر یک مبادله (Trade-off) حیاتی را تأیید می‌کند: «بهای» پذیرش بیولوژیکی، حدود ۰.۹ تا ۷.۴ واحد درصد کاهش صحت در مقایسه با DFA است. با این حال، مزیت این روش برای سخت‌افزارهای فوتونیکی و نورومورفیک که مقادیر سیناپسی غیرمنفی را به‌طور فیزیکی رمزگذاری می‌کنند، بسیار عظیم است. مسیریابی با علامت ثابت در ED به‌راحتی بر روی چنین بسترهایی نگاشت می‌شود.

علاوه بر این، فرآیند آموزش یک پراکندگی ضمنی (Implicit Sparsity) را آشکار می‌کند. حدود ۳۷.۳٪ از وزن‌ها پس از آموزش به کف غیرمنفی ($10^{-4}$) رسیدند. اتصالات کاملاً متصل در جریان بازدارنده-متقاطع بیشترین میزان هرس را داشتند و تا ۶۸.۸٪ آن‌ها به کف رسیدند. این نشان می‌دهد که شبکه‌های سازگار با اصل دیل ممکن است نوعی فشرده‌سازی مدل «رایگان» را ارائه دهند.

این معماری همچنین از طریق جریان بازدارنده اختصاصی خود، یک مکانیزم میراکننده ساختاری (Structural dampening) فراهم می‌کند که می‌تواند کلید حل مشکلات پایداری و جلوگیری از انحرافات شدید گرادیان در یادگیری مداوم و باز باشد.

گام بعدی شما

  • اگر روی سخت‌افزارهای نورومورفیک یا فوتونیکی کار می‌کنید، معماری DFA را برای پیاده‌سازی وزن‌های غیرمنفی بررسی کنید.
  • برای کاهش حجم مدل‌ها، روی وزن‌هایی که به کف غیرمنفی ($10^{-4}$) رسیده‌اند تمرکز کنید تا استراتژی هرس (Pruning) جدیدی بیابید.
  • متد ED-PPO را در محیط‌های یادگیری تقویتی باز (Open-ended) تست کنید تا پایداری آن را در برابر گرادیان‌های شدید بسنجید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با اثبات امکان آموزش بدون پس‌انتشار، مسیر را برای سخت‌افزارهای فوتونیکی و نورومورفیک که اساساً وزن منفی را پشتیبانی نمی‌کنند، هموار می‌کند. اعتبار این یافته‌ها از طریق نتایج برتر در یادگیری تقویتی (RL) تأیید شده است.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و سخت‌افزارهای عصبی اهمیت دارد تا بازار مصرف ایران و اثر مستقیمی بر کاربران نهایی ندارد.

·نگاه ما
تحریریه دات‌هوش

پذیرش افت دقت در ازای سازگاری بیولوژیکی، نشان‌دهنده‌ی چرخش از «بهینه‌سازی نرم‌افزاری» به «بهینه‌سازی سخت‌افزاری» است. وقتی ۳۷٪ از وزن‌ها در این مدل به کف غیرمنفی می‌رسند، ما با یک مکانیزم فشرده‌سازی ذاتی روبرو هستیم که می‌تواند بهره‌وری انرژی را در تراشه‌های نسل بعد به شدت بالا ببرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.