پرش به محتوای اصلی
پرش به محتوای مقاله

FOGO در برابر Adam: غلبه بر تداخل گرادین برای توقف فراموشی مدل‌ها

·۲۱ خرداد ۱۴۰۵۱ دقیقه مطالعه
FOGO در برابر Adam: غلبه بر تداخل گرادین برای توقف فراموشی مدل‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از دیدگاه «فراموشی به عنوان مشکل توالی» به «فراموشی به عنوان تداخل گرادین»؛ ارائه راهکاری ریاضی در سطح بهینه‌ساز (Optimizer-level) به جای تغییر در دیتاست.

بسیاری از پژوهشگران فراموشی فاجعه‌بار را تنها چالشی در یادگیری مستمر (Continual Learning) می‌بینند، اما حقیقت پیچیده‌تر است: این یک نقص بنیادین در بهینه‌سازهای فعلی است که در هر گام آموزش رخ می‌دهد.

اگر مدل‌های زبانی را به عنوان سامانه‌هایی ببینیم که با هر به‌روزرسانی بخشی از دانش قبلی خود را می‌بازند، باید بدانید که مقصر اصلی، تداخل در جهت‌های به‌روزرسانی یا همان تداخل گرادین (Gradient Interference) است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی پایداری آموزش مدل‌های بزرگ اشاره کردیم، تداخل در جهت‌های به‌روزرسانی همواره یک نقطه کور در معماری‌های فعلی بوده است. به همین دلیل، متدهای سنتی که تنها بر بازبینی داده‌ها (Rehearsal) تکیه می‌کنند، ریشه مشکل را حل نمی‌کنند.

طبق گزارش منتشر شده در ۱۰ ژوئن ۲۰۲۶ در arXiv.org، چارچوب FOGO (بهینه‌ساز متعامدسازی آگاه از فراموشی) برای حل این مشکل معرفی شده است. این سیستم از متعامدسازی طیفی (Spectral Orthogonalization) استفاده می‌کند تا اجازه ندهد جهت‌های غالب در داده‌ها، کل فرآیند بهینه‌سازی را به تصاحب خود درآورند.

بر اساس مستندات فنی این پژوهش، ویژگی‌های کلیدی FOGO عبارتند از:

  • استفاده از یک کدبوک (Codebook) فشرده برای ذخیره جهت‌های گذشته.
  • به‌کارگیری پروجکشن تصادفی (Random Projection) برای حفظ فواصل جفت‌به‌جفت در فضای کم‌بعد.
  • اعمال اصلاحات متعامد سبک‌وزن برای رفع تداخلات بدون تحمیل سربار محاسباتی زیاد.

به نقل از نتایج آزمایشات، FOGO در تنظیم دقیق (Fine-tuning) مدل LLaVA-7B و پیش‌آموزش GPT-2، به‌ویژه در محیط‌هایی با توزیع نامتوازن داده‌ها، به‌طور مستمر از بهینه‌سازهای Adam و Muon پیشی گرفت.

این دستاورد فرضیه قدیمی را که فراموشی صرفاً نتیجه‌ی ترتیب توالی وظایف است، می‌شکند. تحلیل این نتایج نشان می‌دهد که تغییرات در سطح بهینه‌ساز — و نه لزوماً مدیریت پیچیده‌ی داده‌ها — می‌تواند نرخ همگرایی را بهبود بخشیده و حفظ دانش را تضمین کند.

گام بعدی شما

  • پژوهشگران باید مقیاس‌پذیری حافظه کدبوک FOGO را در مدل‌های تریلیونی ارزیابی کنند.
  • بررسی تأثیر این بهینه‌ساز بر خطوط لوله‌ی پیش‌آموزش در مقیاس‌های فوق‌بزرگ ضروری است.
  • تست FOGO روی مجموعه‌داده‌های با تداخل شدید معنایی برای سنجش نرخ بازیابی دانش توصیه می‌شود.

اما تأثیر این تغییر در بهینه‌سازی بر هزینه سخت‌افزاری استنتاج، ابعادی دیگر دارد؛ در تحلیل ما درباره‌ی بهینه‌سازی حافظه در تراشه‌های نسل جدید بخوانید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار پژوهشی arXiv، فرآیند آموزش مدل‌های تخصصی را متحول می‌کند. تخصص در متعامدسازی طیفی باعث می‌شود مدل‌ها بدون نیاز به داده‌های تکراری، دانش نادر را حفظ کنند و هزینه‌ی بازآموزی را کاهش دهند.

تأثیر برای ایران

این دستاورد برای پژوهشگران ایرانی که روی مدل‌های زبانی تخصصی فارسی (با داده‌های نامتوازن و کم‌حجم) کار می‌کنند، بسیار ارزشمند است و امکان حفظ دانش نادر در مدل‌های کوچک‌تر را فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

نگاه ما به این خبر این است که صنعت از رویکردهای «تجربی» در مدیریت داده‌ها به سمت «محدودیت‌های ریاضی» در بهینه‌سازها حرکت می‌کند. FOGO ثابت می‌کند که مشکل فراموشی، یک ویژگی ذاتی مدل نیست بلکه نتیجه‌ی انتخاب اشتباه جهت به‌روزرسانی در فضای برداری است؛ این یعنی پتانسیل حذف کامل استراتژی‌های پرهزینه مانند Rehearsal در آینده.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.