اگر برای آموزش مدلهای خود از تنظیم دقیق سنتی استفاده میکنید، احتمالاً با این واقعیت تلخ روبرو شدهاید که مدل شما با یادگیری هر مهارت جدید، مهارت قبلی را فراموش میکند. این نقص ساختاری که به آن فراموشی فاجعهبار (Catastrophic Forgetting) میگویند، اکنون با یک دستورالعمل معماری جدید به چالش کشیده شده است.
طبق گزارشی که در ۲۶ سپتامبر ۲۰۲۶ در وبسایت dev.to منتشر شد، استفاده از «لنگرهای یادگیری مستمر» توانسته است نرخ حفظ دانش در ۱۰۰ تکلیف مختلف را از حدود ۱٪ به ۳۵٪ برساند. این یعنی یک جهش ۲۸ برابری نسبت به روشهای سادهٔ تنظیم دقیق (Fine-tuning) — که شبیه وقتی است به یک پزشک عمومی، تخصص پوست میدهیم تا روی یک حوزه دقیق شود، اما او ناگهان تمام دانش کلی پزشکیاش را فراموش کند.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی پارامترها اشاره کردیم، مشکل اصلی در جابهجایی شدید وزنهای مدل هنگام مواجهه با دادههای جدید است. در روشهای متداول، حافظهٔ مدل در محکهای Symbol-QA و LLM-QA چنان کوتاه است که عملاً پس از یک تکلیف، دانش قبلی پاک میشود. این چالش در مدیریت اولویتهای حافظه، ما را به یاد مقایسهی گرافهای عصبی و جستوجوی برداری در حل تضاد میان تازگی و اهمیت دادهها میاندازد که رویکردی متفاوت برای سازماندهی دانش ارائه میداد.
به نقل از پژوهشگران این پروژه، موثرترین پیکربندی برای حل این بحران، ادغام سه عنصر کلیدی است:
- لنگرهای دادهای (Data Anchors): نقاط دادهای خاصی که حافظه را تثبیت میکنند.
- لنگرهای تابع و وزن: محدودیتهایی که مانع از تغییر شدید وزنها (Weights) میشوند.
- بهروزرسانیهای ادغامشدهٔ لورا (Merged LoRA): روشی کارآمد برای ادغام دانش جدید بدون تخریب ساختار قبلی.
بر اساس مستندات این تحقیق، این ترکیب توانست میانگین حفظ نهایی را از ۱.۲٪ به ۳۴.۹٪ افزایش دهد. در این میان، لنگرهای دادهای و لوراهای ادغامشده بیشترین تاثیر را داشتند و در هر سه مجموعه دادهٔ آزمایش شده، اثرات آنها بهصورت فوقجمعشونده (Super-additive) ظاهر شد.
این یافته برای توسعهدهندگان به این معناست که یادگیری بلندمدت دیگر یک مسئلهٔ حلنشده نیست. ثابت شد که میتوان «منحنی فراموشی» را به یک رژیم یادگیری مستحکم تبدیل کرد، به شرطی که از تنظیم دقیق ساده فاصله بگیریم. البته باید توجه داشت که این متد، مدیریت پارامترهای پیچیدهتری را میطلبد و شاید برای خانوادههای مدلهای بسیار بزرگ، بهراحتی مقیاسپذیر نباشد.
گام بعدی شما
- اگر در حال ساخت سیستمهای یادگیری مادامالعمر هستید، ترکیب لنگرهای دادهای و LoRA را جایگزین Fine-tuning ساده کنید.
- اثر این متد را روی دادههای خاص دامنهٔ کاری خود (Domain-specific) بسنجید.
- منتظر نتایج این رویکرد در محیطهای دادههای جریانی (Streaming Data) باشید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو