پرش به محتوای اصلی
پرش به محتوای مقاله

«پس‌آموزش دانش جدید نمی‌سازد»؛ محدودیت‌های ذاتی مدل‌های زبانی

·۲۵ مرداد ۱۴۰۵۳ دقیقه مطالعه
مدل‌های زبانی در معرض دانش کنترل‌شده آموزشی
مدل‌های زبانی در معرض دانش کنترل‌شده آموزشی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات تجربی این موضوع که پس‌آموزش (Post-training) نمی‌تواند دانش حذف‌شده در مرحله پیش‌آموزش را بازیابی کند — برخلاف باور رایج که RLHF می‌تواند توانایی‌های استدلالی جدید خلق کند.

تصور کنید مدل‌های زبانی بزرگ را به دانش‌آموزی تشبیه کنیم که هرگز کتاب ریاضی ندیده است؛ هیچ مقدار تمرین یا تشویقی نمی‌تواند او را ناگهان به یک نابغه ریاضی تبدیل کند. این ادعای جسورانه، هسته مرکزی گزارش فنی منتشر شده در ۱۶ اوت ۲۰۲۶ است که مدل LittleLearner را معرفی می‌کند.

طبق اعلام پژوهشگران، داده‌های پیش‌آموزش (Pretraining) به عنوان یک سقف توانمندی مطلق عمل می‌کنند؛ سقفی که نه با افزایش اندازه مدل و نه با روش‌های پیشرفته پس‌آموزش، قابل عبور نیست. این موضوع مستقیماً با چالش‌های شناسایی مرزهای دانشی مدل‌ها مرتبط است، مشابه آنچه در بررسی متدولوژی استخراج تاریخ قطع دانش مدل‌های زبانی مشاهده کردیم. در مدل‌های فعلی، به دلیل استفاده از مجموعه‌داده‌های عظیم و بدون فیلتر، تشخیص این موضوع که آیا مدل مهارتی را «کشف» کرده یا صرفاً الگویی را «به یاد می‌آورد»، تقریباً غیرممکن است.

برای حل این چالش، تیم تحقیق مجموعه‌داده LittleCurriculum را ایجاد کرد؛ یک کورپوس ۸۸ میلیارد توکنی (Token) که از FineWeb-Edu استخراج شده است. بر اساس مستندات این پروژه، این داده‌ها به‌طور سخت‌گیرانه بر اساس استانداردهای آموزشی مدارس آمریکا (K-5) فیلتر شده‌اند تا هرگونه حقیقت یا واژگانی که فراتر از سطح پنجم ابتدایی است، به‌طور کامل حذف شود.

در این آزمایش، مدل LittleLearner در سه مقیاس ۰.۶، ۱.۳ و ۵ میلیارد پارامتر (Parameters) از صفر آموزش دید. برای ایجاد یک مقایسه دقیق، مدل‌های کنترلی «بدون فیلتر» با همان معماری و دستورالعمل آموزشی ساخته شدند تا تفاوت عملکرد دقیقاً قابل اندازه‌گیری باشد.

همان‌طور که در بحث‌های گذشته ما درباره‌ی قوانین مقیاس‌پذیری اشاره کردیم، تصور بر این بود که افزایش اندازه مدل می‌تواند منجر به ظهور توانمندی‌های پیش‌بینی‌نشده شود. اما یافته‌های این گزارش چیز دیگری می‌گوید:

  • محدودیت مقیاس: افزایش اندازه مدل تنها عملکرد را در چارچوب برنامه درسی ابتدایی بهبود بخشید و هیچ پیشرفتی در مسائل پیچیده‌تر (فراتر از سطح پنجم) ایجاد نکرد.
  • شکست پس‌آموزش: استفاده از روش GRPO (بهینه‌سازی سیاست نسبی گروهی) روی داده‌های MathCAMPS، مهارت‌های ریاضی ابتدایی را تقویت کرد، اما حتی وقتی داده‌های پس‌آموزش حاوی اطلاعات پیشرفته بود، مدل نتوانست توانایی‌های خارج از محدوده پیش‌آموزش را بازیابی کند.
  • محدودیت یادگیری در بستر متن: روش یادگیری در بستر متن (In-context Learning) نیز نتوانست برای مدل ۵ میلیاردی، راه حلی برای مسائل پیچیده ریاضی ایجاد کند.

این کشف، این فرض رایج را که «استدلال نوظهور» می‌تواند شکاف‌های عظیم دانش بنیادی را پر کند، به چالش می‌کشد. این یافته‌ها همچنین دیدگاه جدیدی به بحث‌های مربوط به مدل‌های کوچک می‌دهد و نشان می‌دهد که صرفاً تقلید از توالی‌ها برای ارتقای مدل‌های کوچک کافی نیست و ریشه توانمندی در داده‌های پایه است. برای متخصصان یادگیری ماشین، این بدان معناست که «هوش» منتسب به روش‌هایی مثل RLHF یا GRPO، در واقع تقویت پیش‌فرض‌های موجود در پیش‌آموزش است، نه خلق توانایی‌های شناختی جدید.

اگر فیلترهای اولیه سقف توانایی را تعیین می‌کنند، تمرکز صنعت باید از مقیاس‌دهی کورکورانه به سمت کیوریتوری (Curating) دقیق مجموعه‌داده‌های اولیه تغییر کند. ما اکنون شاهد حرکتی به سمت آموزش‌های «کنترل‌شده پداگوژیک» هستیم تا بفهمیم مدل‌ها واقعاً چگونه یاد می‌گیرند.

پژوهشگران اکنون از LittleLearner برای بررسی این موضوع استفاده می‌کنند که آیا یادگیری تقویتی می‌تواند از یک پیش‌فرض محدود، توانایی‌های کاملاً جدیدی خلق کند یا مسیر یادگیری ماشین با مسیر یادگیری کسرها در کودکان انسانی تفاوت‌های بنیادین دارد.

گام بعدی شما

  • در انتخاب مدل‌های کوچک (SLM)، بیش از آنکه به تعداد پارامترها اعتماد کنید، بر کیفیت و جامعیت داده‌های پیش‌آموزش تمرکز کنید.
  • اگر در تنظیم دقیق (Fine-tuning) مدل با بن‌بست مواجه شدید، بررسی کنید که آیا دانش مورد نیاز اصلاً در مرحله پیش‌آموزش وجود داشته است یا خیر.
  • مقالات مربوط به GRPO را بخوانید تا متوجه شوید چرا تقویت مدل بدون داشتن دانش پایه، منجر به نتایج توهم‌آمیز می‌شود.

اما تأثیر این محدودیت بر مدل‌های چندوجهی که داده‌های تصویری را ترکیب می‌کنند، ابعاد پیچیده‌تری دارد — به تحلیل ما درباره‌ی مدل‌های VLM مراجعه کنید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی کنترل‌شده، اعتبار این ادعا را تأیید می‌کند که کیفیت داده‌های اولیه بر معماری و حجم محاسبات اولویت دارد. این موضوع باعث می‌شود شرکت‌های توسعه‌دهنده بودجه‌های خود را از خرید GPUهای بیشتر به سمت مهندسی دقیق‌تر داده‌ها سوق دهند.

تأثیر برای ایران

این خبر برای پژوهشگران ایرانی که با محدودیت منابع محاسباتی (GPU) روبر هستند، یک خبر مثبت است؛ زیرا نشان می‌دهد بهینه‌سازی داده‌های آموزشی بسیار مؤثرتر از تلاش برای آموزش مدل‌های غول‌پیکر است.

·نگاه ما
تحریریه دات‌هوش

این یافته‌ها ضربه‌ای به روایت «جادوی مقیاس» (Scaling Magic) می‌زند و ثابت می‌کند که استدلال در مدل‌های زبانی، محصول جانبیِ داشتنِ داده‌های متنوع است، نه یک ویژگی ذاتی که با بزرگ‌تر شدن مدل به‌طور خودکار ظاهر شود. در واقع، پس‌آموزش بیشتر شبیه به یک «فیلتر استخراج» است تا یک «موتور یادگیری»؛ یعنی فقط یاد می‌دهد که چگونه دانش موجود را بهتر بازیابی کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.