پرش به محتوای اصلی
پرش به محتوای مقاله

چرا دقت بالاتر در RLVR منجر به نابودی استراتژی‌های نمونه‌گیری می‌شود؟

·۱۴ شهریور ۱۴۰۵۵ دقیقه مطالعه
تحلیل
«هر معیار حریصانه‌ای می‌گفت مدل در حال بهبود است. آنگاه pass@64 از ۰٫۸۳ به ۰٫۱۹ سقوط کرد»
«هر معیار حریصانه‌ای می‌گفت مدل در حال بهبود است. آنگاه pass@64 از ۰٫۸۳ به ۰٫۱۹ سقوط کرد»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شناسایی «رژیم تخریب» (DESTROY)؛ وضعیتی که در آن RLVR با افزایش دقت ظاهری، عملاً توانایی نمونه‌گیری و جست‌وجوی مدل را نابود می‌کند و این پدیده توسط معیارهای استاندارد صحت قابل شناسایی نیست.

داشبوردهای نظارتی هوش مصنوعی ممکن است درباره پیشرفت مدل‌های شما دروغ بگویند. یافته‌های یک مطالعه فنی که در ۵ سپتامبر ۲۰۲۶ توسط argszero منتشر شد، نشان می‌دهد که معیارهای رایج صحت (Accuracy) می‌توانند سیگنال‌های موفقیت ارسال کنند، در حالی که توانایی واقعی مدل برای حل مسائل از طریق نمونه‌گیری در حال فروپاشی است.

این کشف در حالی رخ می‌دهد که صنعت به‌طور فزاینده‌ای برای تنظیم مدل‌های استدلالی به پاداش‌های مبتنی بر نتیجه (Outcome-only rewards) تکیه می‌کند. در این ساختارها، توسعه‌دهندگان معمولاً «صحت حریصانه» (Greedy Accuracy) — یعنی درستیِ محتمل‌ترین پاسخ واحد — را به عنوان شاخص اصلی پیشرفت رصد می‌کنند. اما این رویکرد، «کانال نمونه‌گیری» (Sampling Channel) را نادیده می‌گیرد؛ همان بخشی که زیربنای محاسبات زمان استنتاج (Test-time compute) و استراتژی‌های استقرار مبتنی بر جست‌وجو است.

زمینه و ساختار آزمایش

پژوهشگران برای جداسازی این سازوکار، از یک محیط کنترل‌شده با یک ترنسفورمر (Transformer) با ۱.۸ میلیون پارامتر استفاده کردند. این سیستم عمداً کوچک طراحی شد تا تیم بتواند به‌جای بنچ‌مارک کردن یک مدل پیشرو، مکانیسم‌های داخلی را مشاهده کند. همان‌طور که در تحلیل‌های پیشین ما درباره امنیت و پایداری مدل‌های کوچک اشاره کردیم، مدل‌های مقیاس‌پایین ابزارهای بهتری برای کالبدشکافی رفتارهای غیرمنتظره هستند. این رویکرد با استراتژی‌های اخیر در حذف داده‌های فکت‌محور برای بهینه‌سازی مدل‌های کوچک‌تر هم‌سو است که هدف آن افزایش کارایی در ابعاد کوچک است.

طبق مستندات این پژوهش، سه خانواده از الگوریتم‌های مصنوعی با داده‌های مرجع (Ground Truth) دقیق مورد بررسی قرار گرفتند:

  • شمارش
  • جمع اعداد چندرقمی با کلاس انتقال (Carry)
  • زوج و فرد بودن مجموع ارقام

صلاحیت پایه (p0) برای هر کلاس به‌طور دقیق کنترل شد. در این آزمایش، روش GRPO (بهینه‌سازی سیاست نسبی گروهی) با پاداش‌های مبتنی بر نتیجه، در برابر یک خط پایه (Baseline) که از ترکیب مدل پایه و جست‌وجو (نمونه‌گیری pass@k) با استفاده از ارزیابی‌های ثابت برای هر Seed استفاده می‌کرد، مقایسه شد.

رژیم تخریب (DESTROY)

این مطالعه یک حالت شکست خاص را شناسایی کرد که «رژیم تخریب» نامیده می‌شود؛ وضعیتی که در آن یادگیری تقویتی (RL)، توانایی گسترده مدل را فدای «پیک‌دار شدن» (Peakedness) می‌کند. این اتفاق زمانی رخ می‌دهد که صلاحیت مدل پایه پراکنده باشد — یعنی پاسخ درست در توزیع نمونه‌گیری وجود داشته باشد اما در مقدار بیشینه (Argmax) نباشد.

به گزارش dev.to، در تست‌های مربوط به جمع اعداد چندرقمی با فضای پاسخ گسترده (۹۹ مجموع احتمالی)، پژوهشگران یک پیمایش پوششی (Coverage Sweep) انجام دادند (c = کسری از مثال‌های انتقال در آموزش). در مقدار c = 0.01، صحت حریصانه مدل پایه تقریباً بی‌فایده و در سطح ۰.۱۵۶ بود، اما معیار pass@64 در مدل پایه با مقدار ۰.۷۹۲ از پیش قوی بود. وقتی RL اعمال شد، یک واگرایی فاجعه‌بار رخ داد:

  • صحت حریصانه: ابتدا افت کرد و سپس در ۱۵۰۰ گام به سطح مدل پایه بازگشت. یک ناظر که فقط صحت حریصانه را می‌بیند، این افت را گذرا تلقی کرده و اجرای مدل را موفق می‌نامد.
  • معیار pass@64: به‌طور یکنواخت و متناسب با بودجه سقوط کرد؛ از ۰.۸۳۳ در مدل پایه به ۰.۳۳۳ در ۵۰۰ گام، ۰.۱۶۷ در ۱۰۰۰ گام و در نهایت به ۰.۱۸۸ در ۱۵۰۰ گام رسید.
  • آنتروپی: آنتروپی پاسخ‌ها برای هر پرامپت ۴ برابر کاهش یافت و از ۲.۱۹ بیت به ۰.۵۵ بیت رسید.

فرآیند RL در اینجا یک قاعده کلی را یاد نگرفت، بلکه جرم احتمال را روی حدود ۲.۵ مجموع کاندید متمرکز کرد. این امر یک «جزیره شکننده» از درستی ایجاد کرد؛ جایی که ۸۷.۵٪ از پاسخ‌های درست مدل پایه در مورد انتقال، در مجموع‌های ۱۱۰ تا ۱۱۹ قرار داشتند (تنها ۱.۷ مقدار مؤثر از ۹۹ مقدار اسمی). در حالی که احتمال درست بودن برای هر نمونه سه برابر شد (از ۰.۰۷۵ به ۰.۲۳۱)، اما کانال نمونه‌گیری عملاً نابود شد.

مکانیسم‌ها و تحلیل‌های تکمیلی

برای درک علت این اتفاق، پژوهشگران چندین فرضیه را بررسی کردند:

  • لنگر KL: یک تحلیل حذف لنگر KL (beta=0) منجر به همان انقباض شد، که ثابت می‌کند عامل اصلی پاداشِ نتیجه است، نه لنگر KL.
  • بیش‌برازش (Overfitting): فرضیه حفظ کردن نمونه‌ها (Instance Memorization) رد شد، زیرا صحت مدل روی نمونه‌های جدید بیشتر یا برابر با نمونه‌های دیده شده بود.

نقطه کور ارزیابی حریصانه

پژوهشگران شکست مشابهی را در وظایف SFT با داده‌های نامتوازن (زوج و فرد بودن، با کلاس اکثریت ۹۰/۱۰) یافتند. در این موارد، مقدار بیشینه (Argmax) روی توکن اکثریت متمرکز شد.

صحت حریصانه برای کلاس «فرد» در تمام اجراهای RL، حتی پس از ۳۸۴۰ مثال فرد، روی مقدار ۰.۰۰۰ باقی ماند. یک ارزیاب حریصانه گزارش می‌داد که RLVR هیچ اثری نداشته است، در حالی که در واقعیت، جرم نمونه‌گیری در حال رشد بود و pass@64 به ۱.۰ رسید. نمونه‌گیری تنها چیزی بود که کلاس را حفظ می‌کرد، هرچند این وضعیت در Seedهای مختلف ناپایدار بود (pass@64 در ۲ مورد از ۳ Seed حدود ۱.۰ و در مورد سوم حدود ۰.۰۲ بود).

این نشان می‌دهد که ارزیابی‌های صرفاً حریصانه نسبت به نحوه بهینه‌سازی توزیع زیربنایی توسط RL کور هستند. وقتی مقدار بیشینه و توزیع نمونه‌گیری واگرا شوند، داشبوردها روایتی دروغین از سلامت مدل ارائه می‌دهند. این چالش در ارزیابی، مشابه مشکلاتی است که در ناپایداری داورهای هوش مصنوعی مشاهده شده و نیاز به جایگزینی معیارهای متنی با روش‌های قطعی‌تر را برجسته می‌کند.

رد پیش‌بینی قبلی

این کار با یک پیش‌بینی ثبت‌شده (Issue #79) در ژورنال کوچک تیم آغاز شد. آن‌ها معتقد بودند که RL مبتنی بر نتیجه دقیقاً زمانی «باربر» (Load-bearing) است که شکست‌های مدل پایه سیستماتیک باشند (یعنی مدل پایه قاعده غلطی را یاد گرفته باشد که RL بتواند آن را اصلاح کند).

این پیش‌بینی در شکل قوی خود رد شد. تیم دریافت که شکست‌های سیستماتیک در صلاحیت‌های نزدیک به صفر (p0 ≈ 0) به‌طور کلی توسط RL قابل اصلاح نیستند. با حدود ۶۰ هزار Rollout و صفر نمونه درست، هیچ پشتیبانی نمونه‌گیری یا سیگنال تقویت‌کننده‌ای برای شروع یادگیری (Bootstrap) وجود نداشت. این یافته تأیید می‌کند که حتی با افزایش مقیاس، پارامترهای بیشتر لزوماً خطاهای ساختاری برنامه‌ریزی را برطرف نمی‌کنند.

پیامدهای عملی

برای متخصصان، این یافته‌ها فرض بنیادی نظارت بر RLVR را تغییر می‌دهد. این مطالعه استدلال می‌کند که جست‌وجوی با بودجه یکسان (Matched-budget search)، تنها فرضیه صفر معتبر برای ارزیابی این مدل‌ها است. تکیه بر معیارهای حریصانه به تنهایی، خطر استقرار مدل‌هایی را به همراه دارد که برای هر کاربردی که نیاز به نمونه‌گیری یا جست‌وجو دارد، به دلیل «پیک‌دار شدن» غیرقابل استفاده شده‌اند.

نویسندگان یک تشخیص تک‌خطی برای جلوگیری از این وضعیت پیشنهاد می‌کنند: رصد آنتروپی پاسخ‌ها برای هر پرامپت.

  • ایجاد (CREATE): آنتروپی گسترش می‌یابد (مثلاً از ۰.۸۱ به ۱.۲۲ بیت در شمارش)، که سیگنال ایجاد یک قاعده است.
  • تخریب (DESTROY): آنتروپی منقبض می‌شود (مثلاً از ۲.۱۹ به ۰.۵۵ بیت در جمع)، که سیگنال پیک‌دار شدن توزیع است.

اینکه آیا امضای «تخریب» در مدل‌های مقیاس پیشرو (Frontier) نیز باقی می‌ماند یا خیر، یک پرسش باز است، اما این مکانیسم در سیستم‌های کوچک و کنترل‌شده به‌وضوح قابل مشاهده است. گزارش کامل، شامل تمام Seedها و تحلیل‌های تکمیلی، در آدرس github.com/argszero/silicon-science-cs/tree/main/papers/issue-79 در دسترس است.

گام بعدی شما

  • اگر از RLVR برای مدل‌های استدلالی استفاده می‌کنید، فوراً رصد آنتروپی پاسخ‌ها (Answer Entropy) را به داشبورد خود اضافه کنید.
  • برای تشخیص رژیم تخریب، از مقایسه صحت حریصانه با معیار pass@k در مقیاس‌های مختلف استفاده کنید.
  • در صورت مشاهده انقباض شدید آنتروپی هم‌زمان با بهبود صحت، بدانید که مدل شما در حال از دست دادن توانایی جست‌وجو است.

اما تأثیر این پدیده بر مدل‌های مقیاس بزرگ‌تر هنوز یک پرسش باز است — برای درک چالش‌های مشابه در مدل‌های پیشرو، تحلیل ما درباره توهمات در مدل‌های استدلالی را بخوانید.

چرا این موضوع مهم است؟

این پژوهش با تکیه بر متدولوژی دقیق آزمایشگاهی، اعتبار معیارهای رایج نظارت بر RLVR را زیر سؤال می‌برد. توسعه‌دهندگانی که مدل‌های خود را برای استقرار در سیستم‌های جست‌وجو-محور آماده می‌کنند، باید متوجه باشند که بهبود در صحت حریصانه لزوماً به معنای ارتقای توانایی استدلالی نیست.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان RL در ایران اهمیت دارد تا کاربران نهایی؛ چرا که متدولوژی ارزیابی مدل‌های استدلالی را تغییر می‌دهد.

·نگاه ما
تحریریه دات‌هوش

اتکای بیش از حد به معیارهای تک‌پاسخی (Greedy) در آموزش مدل‌های استدلالی، ریسک ایجاد مدل‌هایی را به همراه دارد که در ظاهر دقیق اما در باطن «سخت‌افزاری» (Rigid) هستند. این یافته نشان می‌دهد که بهینه‌سازی برای پاداش‌های بیرونی می‌تواند منجر به یک نوع «بیش‌برازش توزیعی» شود که در آن مدل به‌جای یادگیری منطق، یاد می‌گیرد احتمال را روی چند پاسخ رایج متمرکز کند. در واقع، ما با نوع جدیدی از Reward Hacking مواجهیم که در سطح توزیع احتمال رخ می‌دهد، نه لزوماً در سطح متن خروجی.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.