پرش به محتوای اصلی
پرش به محتوای مقاله

RePO: جایگزینی بیشینه‌سازی پاداش با کمینه‌سازی حسرت در همراستاسازی LLM‌ها

·۱۹ خرداد ۱۴۰۵۱ دقیقه مطالعه
RePO: جایگزینی بیشینه‌سازی پاداش با کمینه‌سازی حسرت در همراستاسازی LLM‌ها
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر تابع هدف در همراستاسازی از بیشینه‌سازی یک سیگنال پاداش اسکالر به تحلیل «زیربهینگی نسبی» یا حسرت برای بهبود استدلال.

بیشینه‌سازی پاداش، استاندارد فعلی همراستاسازی (Alignment) مدل‌هاست، اما این رویکرد یک نقص بنیادین دارد: نادیده گرفتن نحوه ادراک واقعی انسان از ارزش.

اگر تصور می‌کنید مدل‌های زبانی تنها با پاداش‌های مثبت یاد می‌گیرند، در اشتباهید. طبق یافته‌های جدید، مدل‌ها زمانی بهتر عمل می‌کنند که به جای جست‌وجوی «بهترین پاسخ»، سعی کنند «کمترین میزان حسرت» را تجربه کنند.

اکثر گردش‌کارهای یادگیری تقویت‌شده از بازخورد انسانی (RLHF) بر یک سیگنال پاداش عددی تکیه می‌کنند تا مدل را به سمت پاسخ «درست» هل دهند. با این حال، انسان‌ها معمولاً کیفیت یک خروجی را نه بر اساس ارزش مطلق، بلکه بر اساس اینکه آن پاسخ چقدر با جایگزین بهترش فاصله دارد، می‌سنجند؛ شکاف روان‌شناختی‌ای که به عنوان حسرت شناخته می‌شود. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی محدودیت‌های RLHF اشاره کردیم، این نادیده‌انگاری در وظایف استدلالی شدید است، جایی که یک خطای منطقی کوچک، کل راه‌حل را زیربهین می‌کند.

در ۹ ژوئن ۲۰۲۶، چارچوب RePO (Regret-based Preference Optimization) منتشر شد که یادگیری ترجیحات را به عنوان ارزیابی‌های شرطی از زیربهینگی (Suboptimality) نسبی بازتعریف می‌کند. به نقل از مستندات منتشر شده در arXiv.org، این سامانه بر محورهای زیر تمرکز دارد:

نویسندگان گزارش داده‌اند که این روش منجر به بهبودهای مستمر در عملکرد شده است، هرچند درصد دقیق این ارتقاء نسبت به روش‌های پایه RLHF افشا نشده است.

این رویکرد این فرض قدیمی را که یک تابع پاداش ایستا (Static) برای استدلال‌های پیچیده کافی است، می‌شکند. با مدل‌سازی «حسرت»، توسعه‌دهندگان می‌توانند عامل‌هایی بسازند که در برابر دست‌کاری پاداش (Reward Hacking) مقاوم‌ترند و تفاوت بین مسیرهای «تقریباً درست» و «کاملاً غلط» را بهتر درک می‌کنند. این نشان می‌دهد مسیر رسیدن به استدلال در سطح انسانی، در درک هزینه اشتباهات نهفته است، نه فقط پاداش موفقیت.

گام بعدی شما

  • اگر بر روی همراستاسازی مدل‌های تخصصی کار می‌کنید، متدولوژی RePO را برای کاهش نرخ توهم در استدلال‌های ریاضی بررسی کنید.
  • پیاده‌سازی فنی این چارچوب را از طریق مخزن arXiv.org مطالعه کنید.
  • بررسی کنید که آیا کمینه‌سازی حسرت در وظایف خلاقانه (که اندازه گیری آن سخت‌تر است) نیز کاربرد دارد یا خیر.

اما تأثیر این تغییر در مصرف منابع محاسباتی و هزینه استنتاج همچنان مبهم است — به تحلیل ما درباره‌ی بهینه‌سازی هزینه‌ی استنتاج مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر پارادایم باعث می‌شود عامل‌های هوش مصنوعی در برابر دست‌کاری پاداش مقاوم‌تر شوند. اعتبار این روش از طریق داده‌های واقعی ترجیحات انسانی تأیید شده و استانداردهای همراستاسازی را به سمت مدل‌های استدلالی دقیق‌تر می‌برد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و متخصصان همراستاسازی در ایران اهمیت دارد تا بازار مصرف نهایی یا کاربران عادی.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که RePO در واقع گامی به سوی مدل‌سازی «تفکر انتقادی» در مدل‌های زبانی است. به جای اینکه مدل صرفاً به دنبال پاسخ درست باشد، یاد می‌گیرد هزینه هر مسیر اشتباه را بسنجد؛ رویکردی که می‌تواند فاصله بین استدلال‌های احتمالاتی فعلی و منطق سخت (Hard Logic) را پر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.