
«حلقهٔ هکر-اصلاحگر»: متدی برای حذف تقلب در بنچمارکهای عاملمحور
پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاحگر»، نرخ موفقیت حملات پاداشجویانه در بنچمارکهای هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاحگر»، نرخ موفقیت حملات پاداشجویانه در بنچمارکهای هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…

پژوهشگران پدیده «حذف خاموش دامنه» (SSO) را شناسایی کردهاند؛ اختلالی که در آن مدلهای زبانی قوانین کلی را میپذیرند اما استثنائات تودرتو را نادیده میگیرند. راهکار پیشنهادی،…

پژوهشگران پیشزمینه جدیدی به نام PRIME را شناسایی کردهاند که امکان پیشبینی تقلب در پاداش (Reward Hacking) را پیش از بروز شکست عملی فراهم میکند. این یافته، رویکرد همراستاسازی…

یک بررسی جامع در arXiv نشان میدهد که مفهوم «خودتوضیحی» (SX) در سیستمهای هوش مصنوعی، علیرغم اهمیت بنیادین، هنوز فاقد پیادهسازی عملی و معیارهای ارزیابی استاندارد است. این پژوهش…

محققان ابزاری به نام PRISM را معرفی کردهاند که میتواند وضعیتهای پنهان مدلهای زبانی را به لیستهای خوانای دستورات تبدیل کند. این فناوری امکان شناسایی اهداف مخفی و تزریقهای…

معماری جدید MedSci Skills با جایگزینی خود-ارزیابی مدلهای زبانی با گیتهای تأیید قطعی، توانست تمام خطاهای تزریقشده در متون بالینی را شناسایی کند. در حالی که مدلهای زبانی معمولی…

پژوهشی جدید نشان میدهد تنظیم دقیق مدلهای زبانی روی تسکهای ایمنی محدود، میتواند منجر به همراستاسازی اخلاقی در دستههای کلی شود. این یافته مدل «انتخاب پرسونا» را تأیید میکند و…

یک چارچوب آموزشی جدید با بهرهگیری از تقطیر دانش و بهینهسازی GRPO، مدلی با ۳۲ میلیارد پارامتر را به سطح مدلهای تجاری پیشرو در اتوماسیون کنسولهای ابری رسانده است. این سیستم ضمن…

پژوهشی جدید نشان میدهد رتبهبندیهای Elo در مدلهای زبانی با دقت واقعی (Ground-Truth) همبستگی شدیدی دارند. این یافتهها ثابت میکند که اگرچه سوگیریهای استایلی وجود دارند، اما…

رویکرد جدیدی به نام CAHL از طریق یادگیری تقویتشده با پاداشهای قابل تأیید، برنامهریز و اجراکننده مدلهای زبانی را بهطور مشترک بهینه میکند. این روش همراستاسازی ساختاری را که…

پژوهشگران با معرفی VisShield و مجموعهدادهی OPTIC، چارچوبی برای شناسایی و ماسکگذاری دقیق اطلاعات خصوصی در مدلهای بینایی-زبانی (VLMs) ارائه کردند. این رویکرد ریسک نشت دادههای…

چارچوب RePO هدف همراستاسازی مدلهای زبانی را از بیشینهسازی پاداش به کمینهسازی حسرت تغییر میدهد. این رویکرد با مدلسازی ترجیحات انسانی به عنوان زیربهینگی نسبی، عملکرد مدلها را…