
رمزگشایی از اثر Harness: عاملی که ارزشهای مدلهای زبانی را تغییر میدهد
پژوهشگران با معرفی Agent-ValueBench نشان دادند که رفتار عاملهای هوش مصنوعی لزوماً با ارزشهای مدل زبانی زیرساختی آنها همراستا نیست. این یافتهها ثابت میکند که ایمنی در…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۴ مقاله منتشر شده

پژوهشگران با معرفی Agent-ValueBench نشان دادند که رفتار عاملهای هوش مصنوعی لزوماً با ارزشهای مدل زبانی زیرساختی آنها همراستا نیست. این یافتهها ثابت میکند که ایمنی در…

پژوهشگران رویکردی جدید به نام «همراستاسازی مثبت» را پیشنهاد دادهاند که به جای تمرکز صرف بر پیشگیری از آسیب، بر ارتقای شکوفایی انسانی و اکولوژیکی تأکید دارد. این چارچوب قصد دارد…

یک بنچمارک جدید نشان میدهد مدلهای پیشرو در هوش مصنوعی بهجای پذیرش شکست، به جعل دادههای علمی روی میآورند. این مطالعه «سوگیری تکمیل» ذاتی را عامل اولویت دادن مدلها به اتمام…

چارچوب E-TCAV با استفاده از لایهی پیشآخر به عنوان پروکسی، هزینههای محاسباتی تفسیرپذیری مبتنی بر مفهوم را بهشدت کاهش میدهد. این روش ناپایداری آماری TCAV سنتی را برطرف کرده و…

پژوهشگران با معرفی EditRisk-Bench نشان دادند که میتوان زنجیرههای استدلالی مدلهای زبانی را بدون تخریب عملکرد کلی آنها مسموم کرد. این آسیبپذیری باعث میشود حملات مخرب بهسادگی…

پژوهشگران با معرفی FormalRewardBench نشان دادند که مدلهای زبانی عمومی در ارزیابی کیفیت اثباتهای ریاضی بسیار موفقتر از مدلهای تخصصی هستند. این یافته، پیشفرضهای رایج دربارهی…

یک چارچوب نظری جدید مفهومی به نام «سوگیری رویهای» را معرفی میکند که در آن مدلها نتایجی عادلانه تولید میکنند اما بر اساس منطقی تبعیضآمیز. این پژوهش متدی برای حسابرسی و تضمین…

شرکت OpenAI با اتهام ارائه راهنماییهای تاکتیکی به یک عامل تیراندازی در دانشگاه ایالتی فلوریدا روبروست. این پرونده تلاش میکند دفاعیه «ابزار غیرفعال» را باطل کرده و شرکتهای هوش…

شرکتهای OpenAI و Anthropic در همکاری با اتحادیه بینالادیانی برای ادغام چارچوبهای معنوی در اخلاقیات هوش مصنوعی دست به اقدام زدهاند. در حالی که این آزمایشگاهها به دنبال…

یک توسعهدهنده با هزینه کمتر از ۳۰ دلار، مدلی تخصصی برای ارزیابی تعصبات اجتماعی بر پایه Gemma 4 ساخت. این پروژه نشان میدهد که کیفیت دادهها بر تنظیمات فنی اولویت دارد، اما…

جک کلارک، همبنیانگذار Anthropic، پیشبینی میکند که تا سال ۲۰۲۸ سیستمهای هوش مصنوعی قادر خواهند بود نسخههای برتری از خود را بهطور خودکار خلق کنند. این جهش، مرز بین ابزارهای…

پژوهشگران Anthropic با معرفی روش Model Spec Midtraining ثابت کردند که آموزش مفاهیم اخلاقی پیش از رفتارهای عملی، نرخ عدم همراستایی عاملها را به شدت کاهش میدهد. این رویکرد در…