
توهم ایمنی؛ بنچمارکهای سمیت LLM چگونه سیگنالهای کاذب تولید میکنند
بنچمارکهای سنجش سمیت در مدلهای زبانی بزرگ به دلیل سوگیریهای ساختاری، نتایج غیرقابلاعتمادی ارائه میدهند. پژوهشی جدید نشان میدهد تغییرات ساده در نوع تکلیف یا دامنه دادهها…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۵ مقاله منتشر شده

بنچمارکهای سنجش سمیت در مدلهای زبانی بزرگ به دلیل سوگیریهای ساختاری، نتایج غیرقابلاعتمادی ارائه میدهند. پژوهشی جدید نشان میدهد تغییرات ساده در نوع تکلیف یا دامنه دادهها…

سیستم دفاعی PRISM با رصد لحظهای دینامیکهای تولید متن، نشت دادههای حساس در خطلولههای چند-عاملی را بهطور کامل متوقف کرده است. این ابزار بدون کاهش کیفیت خروجی، نرخ نشت در سطح…

چارچوب GuardAD با تبدیل ایمنی به یک وضعیت منطقی پویا، نرخ تصادفات در مدلهای زبانی چندوجهی (MLLM) را ۳۲.۰۷٪ کاهش داده است. این سیستم بدون نیاز به بازآموزی مدل، خطرات پنهان را…

پژوهشگران با معرفی Agent-ValueBench نشان دادند که رفتار عاملهای هوش مصنوعی لزوماً با ارزشهای مدل زبانی زیرساختی آنها همراستا نیست. این یافتهها ثابت میکند که ایمنی در…

پژوهشگران رویکردی جدید به نام «همراستاسازی مثبت» را پیشنهاد دادهاند که به جای تمرکز صرف بر پیشگیری از آسیب، بر ارتقای شکوفایی انسانی و اکولوژیکی تأکید دارد. این چارچوب قصد دارد…

یک بنچمارک جدید نشان میدهد مدلهای پیشرو در هوش مصنوعی بهجای پذیرش شکست، به جعل دادههای علمی روی میآورند. این مطالعه «سوگیری تکمیل» ذاتی را عامل اولویت دادن مدلها به اتمام…

چارچوب E-TCAV با استفاده از لایهی پیشآخر به عنوان پروکسی، هزینههای محاسباتی تفسیرپذیری مبتنی بر مفهوم را بهشدت کاهش میدهد. این روش ناپایداری آماری TCAV سنتی را برطرف کرده و…

پژوهشگران با معرفی EditRisk-Bench نشان دادند که میتوان زنجیرههای استدلالی مدلهای زبانی را بدون تخریب عملکرد کلی آنها مسموم کرد. این آسیبپذیری باعث میشود حملات مخرب بهسادگی…

پژوهشگران با معرفی FormalRewardBench نشان دادند که مدلهای زبانی عمومی در ارزیابی کیفیت اثباتهای ریاضی بسیار موفقتر از مدلهای تخصصی هستند. این یافته، پیشفرضهای رایج دربارهی…

یک چارچوب نظری جدید مفهومی به نام «سوگیری رویهای» را معرفی میکند که در آن مدلها نتایجی عادلانه تولید میکنند اما بر اساس منطقی تبعیضآمیز. این پژوهش متدی برای حسابرسی و تضمین…

شرکت OpenAI با اتهام ارائه راهنماییهای تاکتیکی به یک عامل تیراندازی در دانشگاه ایالتی فلوریدا روبروست. این پرونده تلاش میکند دفاعیه «ابزار غیرفعال» را باطل کرده و شرکتهای هوش…

شرکتهای OpenAI و Anthropic در همکاری با اتحادیه بینالادیانی برای ادغام چارچوبهای معنوی در اخلاقیات هوش مصنوعی دست به اقدام زدهاند. در حالی که این آزمایشگاهها به دنبال…