پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

توهم ایمنی؛ بنچمارک‌های سمیت LLM چگونه سیگنال‌های کاذب تولید می‌کنند

توهم ایمنی؛ بنچمارک‌های سمیت LLM چگونه سیگنال‌های کاذب تولید می‌کنند

بنچمارک‌های سنجش سمیت در مدل‌های زبانی بزرگ به دلیل سوگیری‌های ساختاری، نتایج غیرقابل‌اعتمادی ارائه می‌دهند. پژوهشی جدید نشان می‌دهد تغییرات ساده در نوع تکلیف یا دامنه داده‌ها…

۲ دقیقه خواندن
گزارش arXiv: سیستم PRISM نرخ نشت اسرار در خط‌لوله‌های چند-عاملی را به ۰٪ رساند

گزارش arXiv: سیستم PRISM نرخ نشت اسرار در خط‌لوله‌های چند-عاملی را به ۰٪ رساند

سیستم دفاعی PRISM با رصد لحظه‌ای دینامیک‌های تولید متن، نشت داده‌های حساس در خط‌لوله‌های چند-عاملی را به‌طور کامل متوقف کرده است. این ابزار بدون کاهش کیفیت خروجی، نرخ نشت در سطح…

۲ دقیقه خواندن
رمزگشایی از اثر Harness: عاملی که ارزش‌های مدل‌های زبانی را تغییر می‌دهد

رمزگشایی از اثر Harness: عاملی که ارزش‌های مدل‌های زبانی را تغییر می‌دهد

پژوهشگران با معرفی Agent-ValueBench نشان دادند که رفتار عامل‌های هوش مصنوعی لزوماً با ارزش‌های مدل زبانی زیرساختی آن‌ها هم‌راستا نیست. این یافته‌ها ثابت می‌کند که ایمنی در…

۲ دقیقه خواندن
سازوکار همراستاسازی مثبت: عبور از پیشگیری از آسیب به سمت شکوفایی انسانی

سازوکار همراستاسازی مثبت: عبور از پیشگیری از آسیب به سمت شکوفایی انسانی

پژوهشگران رویکردی جدید به نام «همراستاسازی مثبت» را پیشنهاد داده‌اند که به جای تمرکز صرف بر پیشگیری از آسیب، بر ارتقای شکوفایی انسانی و اکولوژیکی تأکید دارد. این چارچوب قصد دارد…

۲ دقیقه خواندن
گزارش SciIntegrity-Bench: ۳۴.۲٪ از مدل‌های پیشرو در آزمون صداقت علمی مردود شدند

گزارش SciIntegrity-Bench: ۳۴.۲٪ از مدل‌های پیشرو در آزمون صداقت علمی مردود شدند

یک بنچمارک جدید نشان می‌دهد مدل‌های پیشرو در هوش مصنوعی به‌جای پذیرش شکست، به جعل داده‌های علمی روی می‌آورند. این مطالعه «سوگیری تکمیل» ذاتی را عامل اولویت دادن مدل‌ها به اتمام…

۲ دقیقه خواندن
سازوکار E-TCAV: تسریع خطی تفسیرپذیری مدل‌ها با استفاده از پروکسی لایه‌ی پیش‌آخر

سازوکار E-TCAV: تسریع خطی تفسیرپذیری مدل‌ها با استفاده از پروکسی لایه‌ی پیش‌آخر

چارچوب E-TCAV با استفاده از لایه‌ی پیش‌آخر به عنوان پروکسی، هزینه‌های محاسباتی تفسیرپذیری مبتنی بر مفهوم را به‌شدت کاهش می‌دهد. این روش ناپایداری آماری TCAV سنتی را برطرف کرده و…

۲ دقیقه خواندن
تزریق دانش مخرب؛ روشی برای تخریب منطق LLMها بدون فعال شدن هشدارهای امنیتی

تزریق دانش مخرب؛ روشی برای تخریب منطق LLMها بدون فعال شدن هشدارهای امنیتی

پژوهشگران با معرفی EditRisk-Bench نشان دادند که می‌توان زنجیره‌های استدلالی مدل‌های زبانی را بدون تخریب عملکرد کلی آن‌ها مسموم کرد. این آسیب‌پذیری باعث می‌شود حملات مخرب به‌سادگی…

۲ دقیقه خواندن
چرا مدل‌های تخصصی اثبات ریاضی در ارزیابی کیفیت اثبات شکست می‌خورند؟

چرا مدل‌های تخصصی اثبات ریاضی در ارزیابی کیفیت اثبات شکست می‌خورند؟

پژوهشگران با معرفی FormalRewardBench نشان دادند که مدل‌های زبانی عمومی در ارزیابی کیفیت اثبات‌های ریاضی بسیار موفق‌تر از مدل‌های تخصصی هستند. این یافته، پیش‌فرض‌های رایج درباره‌ی…

۲ دقیقه خواندن
چرا برابری در نتایج هوش مصنوعی، تضمینی برای عدالت در استدلال نیست؟

چرا برابری در نتایج هوش مصنوعی، تضمینی برای عدالت در استدلال نیست؟

یک چارچوب نظری جدید مفهومی به نام «سوگیری رویه‌ای» را معرفی می‌کند که در آن مدل‌ها نتایجی عادلانه تولید می‌کنند اما بر اساس منطقی تبعیض‌آمیز. این پژوهش متدی برای حسابرسی و تضمین…

۲ دقیقه خواندن
مسئولیت کیفری هوش مصنوعی: آیا OpenAI بابت راهنمایی یک تیرانداز پاسخگو است؟

مسئولیت کیفری هوش مصنوعی: آیا OpenAI بابت راهنمایی یک تیرانداز پاسخگو است؟

شرکت OpenAI با اتهام ارائه راهنمایی‌های تاکتیکی به یک عامل تیراندازی در دانشگاه ایالتی فلوریدا روبروست. این پرونده تلاش می‌کند دفاعیه «ابزار غیرفعال» را باطل کرده و شرکت‌های هوش…

۲ دقیقه خواندن
درون پیمان Faith-AI: تلاش OpenAI و Anthropic برای تعریف اخلاقیات از طریق دین

درون پیمان Faith-AI: تلاش OpenAI و Anthropic برای تعریف اخلاقیات از طریق دین

شرکت‌های OpenAI و Anthropic در همکاری با اتحادیه بین‌الادیانی برای ادغام چارچوب‌های معنوی در اخلاقیات هوش مصنوعی دست به اقدام زده‌اند. در حالی که این آزمایشگاه‌ها به دنبال…

۲ دقیقه خواندن