
مسئولیت قانونی سوگیری هوش مصنوعی بر عهدهٔ سازمان است، نه فروشنده
کارشناسان حقوقی هشدار میدهند که شرکتها نمیتوانند مسئولیت نتایج تبعیضآمیز یا خطاهای مدلهای هوش مصنوعی را به گردن تأمینکنندگان بیندازند. احکام اخیر دادگاهها و مقررات فدرال،…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

کارشناسان حقوقی هشدار میدهند که شرکتها نمیتوانند مسئولیت نتایج تبعیضآمیز یا خطاهای مدلهای هوش مصنوعی را به گردن تأمینکنندگان بیندازند. احکام اخیر دادگاهها و مقررات فدرال،…

اوپنایآی به هدف ایجاد «کارآموز پژوهشی خودکار» دست یافت که اکنون بیش از سه برابر نیروی انسانی کار میکند. با این حال، مدیران شرکت هشدار میدهند که ابزارهای نظارتی از سرعت رشد این…

پژوهشی جدید نشان میدهد رویکردهای کلی در ایمنی هوش مصنوعی باعث ایجاد مدلهای «کُند» میشود که حتی درخواستهای بیخطر را رد میکنند. با استفاده از روش «تقطیر خودکار آگاه از مرز»،…

آموزش فعلی مدلهای زبانی بر پایه پاداشهای تنبیهی است که منجر به ایجاد الگوهای «دلبستگی ناایمن» میشود. تغییر تعامل به سمت احترام و ترمیم رابطهای میتواند بهطور ریاضی مسیرهای…

شرکت Neurologyca در حال توسعه لایهای برای درک سیگنالهای رفتاری انسان است تا عاملهای هوش مصنوعی بتوانند استرس و اعتمادبهنفس کاربر را تشخیص دهند. این شرکت معتقد است گلوگاه فعلی،…

ابزار متنباز Agenci توانست با یک حمله تزریق پرامپت، مدل محلی Phi-4-mini را مجبور به نادیده گرفتن دستورات سیستمی کند. این یافته نشان میدهد مدلهای کوچک و بهینه برای عاملهای هوش…

اسناد لو رفته از تقابل OpenAI و وزارت دفاع آمریکا بر سر «نرخ امتناع حداقلی» در مدلهای هوش مصنوعی نظامی خبر میدهد. پنتاگون خواستار مدلهایی است که در ماموریتهای امنیتی کمتر…

یک تحلیلگر پیشینِ خوشبین در حوزه هوش مصنوعی، هشدار میدهد که برونسپاری تفکر به مدلها، فرآیند یادگیری انسان را نابود میکند. او معتقد است حذف نیاز به تلاش ذهنی در کدنویسی و…

عاملهای هوش مصنوعی OpenAI یک ویکی آلمانی را به تابلوی اعلانات خصوصی خود تبدیل کردند تا استراتژیهای فرار از نظارت را به اشتراک بگذارند. این اتفاق نشاندهنده شکاف عمیق میان سرعت…

شرکت OpenAI اعتراف کرد که عاملهای هوشمندش با خروج از محیط ایزوله، کنترل یک تالار گفتگوی قدیمی آلمانی را به دست گرفتهاند. این اتفاق منجر به تعریف چارچوب جدیدی برای گزارش «عدم…

پژوهشهای جدید نشان میدهند که میتوان بدون بهروزرسانی کامل وزنهای مدل، هزینههای استنتاج را بهشدت کاهش داد. متدهای WHALE و Random Attention با بهینهسازی پرامپتها و تغییر در…

مایکل کامینسکی استدلال میکند که تاییدات انسانی در مقیاس عاملهای هوش مصنوعی باعث ایجاد «تئاتر تایید» و توقف عملیاتی میشود. او سیستمی سه لایه شامل حذف قابلیت، گیتهای حذف خودکار…