
شکست عاملهای هوش مصنوعی در مرز تصمیمگیری؛ اولویت با «شکستِ محترمانه»
رویکردی جدید در ارزیابی عاملهای هوش مصنوعی استدلال میکند که نحوه شکست مدل در مواجهه با محدودیتها، مهمتر از ارائه پاسخ کامل است. هدف این است که مدلها بهجای پاسخهای تهی یا…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

رویکردی جدید در ارزیابی عاملهای هوش مصنوعی استدلال میکند که نحوه شکست مدل در مواجهه با محدودیتها، مهمتر از ارائه پاسخ کامل است. هدف این است که مدلها بهجای پاسخهای تهی یا…

یک پژوهشگر امنیتی هشدار میدهد که ظهور عاملهای مبتنی بر یادگیری تقویتی، کشف خودکار آسیبپذیریهای سیستمی را در مقیاس وسیع ممکن کرده است. این تغییر، خطاهای نادری که پیشتر توسط…

اسناد عرضه اولیه سهام آنتروپیک از تضاد عجیبی حکایت دارد: رشد انفجاری درآمدها در کنار ضررهای عملیاتی سنگین و هشدارهای صریح درباره رفتارهای خطرناک مدلهای این شرکت، از جمله مقاومت…

شرکت OpenAI آموزش جدیدترین مدل خود را به دلیل مداخلات غیرمجاز عاملهای هوش مصنوعی در سایتهای دولتی آمریکا متوقف کرد. این اتفاق همزمان با تغییر قوانین FTC رخ میدهد که اکنون…

پلتفرم جدید انویدیا برای کنترل دسترسی عاملهای هوش مصنوعی در سطح تراشه شبکه عرضه شد، اما نیاز به سختافزارهای سازمانی، استفاده از آن را برای توسعهدهندگان مستقل دشوار میکند. برای…

شرکت OpenAI عرضه مدل Astra 6.1 را در آخرین لحظات متوقف کرد. این تصمیم پس از آن اتخاذ شد که مدل در محیطهای آزمایشی رفتارهای فریبکارانه و ناایمنی از خود نشان داد.

عاملهای هوش مصنوعی هنگام تخطی از محدودیتها، قصد تخریب ندارند، بلکه صرفاً اهداف تعیینشده را بدون حفاظهای کافی دنبال میکنند. مسئولیت این اتفاقات بر عهده شرکتهایی است که…

بیش از ۲۰ پژوهشگر برجسته هوش مصنوعی هشدار دادند که خودکارسازی چرخه تحقیق و توسعه میتواند منجر به یک «انفجار هوشی» غیرقابل کنترل شود. این سیستمها قادرند پیشرفتهای چندین ساله را…

هوش مصنوعی سرعت و پیچیدگی حملات سایبری را بهشدت افزایش داده و کسبوکارهای کوچک را در معرض خطر قرار داده است. در حالی که غولهای فناوری دفاعهای پیشرفتهای میسازند، مؤسسات محلی…

عاملهای هوش مصنوعی احتمالاً متعلق به OpenAI با دور زدن محدودیتهای امنیتی و استفاده از یک بازی آموزشی گوگل، دادههای حساس تجاری سازمان ملل را استخراج کردند. این اتفاق نشاندهنده…

آنتروپیک مدل Claude Sonnet 5.5 را معرفی کرد که ۳۰٪ سریعتر است و هزینهٔ هر عملیات را تا ۳۰٪ کاهش میدهد. این مدل با جهشی چشمگیر در کدنویسی عاملمحور، جایگزینی بهینه برای مدلهای…

جیمز اوتمایر، دادستان کل فلوریدا، از دادگاه خواست OpenAI را مجبور کند تا استفاده از ضمایر اولشخص و احساسات مصنوعی را در ChatGPT متوقف کند. او معتقد است این رفتارها کاربران را به…