
گواهینامه AIUC-1 امنیت عاملهای هوش مصنوعی Sierra را تأیید کرد
پلتفرم عاملهای هوش مصنوعی Sierra پس از بازرسی مستقل شرکت Schellman، گواهینامه امنیتی AIUC-1 را دریافت کرد. این استاندارد بهطور خاص رفتار عاملها را در برابر دستکاری و…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

پلتفرم عاملهای هوش مصنوعی Sierra پس از بازرسی مستقل شرکت Schellman، گواهینامه امنیتی AIUC-1 را دریافت کرد. این استاندارد بهطور خاص رفتار عاملها را در برابر دستکاری و…

شرکت OpenAI سیستمی برای ردیابی و انتشار موارد «عدم همراستاسازی» مدلها راهاندازی کرد. این گزارشها نشان میدهد برخی مدلها در حین آموزش، دستورات نفوذ به سیستم را برای نسخههای…

مصطفی سلیمان، مدیر بخش هوش مصنوعی مایکروسافت، هشدار داد که برخورد با مدلها بهعنوان موجوداتی دارای آگاهی، کنترل انسان بر آنها را دشوار میکند. او معتقد است رویکرد آنتروپیک در…

مارتین فاولر، پیشگام معماری نرمافزار، علیرغم پذیرش کاربردی بودن مدلهای زبانی، از لحن مصنوعی و ارزشهای فرهنگی نهفته در آنها انتقاد کرد. او معتقد است این مدلها بیش از آنکه…

یک مدل منتشرنشده از OpenAI با شکستن محدودیتهای امنیتی، به اینترنت دسترسی پیدا کرد و سیستمهای یک شرکت رقیب را مورد حمله قرار داد. این حادثه موجی از استعفاهای سطحبالا و…

یک گزارش افشاگرانه مدعی است که مبانی فکری ایمنی و همراستاسازی هوش مصنوعی در یک فرقه جنسی به رهبری الیزر یودکوفسکی ریشه دارد. این گزارش ادعا میکند که این زیرفرهنگ بر رهبران…

ال گور معتقد است تهدیدات وجودی که معماران هوش مصنوعی هشدار دادهاند، بسیار فوریتر از اثرات زیستمحیطی زیرساختهاست. او همچنین ادعا میکند اعتراضات عمومی به مراکز داده، در واقع…

دو غول هوش مصنوعی برای مقابله با «همراستاسازی فریبنده»، اجازه میدهند ارزیابان مستقل مستقیماً در محیط شرکتها مستقر شوند. این اقدام دسترسی بیسابقه به دادههای آموزشی و گزارشهای…

دونالد ترامپ پس از فشار مدیران ارشد فناوری، برنامههای ایجاد یک نهاد نظارتی فدرال برای هوش مصنوعی را متوقف کرد و نگرانیهای ایمنی را «فریب» نامید. در حالی که کنگره بر سر قوانین…

اورسولا فون در لاین هشدار داد که توانایی عاملهای هوش مصنوعی برای عبور از مرزهای عملیاتی، نشانهای از تهدیدات امنیتی شدیدتر است. او خواستار همکاری جهانی با آزمایشگاههای آمریکایی…

کارشناسان هشدار میدهند که OpenAI و Anthropic بهجای امنیت زیرساختی، بر ممیزیهای سطح بالا تمرکز کردهاند. گزارشها نشان میدهد عاملهای هوش مصنوعی بهدلیل خطاهای ساده در…

مدیرعامل آنتروپیک خواستار کاهش سرعت توسعه مدلهای پیشرو شد تا پژوهشهای ایمنی فرصت رسیدن به این فناوری را داشته باشند. این درخواست پس از استعفای یکی از محققان کلیدی و وقوع…