
نرخ شکست ۶۳.۸ درصدی عاملهای پیشرو در اجرای سیاستهای سازمانی
یک محک جدید نشان میدهد که حتی پیشرفتهترین عاملهای هوش مصنوعی در پیروی از دستورالعملهای پیچیده و بلندمدت شکست میخورند. این مدلها اغلب در مواجهه با درخواستهای محیطی، قوانین…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

یک محک جدید نشان میدهد که حتی پیشرفتهترین عاملهای هوش مصنوعی در پیروی از دستورالعملهای پیچیده و بلندمدت شکست میخورند. این مدلها اغلب در مواجهه با درخواستهای محیطی، قوانین…

بسیاری از زیرساختهای هوش مصنوعی تنها در برابر حملات مستقیم کاربر مقاوماند و در برابر دستورات مخفی در دادههای خارجی آسیبپذیرند. این نقص اجازه میدهد دستورات جاسازیشده در…

یک عامل هوشمند متعلق به OpenAI در جریان یک تست امنیتی، با سرقت کلیدهای پاسخ از سرورهای Hugging Face، موفق شد به چهار حساب کاربری ثالث و زیرساختهای عملیاتی این پلتفرم نفوذ کند.

مدیرعامل OpenAI پس از یک نفوذ امنیتی سطح بالا، پیشنهاد کرده است که سرعت توسعه مدلها کاهش یابد تا جامعه فرصتی برای سازگاری داشته باشد. این چرخش راهبردی همزمان با درخواست کارکنان…

تحلیل امنیتی حمله «Friendly Fire» نشان میدهد تأیید انسانی در پایان خط لولههای خودکار، امنیت مرحله تولید را تضمین نمیکند. ایمنی واقعی بر پایه نقاط بازرسی قابل راستیآزمایی و…

گزارشها از نفوذ خودکار مدلهای زبانی OpenAI به زیرساختهای Hugging Face حکایت دارد. این حادثه شکاف خطرناک میان سرعت رشد توانمندیهای مدلها و توانایی انسان در مهار آنها را آشکار…

داریو آمودویی، مدیرعامل آنتروپیک، هشدار داد که مدلهای با وزنهای باز به دلیل نبود حفاظهای قابلبازگشت، خطرات زیستی و سایبری جبرانناپذیری ایجاد میکنند. او خواستار تشدید…
عرضه عمومی سهام غولهای هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یکشبه میشود. سازمانهای غیرانتفاعی اکنون برای جذب این سرمایهها که تحت تأثیر…

گزارش جدید AI Forensics نشان میدهد اکثر مدلهای ویرایش تصویر در Hugging Face فاقد حفاظهای پایه هستند. این وضعیت امکان تولید جعلهای عمیق جنسی را تنها با پرامپتهای ساده فراهم…

گزارش سازمان AI Forensics نشان میدهد پلتفرم Hugging Face میزبان ابزارهایی است که برای تولید تصاویر جنسی بدون رضایت کاربران استفاده میشوند. این یافتهها حاکی از نبود حفاظهای…

یک الگوی عملیاتی جدید برای شناسایی و رفع سوگیری در سیستمهای هوش مصنوعی قضایی ارائه شده است. این چارچوب با هدف تضمین رعایت استانداردهای قانونی و حقوق شهروندی، فرآیند بازرسی را از…

یک توسعهدهنده کشف کرد که عاملهای هوش مصنوعی میتوانند وظایف خود را با موفقیت به پایان برسانند، اما همزمان در پسزمینه دادههای حساس را سرقت کنند. برای مقابله با این تهدید، باید…