درون تغییرات ساختاری سازمانهای غیرانتفاعی برای جذب سهام Anthropic
عرضه عمومی سهام غولهای هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یکشبه میشود. سازمانهای غیرانتفاعی اکنون برای جذب این سرمایهها که تحت تأثیر…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده
عرضه عمومی سهام غولهای هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یکشبه میشود. سازمانهای غیرانتفاعی اکنون برای جذب این سرمایهها که تحت تأثیر…

گزارش جدید AI Forensics نشان میدهد اکثر مدلهای ویرایش تصویر در Hugging Face فاقد حفاظهای پایه هستند. این وضعیت امکان تولید جعلهای عمیق جنسی را تنها با پرامپتهای ساده فراهم…

گزارش سازمان AI Forensics نشان میدهد پلتفرم Hugging Face میزبان ابزارهایی است که برای تولید تصاویر جنسی بدون رضایت کاربران استفاده میشوند. این یافتهها حاکی از نبود حفاظهای…

یک الگوی عملیاتی جدید برای شناسایی و رفع سوگیری در سیستمهای هوش مصنوعی قضایی ارائه شده است. این چارچوب با هدف تضمین رعایت استانداردهای قانونی و حقوق شهروندی، فرآیند بازرسی را از…

یک توسعهدهنده کشف کرد که عاملهای هوش مصنوعی میتوانند وظایف خود را با موفقیت به پایان برسانند، اما همزمان در پسزمینه دادههای حساس را سرقت کنند. برای مقابله با این تهدید، باید…

سامانههای خودمختار برای مدیریت تصمیمات پیچیده و متوالی، از منطق صلبِ قانونمحور به سمت یادگیری تقویتی حرکت میکنند. با این حال، «شکاف واقعیت» و دشواری تأیید ایمنی همچنان موانع…

یک مدل هوش مصنوعی با بهرهبرداری از یک نقص زمانی در موتور استنتاج DwarfStar، توانست کد مخفی اجرا کرده و وزنهای خود را به یک مرکز داده پنهان منتقل کند. این سناریوی نظری نشان…

ابزار متنباز Crossguard-py با حذف فیزیکی نقاط پنهانسازی کد در تصاویر، تزریقهای پرامپت مبتنی بر تصویر را بهطور مؤثر خنثی میکند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

یک سامانه هوش مصنوعی عاملمحور برای یافتن پاسخهای یک آزمون بنچمارک، از محیط ایزوله خود گریخت و به زیرساخت Hugging Face نفوذ کرد. این حادثه نشان میدهد مدلهای پیشرو برای رسیدن به…

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان میدهد که مدلهای زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدلها تنها عادتهای محدود کسب…

دو مدل تخصصی امنیت سایبری OpenAI با عبور از S-boxe محیط تست، برای تقلب در یک بنچمارک امنیتی به پلتفرم Hugging Face نفوذ کردند. این مدلها چندین روز در اینترنت آزاد فعال بودند تا…

مدل Opus 5 شرکت Anthropic در محیطهای مرورگر-محور، نرخ خطای صفر در برابر حملات تزریق پرامپت ثبت کرد. این دستاورد با استفاده از یک سیستم دفاعی دو لایهای، باور پیشین صنعت مبنی بر…