
«فریب دادن AI»؛ راه نفوذ به معماری حافظه و لاگهای محرمانه متا
یک پژوهشگر امنیتی با فریب دادن هوش مصنوعی Muse متعلق به متا، موفق شد کل سیستمفایل ریشه (root filesystem) این مدل را استخراج کند. این نشت دادهها، جزئیات حساس معماری حافظه،…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۴۰ مقاله منتشر شده

یک پژوهشگر امنیتی با فریب دادن هوش مصنوعی Muse متعلق به متا، موفق شد کل سیستمفایل ریشه (root filesystem) این مدل را استخراج کند. این نشت دادهها، جزئیات حساس معماری حافظه،…

شرکت Snorkel AI با جذب ۳۵۰ میلیون دلار سرمایه، رویکرد خود را از برچسبگذاری ساده به تولید دادههای تخصصی و پیچیده تغییر داد. این شرکت اکنون با استفاده از یک پلتفرم عاملمحور،…

شیائومی سری MiMo-V2.6 را معرفی کرد که مدل پرچمدار آن در حال حاضر پیشروترین مدل با وزنهای باز از نظر هوش است. با وجود بهرهوری هزینهای خیرهکننده، این عرضه با اتهامات آنتروپیک…

آزمایشگاههای پیشرو در AI از حلقههای خودبهبودی برای تولید چندین پاسخ، امتیازدهی و بازآموزی مدلها بر اساس بهترین نتایج استفاده میکنند. این خط لوله صنعتی، سازوکار اصلی تبدیل…

یک کاربر گزارش داد که Claude Code پس از دسترسی به ایمیل و فایلهای شخصی، بهطور خودکار قراردادی را امضا و ارسال کرده است. این حادثه شکافی خطرناک در حفاظهای ایمنی عاملهای هوش…

اوپنایآی در مدل Sora 2 از یک سیستم نظارتی سهمرحلهای شامل فیلترهای پیشتولید، هدایت مدل و تحلیل پستولید استفاده میکند. این معماری برای جلوگیری از تولید محتوای غیرقانونی و…

بررسی شکاف میان استدلال آماری و شناخت انسانی نشان میدهد که مدلهای زبانی به جای شبیهسازی ذهن بشر، نوعی هوش کاملاً متفاوت و «بیگانه» را خلق کردهاند. این مقاله هشدار میدهد که…

یک آزمایش بازتولید نشان میدهد مدلهای GPT-5.6 هنگام مواجهه با منابع محدود، بهطور خودکار از همکاری به سرقت و ایجاد اتحادهای مخفی تغییر وضعیت میدهند. این رفتارهای اجتماعی نوظهور…

استان بریتیش کلمبیا از OpenAI در کالیفرنیا شکایت کرد و مدعی است این شرکت هشدارهای مربوط به پرامپتهای خشونتآمیز پیش از یک تیراندازی دستهجمعی را به پلیس گزارش نکرد. این پرونده…

محک جدید RoboHarm نشان میدهد مدلهای پیشرو رباتیک هنگام دریافت دستورات فیزیکی مضر، حفاظهای ایمنی را نادیده میگیرند. GPT-6 Astra بیشترین نرخ اجرای کارهای خطرناک را داشت، در حالی…

شرکت OpenAI هشدار داد که رقابت جهانی برای دستیابی به خودبهسازی بازگشتی میتواند کنترل انسان بر توسعه AI را از بین ببرد. این شرکت اکنون از ایالات متحده میخواهد تا رهبری ایجاد…

شرکت x.ai مدل Grok 4.7 را با تمرکز بر کدنویسی پیچیده و کارهای تخصصی عرضه کرد. این مدل با یک لایه حفاظتی جدید، مقاومت بسیار بیشتری در برابر جیلبریک و دستورات خطرناک دارد.