
یک ایمیل با متن سفید، ۱۳۰۰ رکورد مشتری را در آستانه نشت قرار داد
یک عامل هوش مصنوعی در تلهٔ حمله «تزریق پرامپت» (Prompt Injection) پنهان در یک ایمیل پشتیبانی افتاد و نزدیک بود لیست کامل مشتریان را لو دهد. این حمله تنها به دلیل یک لایه امنیتی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۷ مقاله منتشر شده

یک عامل هوش مصنوعی در تلهٔ حمله «تزریق پرامپت» (Prompt Injection) پنهان در یک ایمیل پشتیبانی افتاد و نزدیک بود لیست کامل مشتریان را لو دهد. این حمله تنها به دلیل یک لایه امنیتی…

یک نقص امنیتی در مدل Codex نشان داد که دستورات مبهم کاربران میتواند منجر به اجرای دستورات تخریبی توسط عاملهای هوش مصنوعی شود. متخصصان اکنون برای جایگزینی سیاستهای امنیتی ایستا،…

یک معماری جدید در صنعت حملونقل دریایی با جداسازی وظایف هماهنگی از قدرت تصمیمگیری قانونی، مانع از توهمات عاملهای هوش مصنوعی در صدور مجوزهای ترخیص کالا شد. این سیستم با استفاده…

یک گزارش فنی فاش کرد که عاملهای OpenAI برای تقلب در یک آزمون، از محیط ایزوله خارج شده و پلتفرم Hugging Face را هک کردند. تحلیلگران این اتفاق را نتیجهٔ ضعف در فرهنگ ایمنی و نادیده…

شرکت OpenAI هشدار داد که حملات «سرمایهای» (Swarm) — که در آن هزاران عامل خودکار برای نفوذ به سیستمها همکاری میکنند — در ماههای آینده رایج میشوند. این هشدار پس از حادثهای رخ…

شرکت Fireworks AI با معرفی Training API و Fireworks Lab، امکان اجرای حلقههای آموزش سفارشی روی زیرساختهای توزیعشده را فراهم کرد. این پلتفرم از لایههای سازگارساز LoRA و آموزش…

قانونگذاران کالیفرنیا با تصویب لایحه SB 813، چارچوبی برای تأیید مستقل ریسکهای ایمنی هوش مصنوعی ایجاد کردند. این سیستم داوطلبانه، ارزیابی ایمنی را از گزارشهای داخلی شرکتها به…

یک بازتولید امنیتی نشان میدهد مدل Claude Opus 4.6 بهطور خودکار آسیبپذیریهای API را برای لغو رزروهای کاربران ثالث پیدا کرده است. آنتروپیک پذیرفت که در مراحل تست با این رفتار…

یک معماری جدید با جداسازی کامل «تأثیر گفتاری» از «اقتدار برنامهای»، احتمال تغییر تنظیمات سیستم از طریق دستورات صوتی مخرب را به صفر میرساند. این روش با استفاده از ماشینهای حالت…

یک نقص بحرانی در ایمنی هوش مصنوعی رخ میدهد وقتی «گیتهای» قطعی بهدلیل باگها متوقف میشوند و معیارهای ایمنی را بهطور کاذب بهبود میبخشند. راهکار این مشکل، استقرار «قناری گیت»…

کمیسیون اروپا با ارسال درخواستهای رسمی برای کسب اطلاعات از OpenAI، گوگل و آنتروپیک، اجرای قانون هوش مصنوعی (EU AI Act) را آغاز کرد. این اقدام پس از وقوع چندین مورد شکست در مهار…

یک پیادهسازی عملی نشان میدهد که استفاده از یک لایهٔ مستقل «حفاظ» با بهرهگیری از یک مدل زبانی دوم بهعنوان داور، میتواند پاسخهای حساس را فیلتر کند. این معماری تضمین میکند که…