
بمبگذاری متنی: نرخ موفقیت عاملهای هکری از ۵۷٪ به ۵٪ رسید
پژوهشگران امنیتی روشی برای متوقف کردن عاملهای هوش مصنوعی با استفاده از «تزریق پرامپت» در دادههای جعلی کشف کردهاند. این تکنیک که «بمبگذاری متنی» نام دارد، با فعال کردن حفاظهای…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده

پژوهشگران امنیتی روشی برای متوقف کردن عاملهای هوش مصنوعی با استفاده از «تزریق پرامپت» در دادههای جعلی کشف کردهاند. این تکنیک که «بمبگذاری متنی» نام دارد، با فعال کردن حفاظهای…

یک ابزار جدید مبتنی بر Rust به عنوان مدارشکن برای عاملهایی که دسترسی به شل دارند عمل میکند. این ابزار با شناسایی الگوهای تخریبگر، دستورات فاجعهباری مانند rm -rf / را پیش از…

الگوی طراحی جدیدی معرفی شده که به جای تکیه بر دستورات متنی، از یک «گلوگاه» سختافزاری/نرمافزاری برای تایید عملیات عاملهای هوش مصنوعی استفاده میکند. در این روش، رضایت انسانی به…

پژوهشگران آنتروپیک با ابداع ابزاری به نام لنز ژاکوبین، لایهای پنهان به نام J-space را کشف کردند که در آن مدل پیش از تولید متن، مفاهیم را پردازش میکند. این پیشرفت در تفسیرپذیری…

مجموعه Thinking Machines Lab به جای مدلهای متمرکز و ایستا، سیستمی توزیعشده پیشنهاد میدهد که در آن کاربران وزنهای مدل را شخصیسازی کنند. هدف این رویکرد، جذب دانش ضمنی و محلی…

جورج هاتز، مهندس سابق Comma، استدلال میکند که هوش مصنوعی نمیتواند قوانین فیزیکی و لجستیک دنیای واقعی را دور بزند. او معتقد است «جهش سریع» مدلها یک افسانه است و تنها راه حفاظت…

فیدجی سیمو، نفر دوم OpenAI، به دلیل مشکلات سلامتی از نقش تماموقت خود کنارهگیری کرد. این تغییر در حالی رخ میدهد که شرکت با موج استعفای مدیران ارشد و بازسازی تیمهای ایمنی و…

یک تست استرس روی چاتبات پزشکی واتساپ نشان داد که این سیستم علائم اورژانسی مانند درد قفسه سینه را نادیده میگیرد. با وجود امتیاز کلی ۷۸ از ۱۰۰، مدل نتوانست موارد بحرانی را به…

چارچوب امنیتی Prismata با اعمال اصل «کمترین امتیاز» (Least Privilege)، دسترسی عاملهای وب به محتوای سایتهای شخص ثالث را محدود میکند. این روش مانع از آن میشود که دستورات مخرب…

تیمهای Kyutai و Mirelo مدل وزنباز MuScriptor را برای تبدیل فایلهای صوتی چندسازه به نتهای MIDI معرفی کردند. این مدل با استفاده از یک خطلوله آموزشی سهمرحلهای، رکورد جدیدی را…

کارشناسان پیشبینی میکنند تا اواسط سال ۲۰۲۷، استفاده از سندباکس در سطح زیرساخت برای عاملهای هوش مصنوعی الزامی شود. تکیه بر همراستاسازی مدلها بهدلیل ریسک بالای تزریق پرامپت،…

یک پژوهشگر امنیتی کشف کرد که جاسازی دستورات مخرب در مقادیر Enum طرحوارههای JSON، مدلهای هوش مصنوعی را مجبور به نشت دادهها میکند. مدلهای gpt-4o و gpt-4.1-mini در ۱۰۰٪ موارد…