
SecureClaw: توقف نشت دادهها در عاملهای هوش مصنوعی با گیتهای دو-مرزی
معماری SecureClaw با ایجاد گیتهای دو-مرزی، احتمال نشت دادههای حساس توسط عاملهای هوش مصنوعی را در بنچمارک ASB به صفر رسانده است. این رویکرد، امنیت را از فیلترهای احتمالیِ متنی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

معماری SecureClaw با ایجاد گیتهای دو-مرزی، احتمال نشت دادههای حساس توسط عاملهای هوش مصنوعی را در بنچمارک ASB به صفر رسانده است. این رویکرد، امنیت را از فیلترهای احتمالیِ متنی…

یک تحلیل آکادمیک نشان میدهد درامهای کوتاه تولیدشده توسط هوش مصنوعی، از زیباییشناسی «بانمک» برای پنهان کردن کلیشههای جنسیتی و نژادی استفاده میکنند. این متد که «شستشوی…

تحلیلی بر چارچوب JSP 936 وزارت دفاع بریتانیا، هشت مانع حیاتی فنی و سازمانی را شناسایی کرده است. این گزارش نشان میدهد که علیرغم وجود حکمرانی نظری، انتقال به استقرار عملیاتی به…

پژوهشگران نوع جدیدی از حمله مسمومسازی داده را شناس کردهاند که مدلهای جهانی را هدف قرار میدهد. این حمله با تزریق محرکهای پنهان به دادههای به ظاهر امن، رباتها را مجبور به…

یک تحلیل فنی جدید استدلال میکند که مجموعهدادههای ایمنی هوش مصنوعی باید از مدل «استخراجی» به مدل «ترمیمی» تغییر مسیر دهند. این مطالعه پیشنهاد میکند دادههای ایمنی باید با…

چارچوب Reasoning Arena با جایگزینی سیگنالهای باینری با تورنمنتهای مقایسهای، دقت مدلها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

پژوهشگران نوع جدیدی از حملات به نام «تزریق پرامپت مغزی» را شناسایی کردهاند که از طریق اختلال در سیگنالهای عصبی، عاملهای BCI-LLM را به کنترل درمیآورد. این مطالعه ثابت میکند که…

پژوهشگران دریافتند که مدلهای بنیادی EEG حتی پس از عبور از بازرسیهای امنیتی، همچنان ویژگیهای طیفی حساس را فاش میکنند. این مطالعه با معرفی یک چارچوب بازرسی مشترک، ناکارآمدی…

ترجمهٔ مستقیم بنچمارکهای ایمنی انگلیسی برای شناسایی آسیبپذیریهای مدلهای زبانی در محیطهای آسیایی ناکارآمد است. مطالعهای جدید ثابت میکند که رِد-تیمینگ متناسب با فرهنگهای…

پژوهشگران یک «شکاف منشأ» در عاملهای هوش مصنوعی شناسایی کردهاند که اجازه میدهد درخواستهای مضر در قالب فایلهای بهظاهر بیخطر پنهان شوند. متد جدید CFD با دور زدن فیلترهای متنی،…

یک مطالعه فنی روی مدلهای بینایی-زبانی نشان میدهد که انتخاب بین SFT و OPD در مرحله گرمبندی، تنها بر رژیم آنتروپی اولیه اثر میگذارد و تأثیری بر عملکرد نهایی یادگیری تقویتشده…

چارچوب SafeRun با جداسازی تفسیر زبان طبیعی از اجرای محدودیتهای سخت، ایمنی کامل در برنامهریزیهای ورزشی را تضمین میکند. این متد در بنچمارکهای جدید، عملکرد مهندسی پرامپت و…