پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

SecureClaw: توقف نشت داده‌ها در عامل‌های هوش مصنوعی با گیت‌های دو-مرزی

SecureClaw: توقف نشت داده‌ها در عامل‌های هوش مصنوعی با گیت‌های دو-مرزی

معماری SecureClaw با ایجاد گیت‌های دو-مرزی، احتمال نشت داده‌های حساس توسط عامل‌های هوش مصنوعی را در بنچمارک ASB به صفر رسانده است. این رویکرد، امنیت را از فیلترهای احتمالیِ متنی…

۱ دقیقه خواندن
توت‌فرنگی عجیب با شکلی شبیه شکم باردار

«شستشوی زیبایی‌شناختی»؛ سازوکاری برای دور زدن فیلترهای ایمنی در درام‌های میوه‌ای

یک تحلیل آکادمیک نشان می‌دهد درام‌های کوتاه تولیدشده توسط هوش مصنوعی، از زیبایی‌شناسی «بانمک» برای پنهان کردن کلیشه‌های جنسیتی و نژادی استفاده می‌کنند. این متد که «شستشوی…

۱ دقیقه خواندن
گزارش دفاعی بریتانیا: ۸ شکاف فنی که استقرار عملیاتی هوش مصنوعی را متوقف کرده است

گزارش دفاعی بریتانیا: ۸ شکاف فنی که استقرار عملیاتی هوش مصنوعی را متوقف کرده است

تحلیلی بر چارچوب JSP 936 وزارت دفاع بریتانیا، هشت مانع حیاتی فنی و سازمانی را شناسایی کرده است. این گزارش نشان می‌دهد که علی‌رغم وجود حکمرانی نظری، انتقال به استقرار عملیاتی به…

۱ دقیقه خواندن
چگونه مدل‌های جهانی در تولید داده‌های رباتیک، «درب‌های پشتی» مخفی ایجاد می‌کنند؟

چگونه مدل‌های جهانی در تولید داده‌های رباتیک، «درب‌های پشتی» مخفی ایجاد می‌کنند؟

پژوهشگران نوع جدیدی از حمله مسموم‌سازی داده را شناس کرده‌اند که مدل‌های جهانی را هدف قرار می‌دهد. این حمله با تزریق محرک‌های پنهان به داده‌های به‌ ظاهر امن، ربات‌ها را مجبور به…

۱ دقیقه خواندن
چرا عدالت ترمیمی باید جایگزین مدل استخراجی در مجموعه‌داده‌های ایمنی شود؟

چرا عدالت ترمیمی باید جایگزین مدل استخراجی در مجموعه‌داده‌های ایمنی شود؟

یک تحلیل فنی جدید استدلال می‌کند که مجموعه‌داده‌های ایمنی هوش مصنوعی باید از مدل «استخراجی» به مدل «ترمیمی» تغییر مسیر دهند. این مطالعه پیشنهاد می‌کند داده‌های ایمنی باید با…

۲ دقیقه خواندن
Reasoning Arena: غلبه بر مشکل پاداش‌های تخت در آموزش مدل‌های استدلالی

Reasoning Arena: غلبه بر مشکل پاداش‌های تخت در آموزش مدل‌های استدلالی

چارچوب Reasoning Arena با جایگزینی سیگنال‌های باینری با تورنمنتهای مقایسه‌ای، دقت مدل‌ها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

۲ دقیقه خواندن
چرا دقت دکودر برای توقف تزریق‌های پرامپت مغزی کافی نیست؟

چرا دقت دکودر برای توقف تزریق‌های پرامپت مغزی کافی نیست؟

پژوهشگران نوع جدیدی از حملات به نام «تزریق پرامپت مغزی» را شناسایی کرده‌اند که از طریق اختلال در سیگنال‌های عصبی، عامل‌های BCI-LLM را به کنترل درمی‌آورد. این مطالعه ثابت می‌کند که…

۲ دقیقه خواندن
چرا مدل‌های بنیادی EEG حتی در حالت منجمد، ویژگی‌های طیفی را لو می‌دهند؟

چرا مدل‌های بنیادی EEG حتی در حالت منجمد، ویژگی‌های طیفی را لو می‌دهند؟

پژوهشگران دریافتند که مدل‌های بنیادی EEG حتی پس از عبور از بازرسی‌های امنیتی، همچنان ویژگی‌های طیفی حساس را فاش می‌کنند. این مطالعه با معرفی یک چارچوب بازرسی مشترک، ناکارآمدی…

۲ دقیقه خواندن
چگونه «بومی‌سازی فرهنگی» نرخ موفقیت حملات به مدل‌های زبانی را ۹.۳٪ افزایش داد؟

چگونه «بومی‌سازی فرهنگی» نرخ موفقیت حملات به مدل‌های زبانی را ۹.۳٪ افزایش داد؟

ترجمهٔ مستقیم بنچمارک‌های ایمنی انگلیسی برای شناسایی آسیب‌پذیری‌های مدل‌های زبانی در محیط‌های آسیایی ناکارآمد است. مطالعه‌ای جدید ثابت می‌کند که رِد-تیمینگ متناسب با فرهنگ‌های…

۱ دقیقه خواندن
حمله CFD: افزایش ۲۸.۳ درصدی موفقیت جیل‌بریک از طریق «شکاف منشأ» در مدل‌ها

حمله CFD: افزایش ۲۸.۳ درصدی موفقیت جیل‌بریک از طریق «شکاف منشأ» در مدل‌ها

پژوهشگران یک «شکاف منشأ» در عامل‌های هوش مصنوعی شناسایی کرده‌اند که اجازه می‌دهد درخواست‌های مضر در قالب فایل‌های به‌ظاهر بی‌خطر پنهان شوند. متد جدید CFD با دور زدن فیلترهای متنی،…

۱ دقیقه خواندن
چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

چرا متد گرم‌بندی در مدل‌های بینایی-زبانی اثر نهایی RL را تغییر نمی‌دهد؟

یک مطالعه فنی روی مدل‌های بینایی-زبانی نشان می‌دهد که انتخاب بین SFT و OPD در مرحله گرم‌بندی، تنها بر رژیم آنتروپی اولیه اثر می‌گذارد و تأثیری بر عملکرد نهایی یادگیری تقویت‌شده…

۲ دقیقه خواندن
چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چگونه SafeRun با تفکیک استنتاج و نظارت به ایمنی ۱۰۰ درصدی رسید؟

چارچوب SafeRun با جداسازی تفسیر زبان طبیعی از اجرای محدودیت‌های سخت، ایمنی کامل در برنامه‌ریزی‌های ورزشی را تضمین می‌کند. این متد در بنچمارک‌های جدید، عملکرد مهندسی پرامپت و…

۱ دقیقه خواندن