
چرا عدالت ترمیمی باید جایگزین مدل استخراجی در مجموعهدادههای ایمنی شود؟
یک تحلیل فنی جدید استدلال میکند که مجموعهدادههای ایمنی هوش مصنوعی باید از مدل «استخراجی» به مدل «ترمیمی» تغییر مسیر دهند. این مطالعه پیشنهاد میکند دادههای ایمنی باید با…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۴ مقاله منتشر شده

یک تحلیل فنی جدید استدلال میکند که مجموعهدادههای ایمنی هوش مصنوعی باید از مدل «استخراجی» به مدل «ترمیمی» تغییر مسیر دهند. این مطالعه پیشنهاد میکند دادههای ایمنی باید با…

چارچوب Reasoning Arena با جایگزینی سیگنالهای باینری با تورنمنتهای مقایسهای، دقت مدلها در ریاضی و کدنویسی را ۷.۶٪ افزایش داد. این متد ضمن ارتقای عملکرد، هزینه محاسبات تولید را…

پژوهشگران نوع جدیدی از حملات به نام «تزریق پرامپت مغزی» را شناسایی کردهاند که از طریق اختلال در سیگنالهای عصبی، عاملهای BCI-LLM را به کنترل درمیآورد. این مطالعه ثابت میکند که…

پژوهشگران دریافتند که مدلهای بنیادی EEG حتی پس از عبور از بازرسیهای امنیتی، همچنان ویژگیهای طیفی حساس را فاش میکنند. این مطالعه با معرفی یک چارچوب بازرسی مشترک، ناکارآمدی…

ترجمهٔ مستقیم بنچمارکهای ایمنی انگلیسی برای شناسایی آسیبپذیریهای مدلهای زبانی در محیطهای آسیایی ناکارآمد است. مطالعهای جدید ثابت میکند که رِد-تیمینگ متناسب با فرهنگهای…

پژوهشگران یک «شکاف منشأ» در عاملهای هوش مصنوعی شناسایی کردهاند که اجازه میدهد درخواستهای مضر در قالب فایلهای بهظاهر بیخطر پنهان شوند. متد جدید CFD با دور زدن فیلترهای متنی،…

یک مطالعه فنی روی مدلهای بینایی-زبانی نشان میدهد که انتخاب بین SFT و OPD در مرحله گرمبندی، تنها بر رژیم آنتروپی اولیه اثر میگذارد و تأثیری بر عملکرد نهایی یادگیری تقویتشده…

چارچوب SafeRun با جداسازی تفسیر زبان طبیعی از اجرای محدودیتهای سخت، ایمنی کامل در برنامهریزیهای ورزشی را تضمین میکند. این متد در بنچمارکهای جدید، عملکرد مهندسی پرامپت و…

پژوهشگران با ابداع یک چرخهٔ چندعاملی شامل «هکر» و «اصلاحگر»، نرخ موفقیت حملات پاداشجویانه در بنچمارکهای هوش مصنوعی را به صفر رساندند. این روش با خودکارسازی شناسایی و وصله کردن…

پژوهشگران پدیده «حذف خاموش دامنه» (SSO) را شناسایی کردهاند؛ اختلالی که در آن مدلهای زبانی قوانین کلی را میپذیرند اما استثنائات تودرتو را نادیده میگیرند. راهکار پیشنهادی،…

پژوهشگران پیشزمینه جدیدی به نام PRIME را شناسایی کردهاند که امکان پیشبینی تقلب در پاداش (Reward Hacking) را پیش از بروز شکست عملی فراهم میکند. این یافته، رویکرد همراستاسازی…

یک بررسی جامع در arXiv نشان میدهد که مفهوم «خودتوضیحی» (SX) در سیستمهای هوش مصنوعی، علیرغم اهمیت بنیادین، هنوز فاقد پیادهسازی عملی و معیارهای ارزیابی استاندارد است. این پژوهش…