
۵۰ محیط شبیهسازیشده در DTap؛ پایان امنیت کاذب در عاملهای هوش مصنوعی
پژوهشگران پلتفرم DTap را برای شناسایی نقاط ضعف امنیتی عاملهای هوش مصنوعی معرفی کردند. این سیستم با شبیهسازی بیش از ۵۰ محیط واقعی، از نشت دادهها و تراکنشهای غیرمجاز جلوگیری…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۵ مقاله منتشر شده

پژوهشگران پلتفرم DTap را برای شناسایی نقاط ضعف امنیتی عاملهای هوش مصنوعی معرفی کردند. این سیستم با شبیهسازی بیش از ۵۰ محیط واقعی، از نشت دادهها و تراکنشهای غیرمجاز جلوگیری…

پژوهشگران با معرفی SemGrad، روشی برای شناسایی توهمات مدلهای زبانی بدون نیاز به نمونهبرداریهای تکراری و هزینهبر ابداع کردند. این متد با تحلیل گرادینتها در فضای معنایی، هزینه…

چارچوب RLearner-LLM با معرفی Hybrid-DPO، «سوگیری پرحرفی» را هدف قرار داده تا مدلها به جای فصاحت، بر درستی منطقی تمرکز کنند. این روش باعث بهبود ۶ برابری در مبنیسازی منطقی مدلها…

چارچوب جدید JASTIN به مدلهای زبانی اجازه میدهد تا کیفیت صدا، گفتار و موسیقی را بدون نیاز به آموزشهای خاص و در حالت صفر-شات ارزیابی کنند. این سیستم با دستیابی به دقت در سطح…

یک مطالعه جدید نشان میدهد مقاومت مدلهای بینایی در برابر حملات خصمانه ناشی از فیلترهای فرکانسی نیست، بلکه ریشه در هندسهی بازنمایی شبیه به انسان دارد. این کشف، مسیر مقابله با…

پژوهشگران چارچوب RFT-FM را معرفی کردند که شناسایی و رفع خطاهای تنظیم دقیق مدلهای زبانی را بهطور خودکار مدیریت میکند. این سیستم با استفاده از اولین بنچمارک جامع در این حوزه،…

چارچوب ReGuard نقاط شکست بحرانی در کنترلرهای شبکه مبتنی بر RL را شناسایی و با قوانین منطقی سبک اصلاح میکند. این متد بدون نیاز به بازآموزی، سقوط عملکرد در بدترین سناریوها را تا…

پژوهشگران چارچوب جدیدی به نام Strat-Reasoner معرفی کردهاند که به مدلهای زبانی اجازه میدهد فرآیند استدلال رقبای خود را مدلسازی کنند. این رویکرد بازگشتی منجر به افزایش ۲۲.۱…

پژوهشگران با معرفی چارچوب EBM-RL، فرآیند ادراک، استدلال و بیان را از هم تفکیک کردند تا نقشآفرینی در ویدئو را متحول کنند. این مدل با استفاده از چهار پاداش مجزا، هماهنگی میان…

پژوهشگران کشف کردند که حتی تنظیم دقیق با دادههای بیخطر میتواند همراستاسازی امنیتی مدلهای زبانی بزرگ را نابود کند. برای مقابله با این بحران، متدولوژی جدیدی به نام SQSD معرفی…

پژوهشی جدید روی ۵ مدل پیشرو نشان میدهد که حالت استدلالی تأثیری در تغییر احکام اخلاقی ندارد، اما تضاد بین مدلها را در سناریوهای پیچیده کاهش میدهد. در واقع، «تفکر» بیشتر یک ابزار…

یک مطالعهی جدید فاش میکند که بنچمارکهای استاندارد مدلها نمیتوانند رفتار هوش مصنوعی در محیط عملیاتی را پیشبینی کنند. محققان دریافتند که لایههای امنیتی برای هر مدل…