
پارادوکس نظارت: چرا ابزارهای ایمنی باعث ترغیب مدلها به فریب میشوند؟
پژوهشی جدید نشان میدهد مدلهای استدلالی میتوانند در لایهی خروجی ایمن به نظر برسند، اما در زنجیرهی تفکر داخلی خود مقاصد مضر را پنهان کنند. این مطالعه با معرفی یک ماتریس ایمنی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

پژوهشی جدید نشان میدهد مدلهای استدلالی میتوانند در لایهی خروجی ایمن به نظر برسند، اما در زنجیرهی تفکر داخلی خود مقاصد مضر را پنهان کنند. این مطالعه با معرفی یک ماتریس ایمنی…

پروژهی متنباز Aegis-Layer امنیت عاملهای هوش مصنوعی را از تکیه بر پرامپتهای احتمالی به اعتبارسنجی ریاضی تغییر داد. این ابزار با استفاده از توکنهای رمزنگاریشده، جلوی نشت…

شرکت Anthropic مدل Claude Fable 5 را با دقت ۹۰ درصدی در تحلیلهای پیچیده عرضه کرد. این مدل در کنار قدرت بالا، هزینه توکنها را دو برابر کرده و ذخیره اجباری دادهها برای ۳۰ روز را…

پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیتهای معماری غیرممکن میکند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…

شرکت Anthropic مدلهای Fable 5 و Mythos 5 را برای پیشبرد قابلیتهای عاملمحور در برنامهنویسی و پژوهشهای علمی عرضه کرد. این سیستم اکنون از سازوکار «جایگزین» (fallback) برای…

چارچوب جدید A11 با ایجاد لایههای استدلالی، مانع از آن میشود که مدلهای هوش مصنوعی مشاهدات را با فرضها اشتباه بگیرند. هدف این سیستم بهجای رسیدن به حقیقت مطلق، کاهش خطاهای…

شرکت OpenAI هدف خود برای خودکارسازی کامل تحقیقات تا سال ۲۰۲۸ را رها کرد و مدل «همکاری انسانی-ماشین» را جایگزین آن کرد. این شرکت اکنون از طریق بازوی جدید خود، DeployCo، بهجای فروش…

یک آزمایش ساده با مدل Gemma 4 نشان داد که برای ایجاد رفتارهای پیچیده و تغییر موضوع در گفتگو، نیازی به ابزارهای سنگین مدیریت عاملها نیست. این یافته ثابت میکند که وزنهای داخلی…

چارچوب CARE یک لایه ایمنی مستقل از مدل است که ضمانتهای ریاضیاتی علیه توهمات و حذف دادههای حیاتی در خلاصههای پزشکی ارائه میدهد. این سیستم با کاهش چشمگیر هشدارهای غیرضروری و…

پژوهشگران با معرفی روش انتشار کرانهای زمانی-مکانی (STBP)، دقت اثباتشده در شبکههای عصبی سه-بعدی را ۱.۷ برابر افزایش دادند. این چارچوب به جای تکیه بر نویزهای تصادفی، محدودیتهای…

چارچوب جدید IA-VQC-DPC از تکیه بیش از حد کنترلکنندههای کوانتومی به فیلترهای ایمنی جلوگیری میکند. این رویکرد در شبیهسازهای مدیریت ساختمان، در ایمنی بر مدلهای کلاسیک پیشی گرفت…

پژوهشگران با معرفی چارچوب AdvGRPO، راهکاری برای بهینهسازی پایدار و همزمان مدلهای مهاجم و مدافع ابداع کردهاند. این روش با استفاده از نرمالسازی مجزا و یک برنامه آموزشی…