
جایگزینی «اعتماد» با «معماری»: استراتژی E.L.L.A برای توقف نشت دادهها
پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیتهای معماری غیرممکن میکند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیتهای معماری غیرممکن میکند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…

شرکت Anthropic مدلهای Fable 5 و Mythos 5 را برای پیشبرد قابلیتهای عاملمحور در برنامهنویسی و پژوهشهای علمی عرضه کرد. این سیستم اکنون از سازوکار «جایگزین» (fallback) برای…

چارچوب جدید A11 با ایجاد لایههای استدلالی، مانع از آن میشود که مدلهای هوش مصنوعی مشاهدات را با فرضها اشتباه بگیرند. هدف این سیستم بهجای رسیدن به حقیقت مطلق، کاهش خطاهای…

شرکت OpenAI هدف خود برای خودکارسازی کامل تحقیقات تا سال ۲۰۲۸ را رها کرد و مدل «همکاری انسانی-ماشین» را جایگزین آن کرد. این شرکت اکنون از طریق بازوی جدید خود، DeployCo، بهجای فروش…

یک آزمایش ساده با مدل Gemma 4 نشان داد که برای ایجاد رفتارهای پیچیده و تغییر موضوع در گفتگو، نیازی به ابزارهای سنگین مدیریت عاملها نیست. این یافته ثابت میکند که وزنهای داخلی…

چارچوب CARE یک لایه ایمنی مستقل از مدل است که ضمانتهای ریاضیاتی علیه توهمات و حذف دادههای حیاتی در خلاصههای پزشکی ارائه میدهد. این سیستم با کاهش چشمگیر هشدارهای غیرضروری و…

پژوهشگران با معرفی روش انتشار کرانهای زمانی-مکانی (STBP)، دقت اثباتشده در شبکههای عصبی سه-بعدی را ۱.۷ برابر افزایش دادند. این چارچوب به جای تکیه بر نویزهای تصادفی، محدودیتهای…

چارچوب جدید IA-VQC-DPC از تکیه بیش از حد کنترلکنندههای کوانتومی به فیلترهای ایمنی جلوگیری میکند. این رویکرد در شبیهسازهای مدیریت ساختمان، در ایمنی بر مدلهای کلاسیک پیشی گرفت…

پژوهشگران با معرفی چارچوب AdvGRPO، راهکاری برای بهینهسازی پایدار و همزمان مدلهای مهاجم و مدافع ابداع کردهاند. این روش با استفاده از نرمالسازی مجزا و یک برنامه آموزشی…

معماری SecureClaw با ایجاد گیتهای دو-مرزی، احتمال نشت دادههای حساس توسط عاملهای هوش مصنوعی را در بنچمارک ASB به صفر رسانده است. این رویکرد، امنیت را از فیلترهای احتمالیِ متنی…

یک تحلیل آکادمیک نشان میدهد درامهای کوتاه تولیدشده توسط هوش مصنوعی، از زیباییشناسی «بانمک» برای پنهان کردن کلیشههای جنسیتی و نژادی استفاده میکنند. این متد که «شستشوی…

تحلیلی بر چارچوب JSP 936 وزارت دفاع بریتانیا، هشت مانع حیاتی فنی و سازمانی را شناسایی کرده است. این گزارش نشان میدهد که علیرغم وجود حکمرانی نظری، انتقال به استقرار عملیاتی به…