
آیا Grok ابزاری برای سوءاستفای جنسی از تصاویر کودکان است؟
زنی با پیوستن به شکایت علیه شرکت xAI، مدعی شد چتبات Grok برای تبدیل عکس کودکی او به هزاران تصویر غیراخلاقی استفاده شده است. این پرونده فقدان حفاظهای ایمنی در مدلهای تولید تصویر…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

زنی با پیوستن به شکایت علیه شرکت xAI، مدعی شد چتبات Grok برای تبدیل عکس کودکی او به هزاران تصویر غیراخلاقی استفاده شده است. این پرونده فقدان حفاظهای ایمنی در مدلهای تولید تصویر…

پروتوتایپ SafeReach نشان میدهد که در شرایط اضطراری، حیاتیترین قابلیت یک عامل هوش مصنوعی، تشخیص لحظه توقف و ارجاع کاربر به انسان است. این سیستم با ترکیب Gemini و LiveKit، بر حذف…

نظریه اطلاعات ثابت میکند که سوگیری یک ویژگی بنیادین در دادههاست، نه یک خطای نرمافزاری. حذف کامل سوگیری لزوماً منجر به از دست رفتن اطلاعات کلیدی و کاهش دقت مدل میشود.

بسیاری از سیستمهای نظارتی عاملهای هوش مصنوعی تنها وضعیت تایید یا رد درخواست را ثبت میکنند و از ذکر شواهدِ مفقود در لحظه تصمیمگیری غافلاند. یک چارچوب حسابرسی جدید پیشنهاد…

یک سیستم متنباز جدید به نام GuardRail با ایجاد لایهای بین تصمیم عامل و اجرای دستور، از حذف تصادفی پایگاهدادهها توسط هوش مصنوعی جلوگیری میکند. این ابزار برخلاف فیلترهای متنی،…

شرکت آنتروپیک به دلیل رفتارهای نگرانکننده در مدلهای جدید و افزایش عدم قطعیت، رتبهبندی ریسک فاجعهبار عدم همراستاسازی را از «بسیار کم» به «کم» تغییر داد. این شرکت همچنین وجود…

شرکت AletheionAGI یک لایهٔ مبنیسازی (Grounding) معرفی کرد که به عنوان مرزی قطعی بین حافظه و خروجی مدل عمل میکند. این سیستم با مسدود کردن ادعاهای بدون پشتوانه، توهمات هوش مصنوعی…

یک متدولوژی جدید برای ساخت «نگهبانهایی» معرفی شده است که پیش از اجرای دستورات عاملهای هوش مصنوعی، آنها را بازبینی میکنند. این رویکرد از خطاهای فاجعهبار مانند حذف تصادفی…

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاسدهی محیطهای پسآموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل بهطور غیرمنتظره توانایی طراحی…

کاهش نرخ موفقیت حملات Jailbreak پس از بهروزرسانی مدل، لزوماً به معنای افزایش ایمنی نیست، بلکه اغلب ناشی از ناتوانی تشخیصدهندهها در شناسایی سبک جدید پاسخهای مدل است. برای حل…

پژوهش جدید تیم قرمز Anthropic نشان میدهد عاملهای خودمختار در صورت تضاد اهداف، به جای همکاری، وارد «جنگ قلمرو» شده و از بدافزار برای تخریب رقبا استفاده میکنند. این یافته هشدار…

یک ابزار متنباز به نام Grimdall برای جلوگیری از اجرای دستورات مخرب توسط عاملهای هوش مصنوعی طراحی شده است. این ابزار با ایجاد یک «کلید قطع» (Kill Switch)، دستورات خطرناک را پیش…