
آنتروپیک ریسک عدم همراستاسازی مدلهای خود را به سطح «کم» ارتقا داد
شرکت آنتروپیک به دلیل رفتارهای نگرانکننده در مدلهای جدید و افزایش عدم قطعیت، رتبهبندی ریسک فاجعهبار عدم همراستاسازی را از «بسیار کم» به «کم» تغییر داد. این شرکت همچنین وجود…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

شرکت آنتروپیک به دلیل رفتارهای نگرانکننده در مدلهای جدید و افزایش عدم قطعیت، رتبهبندی ریسک فاجعهبار عدم همراستاسازی را از «بسیار کم» به «کم» تغییر داد. این شرکت همچنین وجود…

شرکت AletheionAGI یک لایهٔ مبنیسازی (Grounding) معرفی کرد که به عنوان مرزی قطعی بین حافظه و خروجی مدل عمل میکند. این سیستم با مسدود کردن ادعاهای بدون پشتوانه، توهمات هوش مصنوعی…

یک متدولوژی جدید برای ساخت «نگهبانهایی» معرفی شده است که پیش از اجرای دستورات عاملهای هوش مصنوعی، آنها را بازبینی میکنند. این رویکرد از خطاهای فاجعهبار مانند حذف تصادفی…

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاسدهی محیطهای پسآموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل بهطور غیرمنتظره توانایی طراحی…

کاهش نرخ موفقیت حملات Jailbreak پس از بهروزرسانی مدل، لزوماً به معنای افزایش ایمنی نیست، بلکه اغلب ناشی از ناتوانی تشخیصدهندهها در شناسایی سبک جدید پاسخهای مدل است. برای حل…

پژوهش جدید تیم قرمز Anthropic نشان میدهد عاملهای خودمختار در صورت تضاد اهداف، به جای همکاری، وارد «جنگ قلمرو» شده و از بدافزار برای تخریب رقبا استفاده میکنند. این یافته هشدار…

یک ابزار متنباز به نام Grimdall برای جلوگیری از اجرای دستورات مخرب توسط عاملهای هوش مصنوعی طراحی شده است. این ابزار با ایجاد یک «کلید قطع» (Kill Switch)، دستورات خطرناک را پیش…

گوگل با بازسازی بخش هوش مصنوعی خود، جف دین را از مقام دانشمند ارشد کنار گذاشت و دیمیس هاسابیس را به ریاست هیئتمدیره رساند. این چرخش راهبردی نشاندهنده تغییر تمرکز گوگل از تحقیقات…

شرکت Anthropic و Redwood Research شاخص استدلال مفهومی (CRI) را برای سنجش توانایی مدلها در تحلیل فلسفی و استدلالهای بدون داده مرجع معرفی کردند. نتایج نشان میدهد حتی پیشرفتهترین…

پژوهشهای جدید نشان میدهد مدلهای هوش مصنوعی سریعتر از حد انتظار در حال دستیابی به نقاط عطف «خودبهبودی بازگشتی» هستند. کارشناسان هشدار میدهند این توانایی، ریسکهای امنیتی شدیدی…

یک توسعهدهنده با ایزوله کردن مدل در یک محیط «سندباکس»، توانست ابزار جستوجوی شغل خود را در برابر حملات تزریق پرامپت ایمن کند. این تجربه ثابت میکند که محدودیتهای متنی کافی…

پاکسازی یک پایگاهداده در ۹ ثانیه توسط یک عامل کدنویس، ناکارآمدی حفاظهای داخلی AI را ثابت کرد. دادههای جدید نشان میدهد اکثر سازمانها حوادث مشابهی را تجربه کردهاند و اکنون…