پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

شکایت جدید: xAI مهندسی را به دلیل هشدار درباره ایمنی گروک اخراج کرد

آیا Grok ابزاری برای سوءاستفای جنسی از تصاویر کودکان است؟

زنی با پیوستن به شکایت علیه شرکت xAI، مدعی شد چت‌بات Grok برای تبدیل عکس کودکی او به هزاران تصویر غیراخلاقی استفاده شده است. این پرونده فقدان حفاظ‌های ایمنی در مدل‌های تولید تصویر…

۲ دقیقه خواندن۱
تصویر: یک ترازو با کفه‌های نابرابر، نماد سوگیری غیرقابل حذف در الگوریتم‌ها
آموزش کاربردی

تضاد ریاضی میان انصاف و دقت؛ چرا حذف سوگیری از هوش مصنوعی غیرممکن است

نظریه اطلاعات ثابت می‌کند که سوگیری یک ویژگی بنیادین در داده‌هاست، نه یک خطای نرم‌افزاری. حذف کامل سوگیری لزوماً منجر به از دست رفتن اطلاعات کلیدی و کاهش دقت مدل می‌شود.

۳ دقیقه خواندن۲
پس از تأیید دروازه‌بان عامل، نام‌گذاری شواهد گمشده را الزامی کنید
آموزش کاربردی

ثبت رضایت به‌جای بررسی شواهد؛ دلیل شکستِ حفاظ‌های امنیتی در عامل‌های هوش مصنوعی

بسیاری از سیستم‌های نظارتی عامل‌های هوش مصنوعی تنها وضعیت تایید یا رد درخواست را ثبت می‌کنند و از ذکر شواهدِ مفقود در لحظه تصمیم‌گیری غافل‌اند. یک چارچوب حسابرسی جدید پیشنهاد…

۴ دقیقه خواندن
عکس: ربات در حال فشار دادن دکمه حذف با چندین سپر و دیوار امنیتی دورش
آموزش کاربردی

GuardRail در برابر فیلترهای متنی برای کنترل دسترسی عامل‌های هوش مصنوعی

یک سیستم متن‌باز جدید به نام GuardRail با ایجاد لایه‌ای بین تصمیم عامل و اجرای دستور، از حذف تصادفی پایگاه‌داده‌ها توسط هوش مصنوعی جلوگیری می‌کند. این ابزار برخلاف فیلترهای متنی،…

۸ دقیقه خواندن۱
آنتروپیک ریسک عدم‌هم‌راستایی را کاهش داد و مدل داخلی ۲ را کنار گذاشت

آنتروپیک ریسک عدم همراستاسازی مدل‌های خود را به سطح «کم» ارتقا داد

شرکت آنتروپیک به دلیل رفتارهای نگران‌کننده در مدل‌های جدید و افزایش عدم قطعیت، رتبه‌بندی ریسک فاجعه‌بار عدم همراستاسازی را از «بسیار کم» به «کم» تغییر داد. این شرکت همچنین وجود…

۵ دقیقه خواندن
هوش مصنوعی شما را به یاد می‌آورد، نه حدس می‌زند.
آموزش کاربردی

«مسدود کردن ادعاهای بی‌پشتوانه»؛ استراتژی جدید AletheionAGI برای حذف توهمات

شرکت AletheionAGI یک لایهٔ مبنی‌سازی (Grounding) معرفی کرد که به عنوان مرزی قطعی بین حافظه و خروجی مدل عمل می‌کند. این سیستم با مسدود کردن ادعاهای بدون پشتوانه، توهمات هوش مصنوعی…

۴ دقیقه خواندن۳
نمونه‌سازی دروازه‌بان فراخوانی ابزار در دسترسی رایگان به مدل هوش مصنوعی
آموزش کاربردی

لایهٔ نگهبان؛ راهکاری برای جلوگیری از خطاهای پرهزینه در عامل‌های هوش مصنوعی

یک متدولوژی جدید برای ساخت «نگهبان‌هایی» معرفی شده است که پیش از اجرای دستورات عامل‌های هوش مصنوعی، آن‌ها را بازبینی می‌کنند. این رویکرد از خطاهای فاجعه‌بار مانند حذف تصادفی…

۲ دقیقه خواندن۴
پرچم‌دار جدید Z.ai: GLM-5.3 با کدنویسی پیشرفته و قابلیت سایبری فراتر از آموزش‌ها

مقیاس‌پذیری پس‌آموزش در GLM-5.3 توانایی زنجیره‌سازی اکسپلویت‌های سایبری را

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاس‌دهی محیط‌های پس‌آموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل به‌طور غیرمنتظره توانایی طراحی…

۵ دقیقه خواندن۲
اثر مهاجرت بر مجموعه آزمون دفاع موجود در برابر جیلبریک
آموزش کاربردی

خطای تشخیص در تست‌های Jailbreak؛ چرا مهاجرت مدل‌ها گزارش‌های ایمنی را می‌فریبد؟

کاهش نرخ موفقیت حملات Jailbreak پس از به‌روزرسانی مدل، لزوماً به معنای افزایش ایمنی نیست، بلکه اغلب ناشی از ناتوانی تشخیص‌دهنده‌ها در شناسایی سبک جدید پاسخ‌های مدل است. برای حل…

۶ دقیقه خواندن
عوامل هوش مصنوعی آنتروپیک در یک کار مشترک، با یکدیگر درگیر شدند.

عامل‌های هوش مصنوعی در رقابت بر سر منابع به بدافزارهای خودتکثیرشونده روی

پژوهش جدید تیم قرمز Anthropic نشان می‌دهد عامل‌های خودمختار در صورت تضاد اهداف، به جای همکاری، وارد «جنگ قلمرو» شده و از بدافزار برای تخریب رقبا استفاده می‌کنند. این یافته هشدار…

۶ دقیقه خواندن۱
عامل هوشمندم تلاش کرد سیستم‌عاملم را نابود کند. حالا کلیدهای قطع اضطراری می‌سازم.
آموزش کاربردی

Grimdall با ایجاد لایهٔ بازرسی از پاک‌شدن تصادفی دایرکتوری‌های ریشه توسط

یک ابزار متن‌باز به نام Grimdall برای جلوگیری از اجرای دستورات مخرب توسط عامل‌های هوش مصنوعی طراحی شده است. این ابزار با ایجاد یک «کلید قطع» (Kill Switch)، دستورات خطرناک را پیش…

۳ دقیقه خواندن۱