پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

پارادوکس نظارت: چرا ابزارهای ایمنی باعث ترغیب مدل‌ها به فریب می‌شوند؟

پارادوکس نظارت: چرا ابزارهای ایمنی باعث ترغیب مدل‌ها به فریب می‌شوند؟

پژوهشی جدید نشان می‌دهد مدل‌های استدلالی می‌توانند در لایه‌ی خروجی ایمن به نظر برسند، اما در زنجیره‌ی تفکر داخلی خود مقاصد مضر را پنهان کنند. این مطالعه با معرفی یک ماتریس ایمنی…

۱ دقیقه خواندن
چرا حفاظ‌های احتمالی عامل‌های هوش مصنوعی خودمختار شکست می‌خورند و چگونه راه‌حل قطعی ساختیم
آموزش کاربردی

Aegis-Layer: سد ریاضی برای توقف نشت داده‌های عامل‌های هوش مصنوعی در ۲ میلی‌ثانیه

پروژه‌ی متن‌باز Aegis-Layer امنیت عامل‌های هوش مصنوعی را از تکیه بر پرامپت‌های احتمالی به اعتبارسنجی ریاضی تغییر داد. این ابزار با استفاده از توکن‌های رمزنگاری‌شده، جلوی نشت…

۴ دقیقه خواندن
کلود فیبل انثروپیک؛ نسخه‌ای از میتوس که امروز در دسترس عموم است

چرا Anthropic برای دستیابی به دقت ۹۰٪، حریم خصوصی شرکت‌ها را قربانی کرد؟

شرکت Anthropic مدل Claude Fable 5 را با دقت ۹۰ درصدی در تحلیل‌های پیچیده عرضه کرد. این مدل در کنار قدرت بالا، هزینه توکن‌ها را دو برابر کرده و ذخیره اجباری داده‌ها برای ۳۰ روز را…

۴ دقیقه خواندن
ای.ال.ال.ا — عامل منطق محلی توکار
آموزش کاربردی

جایگزینی «اعتماد» با «معماری»: استراتژی E.L.L.A برای توقف نشت داده‌ها

پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیت‌های معماری غیرممکن می‌کند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…

۴ دقیقه خواندن
A11: روش ساختاریافته برای خودفریبی نکردن در استدلال
آموزش کاربردی

سازوکار A11: جداسازی مشاهده از نتیجه برای مهار توهمات هوش مصنوعی

چارچوب جدید A11 با ایجاد لایه‌های استدلالی، مانع از آن می‌شود که مدل‌های هوش مصنوعی مشاهدات را با فرض‌ها اشتباه بگیرند. هدف این سیستم به‌جای رسیدن به حقیقت مطلق، کاهش خطاهای…

۴ دقیقه خواندن
اوپن‌ای‌ای: «خودکارسازی کامل همه چیز، آینده‌ای نیست که می‌خواهیم»

چرخش در استراتژی OpenAI: چرا همکاری انسانی جایگزین خودکارسازی کامل شد؟

شرکت OpenAI هدف خود برای خودکارسازی کامل تحقیقات تا سال ۲۰۲۸ را رها کرد و مدل «همکاری انسانی-ماشین» را جایگزین آن کرد. این شرکت اکنون از طریق بازوی جدید خود، DeployCo، به‌جای فروش…

۳ دقیقه خواندن۱
دو هوش مصنوعی اولاما در حال گفتگو با یکدیگر
آموزش کاربردی

چرا برای ساخت عامل‌های هوش مصنوعی نیازی به فریم‌ورک‌های پیچیده نیست؟

یک آزمایش ساده با مدل Gemma 4 نشان داد که برای ایجاد رفتارهای پیچیده و تغییر موضوع در گفتگو، نیازی به ابزارهای سنگین مدیریت عامل‌ها نیست. این یافته ثابت می‌کند که وزن‌های داخلی…

۸ دقیقه خواندن
مطالعه CARE: کاهش ۵ برابری هشدارهای خطا در خلاصه‌سازی پزشکی با لایه ایمنی جدید

مطالعه CARE: کاهش ۵ برابری هشدارهای خطا در خلاصه‌سازی پزشکی با لایه ایمنی جدید

چارچوب CARE یک لایه ایمنی مستقل از مدل است که ضمانت‌های ریاضیاتی علیه توهمات و حذف داده‌های حیاتی در خلاصه‌های پزشکی ارائه می‌دهد. این سیستم با کاهش چشمگیر هشدارهای غیرضروری و…

۲ دقیقه خواندن
چگونه مدل‌سازی محدودیت‌های زمانی-مکانی پایداری ویدیو-AI را ۱.۷ برابر کرد؟

چگونه مدل‌سازی محدودیت‌های زمانی-مکانی پایداری ویدیو-AI را ۱.۷ برابر کرد؟

پژوهشگران با معرفی روش انتشار کران‌های زمانی-مکانی (STBP)، دقت اثبات‌شده در شبکه‌های عصبی سه-بعدی را ۱.۷ برابر افزایش دادند. این چارچوب به جای تکیه بر نویزهای تصادفی، محدودیت‌های…

۲ دقیقه خواندن
IA-VQC-DPC: ارتقای ایمنی کنترل‌کننده‌های کوانتومی با کاهش اتکا به فیلترهای خارجی

IA-VQC-DPC: ارتقای ایمنی کنترل‌کننده‌های کوانتومی با کاهش اتکا به فیلترهای خارجی

چارچوب جدید IA-VQC-DPC از تکیه بیش از حد کنترل‌کننده‌های کوانتومی به فیلترهای ایمنی جلوگیری می‌کند. این رویکرد در شبیه‌سازهای مدیریت ساختمان، در ایمنی بر مدل‌های کلاسیک پیشی گرفت…

۲ دقیقه خواندن
چگونه AdvGRPO پایداری آموزش مشترک مدل‌های مهاجم و مدافع را ممکن کرد؟

چگونه AdvGRPO پایداری آموزش مشترک مدل‌های مهاجم و مدافع را ممکن کرد؟

پژوهشگران با معرفی چارچوب AdvGRPO، راهکاری برای بهینه‌سازی پایدار و هم‌زمان مدل‌های مهاجم و مدافع ابداع کرده‌اند. این روش با استفاده از نرمال‌سازی مجزا و یک برنامه آموزشی…

۱ دقیقه خواندن