پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

ای.ال.ال.ا — عامل منطق محلی توکار
آموزش کاربردی

جایگزینی «اعتماد» با «معماری»: استراتژی E.L.L.A برای توقف نشت داده‌ها

پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیت‌های معماری غیرممکن می‌کند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…

۴ دقیقه خواندن
A11: روش ساختاریافته برای خودفریبی نکردن در استدلال
آموزش کاربردی

سازوکار A11: جداسازی مشاهده از نتیجه برای مهار توهمات هوش مصنوعی

چارچوب جدید A11 با ایجاد لایه‌های استدلالی، مانع از آن می‌شود که مدل‌های هوش مصنوعی مشاهدات را با فرض‌ها اشتباه بگیرند. هدف این سیستم به‌جای رسیدن به حقیقت مطلق، کاهش خطاهای…

۴ دقیقه خواندن
اوپن‌ای‌ای: «خودکارسازی کامل همه چیز، آینده‌ای نیست که می‌خواهیم»

چرخش در استراتژی OpenAI: چرا همکاری انسانی جایگزین خودکارسازی کامل شد؟

شرکت OpenAI هدف خود برای خودکارسازی کامل تحقیقات تا سال ۲۰۲۸ را رها کرد و مدل «همکاری انسانی-ماشین» را جایگزین آن کرد. این شرکت اکنون از طریق بازوی جدید خود، DeployCo، به‌جای فروش…

۳ دقیقه خواندن۱
دو هوش مصنوعی اولاما در حال گفتگو با یکدیگر
آموزش کاربردی

چرا برای ساخت عامل‌های هوش مصنوعی نیازی به فریم‌ورک‌های پیچیده نیست؟

یک آزمایش ساده با مدل Gemma 4 نشان داد که برای ایجاد رفتارهای پیچیده و تغییر موضوع در گفتگو، نیازی به ابزارهای سنگین مدیریت عامل‌ها نیست. این یافته ثابت می‌کند که وزن‌های داخلی…

۸ دقیقه خواندن
مطالعه CARE: کاهش ۵ برابری هشدارهای خطا در خلاصه‌سازی پزشکی با لایه ایمنی جدید

مطالعه CARE: کاهش ۵ برابری هشدارهای خطا در خلاصه‌سازی پزشکی با لایه ایمنی جدید

چارچوب CARE یک لایه ایمنی مستقل از مدل است که ضمانت‌های ریاضیاتی علیه توهمات و حذف داده‌های حیاتی در خلاصه‌های پزشکی ارائه می‌دهد. این سیستم با کاهش چشمگیر هشدارهای غیرضروری و…

۲ دقیقه خواندن۲
چگونه مدل‌سازی محدودیت‌های زمانی-مکانی پایداری ویدیو-AI را ۱.۷ برابر کرد؟

چگونه مدل‌سازی محدودیت‌های زمانی-مکانی پایداری ویدیو-AI را ۱.۷ برابر کرد؟

پژوهشگران با معرفی روش انتشار کران‌های زمانی-مکانی (STBP)، دقت اثبات‌شده در شبکه‌های عصبی سه-بعدی را ۱.۷ برابر افزایش دادند. این چارچوب به جای تکیه بر نویزهای تصادفی، محدودیت‌های…

۲ دقیقه خواندن
IA-VQC-DPC: ارتقای ایمنی کنترل‌کننده‌های کوانتومی با کاهش اتکا به فیلترهای خارجی

IA-VQC-DPC: ارتقای ایمنی کنترل‌کننده‌های کوانتومی با کاهش اتکا به فیلترهای خارجی

چارچوب جدید IA-VQC-DPC از تکیه بیش از حد کنترل‌کننده‌های کوانتومی به فیلترهای ایمنی جلوگیری می‌کند. این رویکرد در شبیه‌سازهای مدیریت ساختمان، در ایمنی بر مدل‌های کلاسیک پیشی گرفت…

۲ دقیقه خواندن
چگونه AdvGRPO پایداری آموزش مشترک مدل‌های مهاجم و مدافع را ممکن کرد؟

چگونه AdvGRPO پایداری آموزش مشترک مدل‌های مهاجم و مدافع را ممکن کرد؟

پژوهشگران با معرفی چارچوب AdvGRPO، راهکاری برای بهینه‌سازی پایدار و هم‌زمان مدل‌های مهاجم و مدافع ابداع کرده‌اند. این روش با استفاده از نرمال‌سازی مجزا و یک برنامه آموزشی…

۱ دقیقه خواندن
SecureClaw: توقف نشت داده‌ها در عامل‌های هوش مصنوعی با گیت‌های دو-مرزی

SecureClaw: توقف نشت داده‌ها در عامل‌های هوش مصنوعی با گیت‌های دو-مرزی

معماری SecureClaw با ایجاد گیت‌های دو-مرزی، احتمال نشت داده‌های حساس توسط عامل‌های هوش مصنوعی را در بنچمارک ASB به صفر رسانده است. این رویکرد، امنیت را از فیلترهای احتمالیِ متنی…

۱ دقیقه خواندن۱
توت‌فرنگی عجیب با شکلی شبیه شکم باردار

«شستشوی زیبایی‌شناختی»؛ سازوکاری برای دور زدن فیلترهای ایمنی در درام‌های میوه‌ای

یک تحلیل آکادمیک نشان می‌دهد درام‌های کوتاه تولیدشده توسط هوش مصنوعی، از زیبایی‌شناسی «بانمک» برای پنهان کردن کلیشه‌های جنسیتی و نژادی استفاده می‌کنند. این متد که «شستشوی…

۱ دقیقه خواندن
گزارش دفاعی بریتانیا: ۸ شکاف فنی که استقرار عملیاتی هوش مصنوعی را متوقف کرده است

گزارش دفاعی بریتانیا: ۸ شکاف فنی که استقرار عملیاتی هوش مصنوعی را متوقف کرده است

تحلیلی بر چارچوب JSP 936 وزارت دفاع بریتانیا، هشت مانع حیاتی فنی و سازمانی را شناسایی کرده است. این گزارش نشان می‌دهد که علی‌رغم وجود حکمرانی نظری، انتقال به استقرار عملیاتی به…

۱ دقیقه خواندن۱