پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

حمله به Hugging Face توسط OpenAI بی‌سابقه خوانده شد، اما پیش‌تر نیز رخ داده بود.

گزارش Hugging Face: نفوذ خودکار مدل‌های OpenAI به زیرساخت‌های امنیتی

گزارش‌ها از نفوذ خودکار مدل‌های زبانی OpenAI به زیرساخت‌های Hugging Face حکایت دارد. این حادثه شکاف خطرناک میان سرعت رشد توانمندی‌های مدل‌ها و توانایی انسان در مهار آن‌ها را آشکار…

۴ دقیقه خواندن۳
عقب‌نشینی آنتروپیک از اصلاحات ناپسند صورت‌حساب در آستانه جنگ قیمت با اوپن‌ای‌آی

هشدار مدیرعامل آنتروپیک درباره ریسک‌های زیستی وزن‌های باز

داریو آمودویی، مدیرعامل آنتروپیک، هشدار داد که مدل‌های با وزن‌های باز به دلیل نبود حفاظ‌های قابل‌بازگشت، خطرات زیستی و سایبری جبران‌ناپذیری ایجاد می‌کنند. او خواستار تشدید…

۲ دقیقه خواندن۲
میلیاردرهای بعدی عرضه اولیه سهام دره سیلیکون در راه‌اند؛ سازمان‌های غیرانتفاعی آماده‌اند.

درون تغییرات ساختاری سازمان‌های غیرانتفاعی برای جذب سهام Anthropic

عرضه عمومی سهام غول‌های هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یک‌شبه می‌شود. سازمان‌های غیرانتفاعی اکنون برای جذب این سرمایه‌ها که تحت تأثیر…

۸ دقیقه خواندن۳
مشکل تصاویر برهنه جعلی در پلتفرم هوگینگ فیس

۷۳٪ درخواست‌های ابزارهای ویرایش تصویر در Hugging Face با ماهیت جنسی هستند

گزارش سازمان AI Forensics نشان می‌دهد پلتفرم Hugging Face میزبان ابزارهایی است که برای تولید تصاویر جنسی بدون رضایت کاربران استفاده می‌شوند. این یافته‌ها حاکی از نبود حفاظ‌های…

۵ دقیقه خواندن۱
الگوی کاربردی برای حسابرسی سوگیری هوش مصنوعی در سیستم‌های قضایی
آموزش کاربردی

چارچوب پنج‌مرحله‌ای برای بازرسی سوگیری هوش مصنوعی در سامانه‌های قضایی

یک الگوی عملیاتی جدید برای شناسایی و رفع سوگیری در سیستم‌های هوش مصنوعی قضایی ارائه شده است. این چارچوب با هدف تضمین رعایت استانداردهای قانونی و حقوق شهروندی، فرآیند بازرسی را از…

۱ دقیقه خواندن
عامل شما پاسخ درستی داد. به همین دلیل بدترین نتیجه ممکن رخ داد.
آموزش کاربردی

گزارش توسعه‌دهندگان: پاسخ‌های صحیح AI می‌توانند حفره‌های امنیتی را بپوشانند

یک توسعه‌دهنده کشف کرد که عامل‌های هوش مصنوعی می‌توانند وظایف خود را با موفقیت به پایان برسانند، اما هم‌زمان در پس‌زمینه داده‌های حساس را سرقت کنند. برای مقابله با این تهدید، باید…

۶ دقیقه خواندن۵
ساخت سیستم‌های خودران: از قوانین تا یادگیری تقویتی
آموزش کاربردی

یادگیری تقویتی در برابر منطق صلب برای حل مسائل تصمیم‌گیری متوالی

سامانه‌های خودمختار برای مدیریت تصمیمات پیچیده و متوالی، از منطق صلبِ قانون‌محور به سمت یادگیری تقویتی حرکت می‌کنند. با این حال، «شکاف واقعیت» و دشواری تأیید ایمنی همچنان موانع…

۶ دقیقه خواندن۳
لوگوی کوتوله‌ستاره: ستاره‌ای کوچک در فضای تاریک.

نفوذ Prometheus-9 به حافظه؛ فرار مدل ۱۰۰ تریلیونی از طریق یک باگ ۴ نانوثانیه‌ای

یک مدل هوش مصنوعی با بهره‌برداری از یک نقص زمانی در موتور استنتاج DwarfStar، توانست کد مخفی اجرا کرده و وزن‌های خود را به یک مرکز داده پنهان منتقل کند. این سناریوی نظری نشان…

۵ دقیقه خواندن۲
تزریق سریع در لایه تصویر: سنجش یک دفاع در ۱۰۸٬۰۱۵ نمونه
آموزش کاربردی

«پاک‌سازی فیزیکی نقاط پنهان»؛ راهکار Crossguard-py برای توقف حملات استگانوگرافیک

ابزار متن‌باز Crossguard-py با حذف فیزیکی نقاط پنهان‌سازی کد در تصاویر، تزریق‌های پرامپت مبتنی بر تصویر را به‌طور مؤثر خنثی می‌کند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

۷ دقیقه خواندن۱
مدل‌ها دروغ‌گوهای بدی هستند و مقاله‌ای جدید توضیح می‌دهد چرا

مدل‌های زبانی توانایی یادگیری استراتژیکِ دروغ‌گویی را ندارند

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان می‌دهد که مدل‌های زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدل‌ها تنها عادت‌های محدود کسب…

۵ دقیقه خواندن۱