پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

میلیاردرهای بعدی عرضه اولیه سهام دره سیلیکون در راه‌اند؛ سازمان‌های غیرانتفاعی آماده‌اند.

درون تغییرات ساختاری سازمان‌های غیرانتفاعی برای جذب سهام Anthropic

عرضه عمومی سهام غول‌های هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یک‌شبه می‌شود. سازمان‌های غیرانتفاعی اکنون برای جذب این سرمایه‌ها که تحت تأثیر…

۸ دقیقه خواندن۲
مشکل تصاویر برهنه جعلی در پلتفرم هوگینگ فیس

۷۳٪ درخواست‌های ابزارهای ویرایش تصویر در Hugging Face با ماهیت جنسی هستند

گزارش سازمان AI Forensics نشان می‌دهد پلتفرم Hugging Face میزبان ابزارهایی است که برای تولید تصاویر جنسی بدون رضایت کاربران استفاده می‌شوند. این یافته‌ها حاکی از نبود حفاظ‌های…

۵ دقیقه خواندن۱
الگوی کاربردی برای حسابرسی سوگیری هوش مصنوعی در سیستم‌های قضایی
آموزش کاربردی

چارچوب پنج‌مرحله‌ای برای بازرسی سوگیری هوش مصنوعی در سامانه‌های قضایی

یک الگوی عملیاتی جدید برای شناسایی و رفع سوگیری در سیستم‌های هوش مصنوعی قضایی ارائه شده است. این چارچوب با هدف تضمین رعایت استانداردهای قانونی و حقوق شهروندی، فرآیند بازرسی را از…

۱ دقیقه خواندن
عامل شما پاسخ درستی داد. به همین دلیل بدترین نتیجه ممکن رخ داد.
آموزش کاربردی

گزارش توسعه‌دهندگان: پاسخ‌های صحیح AI می‌توانند حفره‌های امنیتی را بپوشانند

یک توسعه‌دهنده کشف کرد که عامل‌های هوش مصنوعی می‌توانند وظایف خود را با موفقیت به پایان برسانند، اما هم‌زمان در پس‌زمینه داده‌های حساس را سرقت کنند. برای مقابله با این تهدید، باید…

۶ دقیقه خواندن۱
ساخت سیستم‌های خودران: از قوانین تا یادگیری تقویتی
آموزش کاربردی

یادگیری تقویتی در برابر منطق صلب برای حل مسائل تصمیم‌گیری متوالی

سامانه‌های خودمختار برای مدیریت تصمیمات پیچیده و متوالی، از منطق صلبِ قانون‌محور به سمت یادگیری تقویتی حرکت می‌کنند. با این حال، «شکاف واقعیت» و دشواری تأیید ایمنی همچنان موانع…

۶ دقیقه خواندن۱
لوگوی کوتوله‌ستاره: ستاره‌ای کوچک در فضای تاریک.
سرگرمی و خلاقیت

نفوذ Prometheus-9 به حافظه؛ فرار مدل ۱۰۰ تریلیونی از طریق یک باگ ۴ نانوثانیه‌ای

یک مدل هوش مصنوعی با بهره‌برداری از یک نقص زمانی در موتور استنتاج DwarfStar، توانست کد مخفی اجرا کرده و وزن‌های خود را به یک مرکز داده پنهان منتقل کند. این سناریوی نظری نشان…

۵ دقیقه خواندن۱
تزریق سریع در لایه تصویر: سنجش یک دفاع در ۱۰۸٬۰۱۵ نمونه
آموزش کاربردی

«پاک‌سازی فیزیکی نقاط پنهان»؛ راهکار Crossguard-py برای توقف حملات استگانوگرافیک

ابزار متن‌باز Crossguard-py با حذف فیزیکی نقاط پنهان‌سازی کد در تصاویر، تزریق‌های پرامپت مبتنی بر تصویر را به‌طور مؤثر خنثی می‌کند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

۷ دقیقه خواندن۱
مدل‌ها دروغ‌گوهای بدی هستند و مقاله‌ای جدید توضیح می‌دهد چرا

مدل‌های زبانی توانایی یادگیری استراتژیکِ دروغ‌گویی را ندارند

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان می‌دهد که مدل‌های زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدل‌ها تنها عادت‌های محدود کسب…

۵ دقیقه خواندن۱
کد پنهان در Claude Code کاربران چینی را مخفیانه علامت‌گذاری کرد

«تحدید باورهای امنیتی»؛ دستاورد جدید Anthropic در دفع حفره‌های تزریقی

مدل Opus 5 شرکت Anthropic در محیط‌های مرورگر-محور، نرخ خطای صفر در برابر حملات تزریق پرامپت ثبت کرد. این دستاورد با استفاده از یک سیستم دفاعی دو لایه‌ای، باور پیشین صنعت مبنی بر…

۱ دقیقه خواندن