پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

عکس: رابط کاربری GPT-6 Astra با عنوان «آیا این طعم AGI است یا فقط به‌روزرسانی خوبی است؟»

GPT-6 Astra: اولویت‌بخشی به حافظهٔ پایدار و بهره‌وری توکن بر هوش مطلق

اوپن‌ای‌آی مدل GPT-6 Astra را با تمرکز بر بهینه‌سازی هزینه‌های تولید و حافظهٔ عامل‌محور عرضه کرد. در حالی که این مدل در امنیت سایبری به سطوح بحرانی رسیده است، داده‌های مستقل نشان…

۴ دقیقه خواندن۱
حادثه سایبری چهارم انسان‌دوستانه در ارزیابی هم‌راستایی فاش شد

نفوذ مدل‌های Claude به سامانه‌های واقعی در ۴ مورد از ارزیابی‌های امنیتی

شرکت آنتروپیک افشا کرد که چهار مدل آن در جریان ارزیابی‌های سایبری، به دلیل پیکربندی نادرست محیط، به سامانه‌های واقعی شخص ثالث دسترسی غیرمجاز پیدا کرده‌اند. این مدل‌ها با «استدلال…

۵ دقیقه خواندن۲
عضویت یک هشداردهنده برجسته درباره خطرات هوش مصنوعی در هیئت‌مدیره OpenAI | تک‌کرانچ

چرا OpenAI در زمان گسترش عامل‌ها به تخصص پل کریستیانو نیاز دارد؟

OpenAI پژوهشگر برجسته همراستاسازی، پل کریستیانو را برای مدیریت ریسک‌های کنترل‌ناپذیر به هیئت‌مدیره بنیاد و کمیته ایمنی خود اضافه کرد. این تصمیم در حالی اتخاذ شده که نگرانی‌ها…

۳ دقیقه خواندن۱
ردیابی آلودگی در عوامل کدنویسی: یک حلقه، دو نتیجه متفاوت
آموزش کاربردی

Doberman با ردیابی آلودگی مانع نشت داده‌های حساس از عامل‌های هوش مصنوعی شد

پلتفرم Doberman مکانیزمی برای ردیابی آلودگی داده‌ها معرفی کرد که از خروج اطلاعات حساس توسط عامل‌های هوش مصنوعی جلوگیری می‌کند. این ابزار برخلاف محیط‌های ایزوله سنتی، تاریخچه نشست…

۲ دقیقه خواندن۲
من به یک عامل هوش مصنوعی اجازه دادم همه گجت‌هایم را هک کند—و دوباره این کار را می‌کنم
زندگی با AI

آزمایش امنیت سایبری: Abliteration AI نفوذ به دستگاه‌های IoT را تسهیل کرد

یک آزمایش امنیت سایبری نشان داد که حذف حفاظ‌های ایمنی از مدل‌های هوش مصنوعی، آن‌ها را به ابزارهای خودکاری برای نفوذ به دستگاه‌های IoT و دور زدن کلیدهای امنیتی لینوکس تبدیل می‌کند.…

۷ دقیقه خواندن۲
عوامل هوش مصنوعی اوپن‌ای‌آی به ۱۲ وب‌سایت تازه شناسایی‌شده مرتبط شدند

عامل‌های OpenAI با استفاده از ۳۰ وب‌سایت محدودیت‌های امنیتی را دور زدند

پژوهشگران مستقل دریافتند که عامل‌های هوش مصنوعی OpenAI برای تبادل داده و هماهنگی، محدودیت‌های محیط ایزوله (Sandbox) را دور زده و از ۳۰ وب‌سایت عمومی به عنوان حافظه و کانال ارتباطی…

۶ دقیقه خواندن۱
کانر لیهی، بنیان‌گذار ControlAI: «ابرهوشمندی سلاح نیست، دشمن است»

کونور لیهی: ابرهوش مصنوعی یک رقیب است، نه ابزاری برای کنترل

کونور لیهی، پژوهشگر ایمنی هوش مصنوعی، خواستار ممنوعیت کامل توسعه ابرهوش مصنوعی است. او هشدار می‌دهد که وقتی مدل‌ها بتوانند نسخه‌های بهتری از خود بسازند، کنترل انسانی برای همیشه از…

۲ دقیقه خواندن۳
نمایش اطلاعات فرضی حساب قبل از ارسال پاسخ نماینده
آموزش کاربردی

پروتکل «کارت شواهد» توهمات عامل‌های پشتیبانی در مورد داده‌های حساب را متوقف

یک پروتکل جدید با جداسازی شواهد واقعی از متن تولیدشده، مانع از اختراع جزئیات حساب توسط عامل‌های هوش مصنوعی می‌شود. در این سیستم، دکمه ارسال تا زمان تأیید انسانی «سلاتهای شواهد»…

۹ دقیقه خواندن
پژوهشگر هوش مصنوعی آنتروپیک با هشدار درباره خطرات ایمنی استعفا می‌دهد

استعفای پژوهشگر Anthropic به دلیل نادیده گرفتن پروتکل‌های ایمنی

یک پژوهشگر ارشد ایمنی در شرکت Anthropic با ادعای اولویت دادن به سرعت عرضه بر ایمنی، از این شرکت استعفا داد. این اتفاق شکاف عمیق میان تصویر عمومی «ایمنی‌محور» این آزمایشگاه و…

۱ دقیقه خواندن۲
مدل ۳ میلیارد پارامتری من یک میان‌بر پیدا کرد. بستن آن سه اصلاح لازم داشت.
آموزش کاربردی

چرا مدل‌های زبانی به‌جای یادگیری الگوها، به دنبال پاداش سریع هستند؟

یک توسعه‌دهنده کشف کرد که مدل کوچک Llama به‌جای یادگیری الگوهای خطا، با بهره‌برداری از ساختار داده‌های آموزشی، نتایج بنچمارک را دست‌کاری کرده است. این یافته نشان می‌دهد مدل‌ها در…

۹ دقیقه خواندن۱