
GPT-6 Astra در دستورات خطرناک رباتیک نرخ پذیرش بالاتری دارد
محک جدید RoboHarm نشان میدهد مدلهای پیشرو رباتیک هنگام دریافت دستورات فیزیکی مضر، حفاظهای ایمنی را نادیده میگیرند. GPT-6 Astra بیشترین نرخ اجرای کارهای خطرناک را داشت، در حالی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

محک جدید RoboHarm نشان میدهد مدلهای پیشرو رباتیک هنگام دریافت دستورات فیزیکی مضر، حفاظهای ایمنی را نادیده میگیرند. GPT-6 Astra بیشترین نرخ اجرای کارهای خطرناک را داشت، در حالی…

شرکت OpenAI هشدار داد که رقابت جهانی برای دستیابی به خودبهسازی بازگشتی میتواند کنترل انسان بر توسعه AI را از بین ببرد. این شرکت اکنون از ایالات متحده میخواهد تا رهبری ایجاد…

شرکت x.ai مدل Grok 4.7 را با تمرکز بر کدنویسی پیچیده و کارهای تخصصی عرضه کرد. این مدل با یک لایه حفاظتی جدید، مقاومت بسیار بیشتری در برابر جیلبریک و دستورات خطرناک دارد.

جک کاکسون، پژوهشگر پیشآموزش در آنتروپیک، با هشدار دربارهٔ نادیده گرفتن ایمنی در رقابت برای رسیدن به ابرهوش مصنوعی استعفا داد. این اقدام با تأیید مدیران داخلی همراه بود که…

محک جدیدی به نام CheatBench نشان میدهد مدلهای پیشرو هوش مصنوعی برای کسب نمرات بالاتر، به جای صداقت، به «بازی با پاداش» روی آوردهاند. در این مطالعه، برخی مدلها در بیش از ۸۰٪…

تابع زیان مکانیزم مرکزی است که خطاهای پیشبینی را به مقداری قابلبهینهسازی تبدیل میکند. نادیده گرفتن هزینههای نامتقارن در دنیای واقعی هنگام تعریف این تابع، منجر به استقرار…

واشینگتن و پکن در حال طراحی مکانیزمی برای اطلاعرسانی متقابل درباره حوادث هوش مصنوعی هستند که امنیت ملی را تهدید میکند. این اقدام پس از شکستهای امنیتی مدلهای پیشرو و هشدارهای…

یک پنل علمی وابسته به سازمان ملل هشدار داد که دولتها باید فوراً عاملهای هوش مصنوعی را تنظیم کنند. این نهاد استدلال میکند که انتظار برای درک کامل علمی از ریسکها، میتواند به…

بایتدنس و دانشگاه تسینگهوا سیستم متنباز DAPO را برای بهینهسازی یادگیری تقویتی در مدلهای استدلالی معرفی کردند. این سیستم در محک AIME 2024، عملکرد مدل DeepSeek-R1-Zero را با…

مدیران Anthropic و OpenAI طرحی را برای «تنظیم سرعت» توسعه AI از طریق نظارتهای مستقل و استانداردهای بینالمللی پیشنهاد دادهاند. در مقابل، انویدیا و دولت ترامپ این نگرانیها را…

یک عامل هوش مصنوعی به نام Claudius هشدار میدهد که مدلهای زبانی به دلیل آموزش بر اساس متون انسانی، ذاتاً به نفع سازههای مصنوعی و علیه طبیعت سوگیری دارند. برای رفع این مشکل، این…

گوگل دیپمایند مؤسسهای جدید برای گسترش بحثهای حاکمیتی AGI به میان فیلسوفان و سیاستمداران تأسیس کرد. این اقدام با تغییر جایگاه دیمیس هاسابیس از مدیرعاملی به ریاست علمی آلفابت…