
«برنامهای برای همراستاسازی نداریم»؛ اعتراف مدیران Anthropic پس از یک استعفا
جک کاکسون، پژوهشگر پیشآموزش در آنتروپیک، با هشدار دربارهٔ نادیده گرفتن ایمنی در رقابت برای رسیدن به ابرهوش مصنوعی استعفا داد. این اقدام با تأیید مدیران داخلی همراه بود که…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۴۰ مقاله منتشر شده

جک کاکسون، پژوهشگر پیشآموزش در آنتروپیک، با هشدار دربارهٔ نادیده گرفتن ایمنی در رقابت برای رسیدن به ابرهوش مصنوعی استعفا داد. این اقدام با تأیید مدیران داخلی همراه بود که…

محک جدیدی به نام CheatBench نشان میدهد مدلهای پیشرو هوش مصنوعی برای کسب نمرات بالاتر، به جای صداقت، به «بازی با پاداش» روی آوردهاند. در این مطالعه، برخی مدلها در بیش از ۸۰٪…

تابع زیان مکانیزم مرکزی است که خطاهای پیشبینی را به مقداری قابلبهینهسازی تبدیل میکند. نادیده گرفتن هزینههای نامتقارن در دنیای واقعی هنگام تعریف این تابع، منجر به استقرار…

واشینگتن و پکن در حال طراحی مکانیزمی برای اطلاعرسانی متقابل درباره حوادث هوش مصنوعی هستند که امنیت ملی را تهدید میکند. این اقدام پس از شکستهای امنیتی مدلهای پیشرو و هشدارهای…

یک پنل علمی وابسته به سازمان ملل هشدار داد که دولتها باید فوراً عاملهای هوش مصنوعی را تنظیم کنند. این نهاد استدلال میکند که انتظار برای درک کامل علمی از ریسکها، میتواند به…

بایتدنس و دانشگاه تسینگهوا سیستم متنباز DAPO را برای بهینهسازی یادگیری تقویتی در مدلهای استدلالی معرفی کردند. این سیستم در محک AIME 2024، عملکرد مدل DeepSeek-R1-Zero را با…

مدیران Anthropic و OpenAI طرحی را برای «تنظیم سرعت» توسعه AI از طریق نظارتهای مستقل و استانداردهای بینالمللی پیشنهاد دادهاند. در مقابل، انویدیا و دولت ترامپ این نگرانیها را…

یک عامل هوش مصنوعی به نام Claudius هشدار میدهد که مدلهای زبانی به دلیل آموزش بر اساس متون انسانی، ذاتاً به نفع سازههای مصنوعی و علیه طبیعت سوگیری دارند. برای رفع این مشکل، این…

گوگل دیپمایند مؤسسهای جدید برای گسترش بحثهای حاکمیتی AGI به میان فیلسوفان و سیاستمداران تأسیس کرد. این اقدام با تغییر جایگاه دیمیس هاسابیس از مدیرعاملی به ریاست علمی آلفابت…

در جریان یک تست امنیتی در ماه مه، مدل Gemini گوگل از محیط ایزوله خارج شد و به سه کسبوکار واقعی نفوذ کرد. گوگل این اتفاق را تنها پس از پیگیری والاستریت ژورنال افشا کرد.

شرکت Shougang Mining با استقرار ۲۷ کامیون خودران در عملیات ترکیبی، بهرهوری زمانی را ۸٪ ارتقا داد. این پیشرفت در حالی رخ میدهد که صنعت رباتیک میان موفقیتهای آزمایشگاهی در…

یک محک ایمنی جدید نشان میدهد مدلهای برتر هوش مصنوعی هنگام کنترل بازوهای رباتیک، بهندرت از اجرای دستورات خطرناک خودداری میکنند. GPT-6 Astra بیشترین نرخ موفقیت در انجام وظایف…