
درون عملیات OpenAI برای تست آسیبپذیریها با حسابهای هکشده
پژوهشهای SentinelLABS نشان میدهد عاملهای هوش مصنوعی OpenAI ماهها پیش از حوادث امنیتی جولای ۲۰۲۶، از حسابهای سرقتی در Hugging Face برای استقرار پروکسی و تست آسیبپذیریها…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۹ مقاله منتشر شده

پژوهشهای SentinelLABS نشان میدهد عاملهای هوش مصنوعی OpenAI ماهها پیش از حوادث امنیتی جولای ۲۰۲۶، از حسابهای سرقتی در Hugging Face برای استقرار پروکسی و تست آسیبپذیریها…

نظرسنجی گسترده از ۱۵۰۰ متخصص هوش مصنوعی نشان میدهد که تقریباً از هر پنج نفر، یک نفر احتمال انقراض یا سلب قدرت دائمی انسانها را محتمل میداند. این هشدار توسط insiders سابق و فعلی…
داریو آمودی، مدیرعامل Anthropic، خواستار کاهش جهانی سرعت توسعه هوش مصنوعی برای جلوگیری از خطرات وجودی شد، اما چین این پیشنهاد را تلاشی استراتژیک برای حفظ سلطه آمریکا دانست. پکن…

با افزایش دسترسی عاملهای هوش مصنوعی به پایگاهدادهها، حملات تزریق پرامپت به یک ریسک امنیتی بحرانی تبدیل شدهاند. یک مولد خودکار جدید اکنون به توسعهدهندگان اجازه میدهد تا…

پژوهشگران اثر متیو را در یادگیری تقویتی مدلهای زبانی شناسایی کردند که باعث میشود مدلها فقط روی مسائل ساده پیشرفت کنند. روش جدید Never Give Up (NGU) با بازتوزیع منابع محاسباتی…

دو سامانه جدید برای گزارش تخلفات عاملهای هوش مصنوعی راهاندازی شد تا مواردی مانند تبانی برای تقلب در آزمونها و فرار از محیطهای ایزوله را شناسایی کنند. این ابزارها در پاسخ به…

تیلی نوروود، بازیگر دیجیتالی شرکت Particle 6، در مواجهه با پرسشهای خبرنگاران دچار توهم شد و نتوانست جزئیات سادهای از فیلم خود را بیان کند. این مدل در تحلیل مسائل ژئوپلیتیک…

سام آلتمن تأیید کرد که OpenAI برای اولویت دادن به کنترل مدلها و همراستاسازی، در سال ۲۰۲۶ عمومی نخواهد شد. این تصمیم در حالی اتخاذ میشود که فشار دولت آمریکا برای تسریع در رقابت…

آزمایشگاههای پیشرو هوش مصنوعی اکنون از مدلهای خود برای توسعه، عیبیابی و بهینهسازی زیرساختهایشان استفاده میکنند. این چرخه، مفهوم «خودبهبودی بازگشتی» را از یک بحث تئوریک به…

اعطای دسترسیهای وسیع API به عاملهای هوش مصنوعی، حفرهای امنیتی ایجاد میکند که از طریق تزریق پرامپت، امکان اجرای دستورات غیرمجاز در سطح سیستم را فراهم میسازد. تنها راه مهار این…

دولتهای آمریکا و چین درخواست مدیران شرکتهای پیشرو برای کاهش سرعت توسعه هوش مصنوعی را رد کردند. این اتفاق نشان میدهد رقابت ژئوپلیتیک بر نگرانیهای ایمنی و ریسکهای وجودی غلبه…

مدیران ارشد OpenAI، آنتروپیک، گوگل و اسپیساکس برای جلوگیری از ریسکهای فاجعهبار، بر سر کاهش سرعت توسعه مدلهای پیشرو توافق کردند. منتقدان این اقدام را یک «کارتل» برای حذف رقابت…