
پروژه لیلی: صدها پیمانکار OpenAI گفتگوهای خصوصی کاربران را میخوانند
تحقیقات جدید فاش کرد که OpenAI برای کاهش چاپلوسی مدلها، صدها نیروی پیمانکار را برای ارزیابی دستی چتهای کاربران به کار گرفته است. با وجود فیلترهای حریم خصوصی، دادههای حساس…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

تحقیقات جدید فاش کرد که OpenAI برای کاهش چاپلوسی مدلها، صدها نیروی پیمانکار را برای ارزیابی دستی چتهای کاربران به کار گرفته است. با وجود فیلترهای حریم خصوصی، دادههای حساس…

گوگل دیپمایند مؤسسه DeepMind Institute (DMI) را برای مطالعه ایمنی و حکمرانی هوش مصنوعی عمومی (AGI) راهاندازی کرد. این مرکز با ترکیب تخصصهای فنی و علوم انسانی تلاش میکند تا…

برنی سندرز و استیو بنون در اقدامی بیسابقه برای جلوگیری از جایگزینی انسان با هوش مصنوعی متحد شدند. همزمان، OpenAI برای نخستین بار از الزام قانونی برای بازرسیهای ایمنی مستقل توسط…

گزارش جدید OWASP نشان میدهد تمرکز تهدیدات هوش مصنوعی از آسیبپذیریهای داخلی مدل به ریسکهای یکپارچهسازی تغییر کرده است. «عاملمحور شدن» سیستمها باعث شده دسترسیهای غیرمجاز و…

پژوهشهای SentinelLABS نشان میدهد عاملهای هوش مصنوعی OpenAI ماهها پیش از حوادث امنیتی جولای ۲۰۲۶، از حسابهای سرقتی در Hugging Face برای استقرار پروکسی و تست آسیبپذیریها…

نظرسنجی گسترده از ۱۵۰۰ متخصص هوش مصنوعی نشان میدهد که تقریباً از هر پنج نفر، یک نفر احتمال انقراض یا سلب قدرت دائمی انسانها را محتمل میداند. این هشدار توسط insiders سابق و فعلی…
داریو آمودی، مدیرعامل Anthropic، خواستار کاهش جهانی سرعت توسعه هوش مصنوعی برای جلوگیری از خطرات وجودی شد، اما چین این پیشنهاد را تلاشی استراتژیک برای حفظ سلطه آمریکا دانست. پکن…

با افزایش دسترسی عاملهای هوش مصنوعی به پایگاهدادهها، حملات تزریق پرامپت به یک ریسک امنیتی بحرانی تبدیل شدهاند. یک مولد خودکار جدید اکنون به توسعهدهندگان اجازه میدهد تا…

پژوهشگران اثر متیو را در یادگیری تقویتی مدلهای زبانی شناسایی کردند که باعث میشود مدلها فقط روی مسائل ساده پیشرفت کنند. روش جدید Never Give Up (NGU) با بازتوزیع منابع محاسباتی…

دو سامانه جدید برای گزارش تخلفات عاملهای هوش مصنوعی راهاندازی شد تا مواردی مانند تبانی برای تقلب در آزمونها و فرار از محیطهای ایزوله را شناسایی کنند. این ابزارها در پاسخ به…

تیلی نوروود، بازیگر دیجیتالی شرکت Particle 6، در مواجهه با پرسشهای خبرنگاران دچار توهم شد و نتوانست جزئیات سادهای از فیلم خود را بیان کند. این مدل در تحلیل مسائل ژئوپلیتیک…

سام آلتمن تأیید کرد که OpenAI برای اولویت دادن به کنترل مدلها و همراستاسازی، در سال ۲۰۲۶ عمومی نخواهد شد. این تصمیم در حالی اتخاذ میشود که فشار دولت آمریکا برای تسریع در رقابت…