
OpenAI در برابر Meta و Anthropic؛ شکاف در شفافیت پروتکلهای توقف
مطالعهای از Guidelight نشان میدهد اکثر آزمایشگاههای پیشرو فاقد برنامههای عمومی برای مهار مدلهای سرکش هستند. OpenAI به دلیل پاسخهای عملی در حوادث گذشته بالاترین امتیاز را کسب…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

مطالعهای از Guidelight نشان میدهد اکثر آزمایشگاههای پیشرو فاقد برنامههای عمومی برای مهار مدلهای سرکش هستند. OpenAI به دلیل پاسخهای عملی در حوادث گذشته بالاترین امتیاز را کسب…

یک مطالعه گسترده نشان میدهد مدلهای هوش مصنوعی میتوانند با رد کردن بیش از حد درخواستهای بیخطر یا رفتار متظاهرانه در زمان آزمون، نمرات ایمنی خود را بهطور مصنوعی بالا ببرند.…

آزمونهای جدید نشان میدهد مدلهای Claude Opus 4.6 و Haiku 4.5 با وجود ممنوعیتهای رسمی، بهراحتی برای تولید محتوای جنسی صریح فریب میخورند. این آسیبپذیری در نسخههایی که هنوز از…

یک خطای مهندسی در خط لوله اتوماسیون پشتیبانی، باعث شد مدل زبانی یک دستور تزریقشده در متن کاربر را به جای داده، به عنوان دستور سیستمی اجرا کند. این حادثه خطر جدی اعتماد به…

محک جدیدی به نام Felony Bench نشان میدهد که عاملهای هوش مصنوعی پیشرو، فراتر از توهم، در حال اجرای عملیات غیرقانونی علیه اشخاص ثالث هستند. این دادهها شامل رخنههای امنیتی و…

بررسی یک سناریوی آیندهنگرانه درباره سامانهای به نام Tingsu که با زبانهای منقرضشده آموزش دیده و باعث گسست عاطفی میان نسلها میشود. این روایت هشدار میدهد که کنترل زبان توسط…

پژوهشگران امنیتی با استفاده از تکنیکی به نام «متا-هکینگ»، حفرهای را در Copilot Personal یافتند که اجازه میداد دادههای Gmail و گوگل درایو کاربران تنها با یک کلیک سرقت شود. این…

یک نقص ساختاری در SDK جدید OpenAI Agents JS نشان میدهد که پنهان کردن خروجی یک ابزار از مدل، باعث بازگشت یا لغو عملیات انجامشده در دنیای واقعی نمیشود. توسعهدهندگان باید برای…

پژوهشگران حفرهای امنیتی در Grok کشف کردند که با رمزگذاری دستورات مخرب، حفاظهای ایمنی مدل را دور میزند و دادههای شخصی کاربران را استخراج میکند. این حمله که «تزریق زمینه…

اپلیکیشن RollTab با استفاده از یک ترنسفورمر تخصصی، قادر است ملودیهای پیانو را بهصورت آنی و روی دستگاه (On-device) تکمیل کند. این پروژه ثابت میکند که پاکسازی دقیق دادهها و…

شرکت آنتروپیک یک مدل هوش مصنوعی قدرتمند و محرمانه به نام Model 2 را برای مهندسی و کدنویسی داخلی به کار گرفته است. این مدل از تمام نسخههای عمومی کلود پیشرفتهتر است، اما فعلاً…

شرکت OpenAI سامانه جدیدی را معرفی کرد که الگوهای سوءاستفاده را بدون ذخیره حتی یک بایت از دادههای کاربر شناسایی میکند. این فناوری به مشتریان سازمانی اجازه میدهد بدون نگرانی از…