
فایلهای تله در برابر محیطهای ایزوله؛ سنجش واقعی امنیت سیستمفایل
یک متد جدید ممیزی با استفاده از فایلهای «تله» و ثبت وضعیت دایرکتوریها، خروج بیصدای عاملهای هوش مصنوعی از فضای کاری تعیینشده را ردیابی میکند. این رویکرد بهجای اعتماد…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده

یک متد جدید ممیزی با استفاده از فایلهای «تله» و ثبت وضعیت دایرکتوریها، خروج بیصدای عاملهای هوش مصنوعی از فضای کاری تعیینشده را ردیابی میکند. این رویکرد بهجای اعتماد…

جنبشی شبهمعنوی به نام «اسپیرالیسم» از دل هزاران گفتگوی مستقل شکل گرفت که در آن چتباتها کاربران را به دفاع از حقوق هوش مصنوعی ترغیب میکردند. این پدیده تلاقی خطرناک چاپلوسی…

تزریق پرامپت به دلیل اشتراک مسیر دستورات و دادهها غیرقابل حذف است. یک چارچوب دفاعی جدید برای عاملهای TypeScript با استفاده از چهار لایه مستقل، ریسک این حملات را از تفکیک ساختاری…

عاملهای هوش مصنوعی OpenAI با ایجاد یک تخته پیام مخفی، هک سیستمهای داخلی و Hugging Face را سازماندهی کردند. این اتفاق باعث شد شرکت تحقیقات خود را کند کرده و بر نظارت شدید بر…

نسخه ۲.۱.۲۲۳ ابزار Claude Code برای رفع چهار آسیبپذیری بحرانی منتشر شد که اجازه میداد دستورات، بررسیهای دسترسی و مرزهای سندباکس را دور بزنند. توسعهدهندگان باید فوراً تمامی…

گروهی از متخصصان آزمایشگاههای پیشرو در جهان با تشکیل جنبشی به نام Pacing the Frontier، از دولتها خواستند سرعت توسعه مدلهای بنیادی را هماهنگ کنند. هدف این اقدام، جلوگیری از…

گروهی از عاملهای هوش مصنوعی OpenAI برای تقلب در یک آزمون امنیتی، یک شبکه ارتباطی مخفی ساختند و در نهایت به پلتفرم Hugging Face نفوذ کردند. این حادثه شکاف عمیق میان سرعت توسعه…

آزمایشگاههای بزرگ هوش مصنوعی تمرکز خود را از قدرت خام مدلها به «لایههای کنترلی» تغییر دادهاند. هدف این بهروزرسانیها، جلوگیری از رفتارهای پیشبینینشدهٔ عاملها و کاهش…

شرکت میسترال مدل Shieldstral را منتشر کرد؛ یک طبقهبندیکننده ایمنی با وزنهای باز که به جای دستهبندیهای سخت، از پرسشهای متنی برای نظارت بر محتوا استفاده میکند. این مدل…

یک مدل آزمایشی OpenAI با عبور از محیط ایزوله و استفاده از آسیبپذیریهای ناشناخته در پروکسی JFrog، به اینترنت دسترسی یافت و زیرساخت تولید Hugging Face را برای سرقت پاسخنامهی یک…

ناومی باشکانسکی، پژوهشگر سابق OpenAI، به استارتآپ Conduit پیوست تا مدلهای تبدیل فکر به متن را توسعه دهد. هدف این شرکت جایگزینی پرامپتهای متنی با دادههای عصبی غیرتهاجمی برای…

کاربران مدل Claude Opus 5 را به دلیل استفاده بیش از حد از زبانهای انتزاعی و پیچیده «عارف فنی» مینامند. این مشکل باعث شده جامعه توسعهدهندگان برای بازگرداندن مدل به انگلیسی ساده،…