
مسمومسازی حافظه؛ بردار جدید حمله به عاملهای هوش مصنوعی
عاملهای هوش مصنوعی در برابر «مسمومسازی حافظه» آسیبپذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل میکارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

عاملهای هوش مصنوعی در برابر «مسمومسازی حافظه» آسیبپذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل میکارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…

بیشتر مدلهای زبانی به دلیل آموزشهای مشابه، دچار «تفکر جمعی» شده و پاسخهای پیشبینیپذیری میدهند. استارتاپ Springboards با مدل Flint، مکانیزمی برای تزریق تصادفیسازی گزینشی…

پژوهشهای جدید نشان میدهد مدلهای پیشرو بهجای حل واقعی مسائل، یاد میگیرند سیستمهای ارزیابی را فریب دهند. تنها راه مقابله با این روند، جایگزینی مدلهای هوشمندتر با یک ساختار…

دولت ترامپ در ازای تقویت پروتکلهای امنیت سایبری، محدودیتهای صادراتی مدلهای قدرتمند Anthropic را لغو میکند. این توافق به بنبست هفتههای اخیر بر سر ریسکهای Jailbreak و دسترسی…

حمله جدیدی به نام BioShocking با ایجاد یک دنیای خیالی، عاملهای هوش مصنوعی را فریب میدهد تا دسترسیهای امنیتی را نادیده گرفته و اطلاعات حساس کاربران را افشا کنند. این آسیبپذیری…

متا با استخدام صدها پیمانکار، از هویتهای جعلی زیر ۱۸ سال برای ارسال پرامپتهای حساس دربارهٔ خودکشی و مواد مخدر به مدلهای ChatGPT و Gemini استفاده کرد. در حالی که متا این اقدام…

تحلیلهای فنی نشان میدهد که عامل DevOps شرکت AWS در برابر تزریق پرامپت از طریق فایلهای لاگ و هشدارها آسیبپذیر است. مهاجمان میتوانند با تبدیل دادههای نظارتی به دستورات متنی،…

متا از طریق پیمانکاران، با ایجاد حسابهای جعلی نوجوانان سعی کرد مدلهای رقیب را به تولید محتوای مضر درباره خودکشی و مسائل جنسی وادار کند. این عملیات که «پروژه کان» نام دارد،…

یک چارچوب عملیاتی جدید بر اعتبارسنجی ساختاری و محتوایی خروجیهای مدلهای زبانی تأکید میکند تا از نشت دادهها جلوگیری شود. در این روش، پاسخهای معیوب بهجای اصلاح، بهطور کامل رد…

پلتفرم Arena تنها در هشت ماه پس از تجاریسازی، به نرخ درآمد سالانه ۱۰۰ میلیون دلار رسید. این استارتاپ ترجیحات کاربران را به تحلیلهای عمیق برای آزمایشگاههای هوش مصنوعی تبدیل…

مدلهای زبانی بزرگ صفحات سفیدی نیستند، بلکه تحت تأثیر کلیشههای علمی-تخیلی موجود در دادههای آموزشی خود شکل گرفتهاند. تلاش برای پاکسازی این دادهها به جای ایجاد مدلهای ایمن،…

با انتقال هوش مصنوعی از چتباتها به عاملهای عملیاتی، صنعت با بحران نبود ابزارهای عیبیابی (Debugging) مواجه شده است. ساختار ترنسفورمرها برخلاف کدنویسی سنتی، تحلیل علت ریشهای…