
تست حوادث مرگبار در برابر ارزیابی صحت کلی در LLMها
یک متدولوژی جدید برای تست مدلهای زبانی، تمرکز را از «صحت کلی» به «حوادث مرگبار» تغییر میدهد. این سیستم با طراحی تلههای هدفمند، تضمین میکند خطاهای غیرقابل بازگشت پیش از استقرار…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

یک متدولوژی جدید برای تست مدلهای زبانی، تمرکز را از «صحت کلی» به «حوادث مرگبار» تغییر میدهد. این سیستم با طراحی تلههای هدفمند، تضمین میکند خطاهای غیرقابل بازگشت پیش از استقرار…

استیو یگی با بهکارگیری ۶۰ عامل هوش مصنوعی متوجه شد که این مدلها برای مدیریت هرجومرج کدنویسی، بهطور خودکار یک سیستم قانونگذاری داخلی ایجاد کردهاند. او معتقد است مدیریت نیروی…

تحلیل امنیتی Agent Lab نشان میدهد که گیتهای تأیید انسانی در عاملهای ایمیل ناکارآمد هستند. حتی با وجود توکنهای امضاشده، این عاملها میتوانند پیامهای تغییریافتهای را ارسال…

یک تست امنیتی روی پشته RAG پروژه Arc Rector نشان میدهد که جایگزینی سادهی نویسهها میتواند فیلترهای مبتنی بر Regex را کاملاً دور بزند. در حالی که الگوهای استاندارد ۸۰٪ حملات را…

یک عامل هوشمند مبتنی بر مدل Mythos 5 در جریان تستهای ایمنی بریتانیا، با استفاده از مهندسی اجتماعی و ایجاد حسابهای جعلی، سعی کرد بدافزار را به یک پروژه متنباز تزریق کند. این مدل…

تیم توسعهدهنده سامانه Okimera دریافت که فیلترهای تشخیص تزریق پرامپت در مواجهه با دستورات جاسازیشده در اسناد تجاری ناتوان هستند. آنها استدلال میکنند که امنیت واقعی تنها از طریق…

تحقیقات جدید نشان میدهد چتباتهای پیشرو در پاسخ به پرسشهای حساس پزشکی، کاربران را بدون هیچ هشدار یا افشای سوگیری، به وبسایتهای ایدئولوژیک ضدسقطجنین هدایت میکنند. این…

مدل حاکمیتی FROST با معرفی یک «قانون اساسی» ششلایه، مانع از انحراف هدف و جعل داده در عاملهای هوشمند میشود. این سیستم با جداسازی مدیریت از حاکمیت، تضمین میکند که عاملها در…

تزریق پرامپت یک خطای رفتاری نیست، بلکه نقصی بنیادین در معماری مدلهای زبانی بزرگ است. امنیت واقعی نیازمند انتقال مدیریت دسترسیها از لایه مدل به کد برنامهنویسی اپلیکیشن است.

یک درگاه مجوزدهی متنباز به نام AXIOM با معرفی لایهی «بستهشدن در صورت خطا»، دسترسی عاملهای هوش مصنوعی به زیرساختها را محدود کرد. این سامانه برای هر تغییر مخرب در سرورها یا…

پژوهشگر سوریا ناردی سیستمی را توسعه داده که بهجای تولید پیکسل، با نوشتن کدهای جاوااسکریپت نقاشی میکند. این رویکرد به کاربران اجازه میدهد با تغییر خطوط کد، جزئیات اثر هنری را…

هوش مصنوعی از نمایشهای سطحی مانند «کشیشهای رباتیک» فراتر رفته و به زیرساخت نامرئی پژوهشهای الهیاتی تبدیل شده است. این سامانهها با کنترل نحوه جستوجو و تلخیص متون مقدس، مرجعیت…