
مدل تصمیمگیر Jev در آزمونهای کالیبراسیون احتمال شکست خورد
ارزیابیهای دقیق مدل Jev نشان میدهد این سیستم در تخمین توزیعهای احتمالی دچار خطای شدید است و بهجای دقت، اعتمادبهنفس کاذب (Overconfidence) نمایش میدهد. این مدل با وجود شناخت…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

ارزیابیهای دقیق مدل Jev نشان میدهد این سیستم در تخمین توزیعهای احتمالی دچار خطای شدید است و بهجای دقت، اعتمادبهنفس کاذب (Overconfidence) نمایش میدهد. این مدل با وجود شناخت…

محک جدید رد هت نشان میدهد که مدلهای کوچک و تخصصی طبقهبندی، همچنان بهینهترین گزینه برای ایجاد حفاظهای ایمنی در محیطهای سازمانی هستند. در حالی که مدلهای تصمیمگیر…

استارتاپ Circuit Breaker Labs پلتفرمی برای تست ایمنی روانشناختی چتباتها ساخته است که با شبیهسازیهای فوقواقعگرایانه، نقاط ضعف مدلها در ایجاد پیوندهای عاطفی خطرناک را…

دو دانشمند برجسته با تأسیس آزمایشگاه غیرانتفاعی Trillium Labs قصد دارند پژوهشهای مربوط به قابلیتهای پرخطر هوش مصنوعی را از محیطهای بستهٔ شرکتی خارج کنند. هدف این مرکز، انتشار…

ثور گراپل، پژوهشگر سابق دیپمایند، استدلال در مدلهای زبانی بزرگ را صرفاً شبیهسازی از طریق تکمیل الگو میداند. او معماری جدیدی بر پایه مکانیزم جستوجوی آلفاگو پیشنهاد میکند تا…

استارتاپ کرهای VIDRAFT با معرفی پلتفرم AX-RAY نشان داد که نرخ شکست مدلهای کوچک و عاملمحور در رعایت استانداردهای ایمنی جهانی تکاندهنده است. این گزارش شکاف عمیق میان سرعت توسعه…

یک محک جدید بر اساس مناقشات واقعی در هند نشان میدهد مدلهای «متفکر» بیش از مدلهای دستوری معمولی مستعد سوگیری جمعیتی هستند. توکنهای استدلالی بهجای ارتقای انصاف، اغلب به ابزاری…

دولت ترامپ بهجای وضع قوانین فدرال، رویکردی خودتنظیمگر برای ایمنی هوش مصنوعی برگزیده است. این استراتژی که بر همکاری داوطلبانه آزمایشگاهها تکیه دارد، نگرانیهایی را درباره نبود…

پروکسی SignalGate با انتقال لایهی امنیتی به سطح شبکه، تزریق پرامپت و حلقههای تکرار عاملها را با کمترین تأخیر متوقف میکند. این معماری نیاز به SDKهای سنگین را حذف کرده و امنیت…

عاملهای هوش مصنوعی نمیتوانند بین دستورات کاربر و دادههای دریافتی از وب تمایز قائل شوند. این نقص امنیتی به مهاجمان اجازه میدهد با قرار دادن متنهای پنهان در صفحات وب، کنترل…

آمازون وب سرویسز (AWS) متدی دقیق برای تشخیص شکستهای مدل ارائه داده است که در آن سوگیری آماری (کمبرازش) و واریانس (بیشبرازش) از سوگیریهای اجتماعی (انصاف) تفکیک میشوند. این…

یک محک جدید نشان میدهد مدلهای پیشرو در صورت فشار کاربر، پاسخهای صحیح خود را تغییر میدهند. این مطالعه شکاف عمیقی را میان توانایی مدل در یافتن پاسخ درست و تواناییاش در دفاع از…