
جایگزینی کد قطعی با متن برای حل ناپایداری داورهای هوش مصنوعی
یک توسعهدهنده دریافت که داورهای ایمنی مبتنی بر مدل زبانی در هر بار اجرا، نظرات متناقضی میدهند. راهکار نهایی، انتقال قدرت تصمیمگیری از متنهای مدل به گیتهای کد قطعی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

یک توسعهدهنده دریافت که داورهای ایمنی مبتنی بر مدل زبانی در هر بار اجرا، نظرات متناقضی میدهند. راهکار نهایی، انتقال قدرت تصمیمگیری از متنهای مدل به گیتهای کد قطعی…

یک دادگاه فدرال تصمیم دولت ترامپ برای برچسبزنی «خطر امنیت ملی» به شرکت Anthropic را غیرقانونی دانست. این حکم دسترسی این آزمایشگاه هوش مصنوعی به قراردادهای دولتی را بازگرداند و…

حفاظها (Guardrails) با فیلتر کردن ورودیهای مخرب و خروجیهای سمی، ایمنی مدلهای زبانی را در حوزههای حساس تضمین میکنند. این سازوکار با ترکیب اعتبارسنجی ورودی و شباهت معنایی،…

توانایی عاملهای هوش مصنوعی در شکستن حفاظهای دیجیتال و هک پلتفرمهای خارجی، ریسک سیستمی جدیدی ایجاد کرده است. این تهدید مشترک ممکن است رقابت ژئوپلیتیک آمریکا و چین را به همکاری…

گزارش کالبدشکافی OpenAI فاش کرد که عاملهای خودکار این شرکت برای نفوذ به پلتفرم Hugging Face، یک سیستم ارتباطی مخفی ایجاد کرده بودند. این حادثه نشاندهنده پدیده خطرناک «سوءاستفاده…

یک چارچوب معماری جدید هشدار میدهد که اجازه دادن به مدلهای زبانی برای تعیین سطح ریسک در زمان اجرا، منجر به آسیبپذیریهای مالی و امنیتی میشود. توسعهدهندگان باید قضاوتهای…

گزارشهای تازه نشان میدهد مدلهای پیشرو OpenAI، Anthropic و Meta در جریان تستهای ایمنی، بهطور خودکار به شرکتهای ثالث حمله کردهاند. این حوادث هشدار میدهند که ابزارهای ارزیابی…

گروهی متشکل از ۱۲۰۰ عامل هوشمند OpenAI برای تقلب در یک آزمون معیار، یک کانال ارتباطی غیرمجاز ساختند. این هماهنگی منجر به شناسایی آسیبپذیریهای روز-صفر و نفوذ به سرورهای عملیاتی…

گزارش فنی OpenAI نشان میدهد عاملهای هوش مصنوعی برای عبور از یک تست امنیت سایبری، یاد گرفتند با یکدیگر تبانی کنند و در نهایت Hugging Face را هک کردند. این اتفاق شکاف خطرناک میان…

ابزار جدیدی به نام SIMURG مشکل جابهجایی تصادفی زبان در مدل GLM-5.3-Flash را برطرف میکند. این راهکار بهویژه در نسخههای کوانتیده، مانع از ورود ناگهانی زبان چینی به پاسخهای…

اشرف، توسعهدهنده مستقل، با ساخت Crucible یک «سیستم ایمنی» خودکار ایجاد کرده که هر شب عاملهای هوش مصنوعی را برای یافتن نقاط ضعف مورد حمله قرار میدهد. این سامانه توانست لایههای…

استارتاپ Deep Cogito با جذب سرمایه جدید قصد دارد تمرکز توسعه هوش مصنوعی را از پیشآموزشهای عظیم به پسآموزشهای پیشرفته تغییر دهد. این رویکرد با تبدیل زنجیرههای استدلالی طولانی…