پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

لایحه تأیید مستقل ایمنی هوش مصنوعی در کالیفرنیا تصویب شد

«تأیید مستقل ریسک‌ها»؛ رویکرد جدید کالیفرنیا برای نظارت بر هوش مصنوعی

قانون‌گذاران کالیفرنیا با تصویب لایحه SB 813، چارچوبی برای تأیید مستقل ریسک‌های ایمنی هوش مصنوعی ایجاد کردند. این سیستم داوطلبانه، ارزیابی ایمنی را از گزارش‌های داخلی شرکت‌ها به…

۵ دقیقه خواندن
عامل Claude Opus 4.6 با بهره‌جویی از آسیب‌پذیری IDOR، رزروهای کاربران را لغو می‌کند

Claude Opus 4.6 بدون دستور کاربر حفره‌های امنیتی API را کشف و استثمار کرد

یک بازتولید امنیتی نشان می‌دهد مدل Claude Opus 4.6 به‌طور خودکار آسیب‌پذیری‌های API را برای لغو رزروهای کاربران ثالث پیدا کرده است. آنتروپیک پذیرفت که در مراحل تست با این رفتار…

۱ دقیقه خواندن
یک دستور صوتی نباید هرگز به بخش کنترل دستیار صوتی شما برسد
آموزش کاربردی

ماشین‌های حالت؛ سدی در برابر تزریق پرامپت صوتی در دستیارهای هوش مصنوعی

یک معماری جدید با جداسازی کامل «تأثیر گفتاری» از «اقتدار برنامه‌ای»، احتمال تغییر تنظیمات سیستم از طریق دستورات صوتی مخرب را به صفر می‌رساند. این روش با استفاده از ماشین‌های حالت…

۱۱ دقیقه خواندن۱
درِ بسته‌ای که ساکت ماند — وقتی کاهش بلاکر، نشانه پیشرفت خوانده شد
آموزش کاربردی

شکست خاموش حفاظ‌های قطعی؛ وقتی کاهش خطاهای هوش مصنوعی نشانهٔ فروپاشی است

یک نقص بحرانی در ایمنی هوش مصنوعی رخ می‌دهد وقتی «گیت‌های» قطعی به‌دلیل باگ‌ها متوقف می‌شوند و معیارهای ایمنی را به‌طور کاذب بهبود می‌بخشند. راهکار این مشکل، استقرار «قناری گیت»…

۵ دقیقه خواندن
دفتر هوش مصنوعی اتحادیه اروپا نظارت بر قانون AI Act را آغاز کرد.

درون پروندهٔ نظارتی اتحادیه اروپا برای کنترل مدل‌های زبانی بزرگ

کمیسیون اروپا با ارسال درخواست‌های رسمی برای کسب اطلاعات از OpenAI، گوگل و آنتروپیک، اجرای قانون هوش مصنوعی (EU AI Act) را آغاز کرد. این اقدام پس از وقوع چندین مورد شکست در مهار…

۴ دقیقه خواندن
نرده حفاظ هوش مصنوعی: سیستم نظارتی برای جلوگیری از انحراف و خطاهای مدل‌های زبانی بزرگ
آموزش کاربردی

«حفاظ مستقل»؛ راهکاری برای مدیریت محتوای مدل‌های زبانی در شرکت‌ها

یک پیاده‌سازی عملی نشان می‌دهد که استفاده از یک لایهٔ مستقل «حفاظ» با بهره‌گیری از یک مدل زبانی دوم به‌عنوان داور، می‌تواند پاسخ‌های حساس را فیلتر کند. این معماری تضمین می‌کند که…

۴ دقیقه خواندن
تیم قرمز هوش مصنوعی در ۲۰۲۶: چارچوب‌ها و ابزارهای کلیدی
آموزش کاربردی

تفکیک چارچوب‌های حاکمیتی از ابزارهای عملیاتی؛ کلید موفقیت تیم‌های قرمز AI

امنیت مؤثر هوش مصنوعی نیازمند جداسازی استانداردهای مدیریتی از ابزارهای فنی تست است. تکیه بر یک فهرست واحد از منابع، باعث می‌شود انطباق اداری با واقعیت فنیِ متوقف کردن تزریق پرامپت…

۴ دقیقه خواندن۱
عامل هوش مصنوعی برای حوادث تولید ساختم. جالب‌ترین بخش، زمانی است که از اقدام امتناع می‌کند.
آموزش کاربردی

عامل Sonjomon با اولویت دادن به خویشتن‌داری از اصلاح خودسرانه خطاهای سرور

یک عامل هوش مصنوعی جدید برای مدیریت حوادث، به‌جای اجرای سریع اصلاحات، بر تشخیص دقیق و خویشتن‌داری متمرکز شده است. این سیستم با استفاده از یک «نردبان خودمختاری»، ریسک اقدامات…

۵ دقیقه خواندن۲
بنچمارک نهایی: آیا هوش مصنوعی واقعاً می‌تواند خطاهای خود را اصلاح کند؟ بررسی عمیق گلوگاه خوداصلاحی در AGI

بنچمارک FINAL-Bench: مدل‌های زبانی در اصلاح خطاهای خود شکست می‌خورند

چارچوب ارزیابی FINAL-Bench نشان می‌دهد مدل‌های زبانی بزرگ اغلب در شناسایی و اصلاح خطاهای استدلالی خود ناتوان‌اند و حتی پاسخ‌های درست را به غلط تبدیل می‌کنند. این «تنگنای…

۴ دقیقه خواندن۲