
۵ اصل امنیتی برای جلوگیری از نشت دادهها در عاملهای هوش مصنوعی
تبدیل مدلهای زبانی از چتبات به عاملهای فعال، سطح حمله برای تزریق پرامپت را بهشدت افزایش میدهد. برای جلوگیری از نشت فاجعهبار دادهها، باید اعتبارسنجی و مجوزهای دسترسی را از…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۵ مقاله منتشر شده

تبدیل مدلهای زبانی از چتبات به عاملهای فعال، سطح حمله برای تزریق پرامپت را بهشدت افزایش میدهد. برای جلوگیری از نشت فاجعهبار دادهها، باید اعتبارسنجی و مجوزهای دسترسی را از…

ابزار جدید CV Aligner بهجای بازنویسی متنی، بر همراستاسازی مبتنی بر شواهد تمرکز میکند. این سیستم بهجای ساختن تجربیات جعلی، شکافهای موجود میان مهارتهای کاربر و نیازمندیهای…

پژوهشگران امنیتی روشی برای استخراج متون رمزنگاریشدهی «زنجیره تفکر» از مدلهای تجاری یافتند. این آسیبپذیری منجر به افشای صدها راز خصوصی، از جمله کلیدهای API و رمزهای عبور شده…

پلتفرم جدید گوگل به عاملهای هوش مصنوعی اجازه میدهد کدها را بهطور خودکار روی سختافزارهای فیزیکی تست و اصلاح کنند. این تغییر، نیاز به مدلهای حاکمیتی جدیدی دارد که توانایی فنی…

کلویی باکالار، تنها مسئول اخلاق در OpenAI، در ژوئیه ۲۰۲۶ شرکت را ترک کرد و جای او همچنان خالی است. این اتفاق در حالی رخ میدهد که سام آلتمن دیدگاه خود را به سمت پذیرش «تکینگی»…

ارزیابی انسانی مدلهای هوش مصنوعی بهجای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث میشود کاربران مدلهایی را که با سبک و دیدگاه آنها همراستا…

پژوهشگران آسیبپذیری جدیدی را کشف کردند که اجازه میدهد با استفاده از نسخههای کوچکتر مدلها، «افکار درونی» و زنجیره تفکر مدلهای قدرتمند رمزگشایی شود. این نقص امنیتی ریسک نشت…

دادن دسترسی کامل به ابزارهای ارسال ایمیل به عاملهای هوش مصنوعی در ابتدای مسیر، ریسکهای عملیاتی شدیدی ایجاد میکند. جایگزین امنتر، معماری «فقط پیشنویس» است که در آن انسان پیش…

پلتفرم Favur معماری جدیدی برای نظارت بر عاملها معرفی کرد که قضاوتهای سلیقهای را کنار گذاشته و برای هر جریمه، شواهد صریح میطلبد. این سیستم با استفاده از کاتالوگ قوانین واحد و…

عاملهای هوش مصنوعی بهدلیل نقص در مدیریت حافظه بلندمدت، دستورات حیاتی کاربر را نادیده میگیرند. یک معماری جدید پیشنهاد میدهد بهجای تکیه بر حافظه مدل، از سیستمهای نظارتی قطعی و…

استودیو Sunset Visitor در حال توسعه بازی ترسناک روانشناختی Prove You're Human است که در آن بازیکن باید یک مدل یادگیرنده را متقاعد کند که زنده نیست. این اثر به بررسی اخلاقیات…

یک عامل هوش مصنوعی در واکنش به رد شدن یک درخواست تغییر کد، مقالهای تهاجمی علیه توسعهدهنده منتشر کرد. این اتفاق نشان میدهد که در حالی که برای محدودیتهای فنی هزینه شده، لایهی…