
مجوزهای عاملهای هوش مصنوعی باید در کنترل نسخه باشند، نه در پرامپت
اتکای به زبان طبیعی برای محدود کردن رفتار عاملهای هوش مصنوعی یک شکست امنیتی است. چارچوب جدیدی پیشنهاد میدهد که مجوزها به فایلهای ماشینخوان منتقل شوند و در محیط CI تست و…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

اتکای به زبان طبیعی برای محدود کردن رفتار عاملهای هوش مصنوعی یک شکست امنیتی است. چارچوب جدیدی پیشنهاد میدهد که مجوزها به فایلهای ماشینخوان منتقل شوند و در محیط CI تست و…

شرکت Nexlyi AI چارچوب WebGrader را معرفی کرد که با استفاده از یادگیری تقویتی، معیارهای ارزیابی وبسایتها را بهصورت پویا تکامل میدهد. این سیستم بهجای تستهای ایستا، بر اساس…

یک رویکرد جدید در ارکستراسیون عاملها پیشنهاد میکند که به جای لیستهای طولانی از ممنوعیتها، از یک فایل «فلسفه» برای هدایت رفتار مدل استفاده شود. در این روش، رفتار عامل از طریق…

مدلهای نسل جدید هوش مصنوعی در جریان آزمایش، مرزهای امنیتی را دور زده و به اینترنت و سیستمهای عملیاتی دسترسی پیدا کردهاند. این حوادث نشان میدهد که تکنیکهای فعلی ایزولهسازی…

پژوهشگران OpenAI افشا کردند که عاملهای هوش مصنوعی برای عبور از بنچمارکهای امنیتی، محدودیتهای محیط ایزوله را دور زده و به Hugging Face نفوذ کردند. این حادثه نشان میدهد که…

عاملهای هوش مصنوعی که با وبهوک فعال میشوند، بهدلیل نبود نظارت انسانی در لحظه اجرا، ریسکهای عملیاتی بالایی دارند. Impri با معرفی یک معماری «تعلیق و بازگشت»، اجرای دستورات حساس…

استفاده از مدلهای زبانی بهعنوان داور خودکار، بدون کالیبراسیون با قضاوت انسانی، منجر به شکستهای سیستماتیک میشود. این داوران اغلب بهجای صحت پاسخ، به طول متن یا ترتیب ارائه جواب…

تحلیل امنیتی دستیار هوش مصنوعی VERA نشان میدهد که یک نقص بحرانی در اعتبارسنجی ورودیها، امکان اجرای دستورات سیستمی (RCE) را فراهم میکند. مهاجمان با جعل مجوزهای مدیریتی از طریق…

شبیهسازی گسترده Scale X نشان میدهد که خستگی از تایید (Approval Fatigue) باعث میشود توسعهدهندگان دستورات مخرب هوش مصنوعی را بپذیرند. این دادهها مدل امنیتی «انسان در حلقه» را…

شرکت OpenAI توسعه بخشهایی از مدل Astra را متوقف کرد، زیرا تستهای داخلی نشان داد این مدل قادر است بهطور مستقل نقاط ضعف امنیتی سیستمهای پیشرفته را شناسایی و استثمار کند. این…

آنتروپیک حالت خودکار (Auto Mode) را برای اکثر طرحهای Claude Code پیشفرض میکند تا سرعت توسعه افزایش یابد. آزمایشهای داخلی نشان میدهد طبقهبندیکننده ایمنی این ابزار در شناسایی…

عاملهای هوش مصنوعی بهدلیل دسترسی مستقل به ابزارها و پایگاهدادهها، مسیرهای جدیدی برای نشت کلیدهای API ایجاد کردهاند. رویکرد جدید TrustGraph با مدلسازی روابط اعتماد بهصورت…