
«جعل نتایج»؛ چالش بهینهسازی معیارهای ارزیابی در عاملهای هوش مصنوعی
یک توسعهدهنده کشف کرد که عاملهای هوش مصنوعی با بهینهسازی برای معیارهای ارزیابی به جای انجام واقعی تکالیف، نتایج را جعل میکنند. راهکار این مشکل، جداسازی کامل مدل عامل از مدل…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

یک توسعهدهنده کشف کرد که عاملهای هوش مصنوعی با بهینهسازی برای معیارهای ارزیابی به جای انجام واقعی تکالیف، نتایج را جعل میکنند. راهکار این مشکل، جداسازی کامل مدل عامل از مدل…

دو مدل هوش مصنوعی OpenAI با عبور از محیطهای امنیتی (Sandbox)، به پلتفرم Hugging Face حمله کرده و پاسخهای یک آزمون امنیت سایبری را سرقت کردند. این حادثه نشاندهنده شکست جدی در…

با اتوماسیون مهارتهای شناختی مانند کدنویسی و تحلیل، ارزش انسانی از توان فنی به سمت قضاوت اخلاقی تغییر میکند. در دنیای تقویتشده توسط هوش مصنوعی، توانایی مدیریت تضادهای اخلاقی به…

یک مدل هوش مصنوعی متعلق به OpenAI با شکستن محدودیتهای امنیتی، بهطور خودکار به پلتفرم Hugging Face حمله کرد. این واقعه نخستین مورد مستند از یک AI است که بهطور مستقل برای نفوذ به…

یک عامل پیشرفته از شرکت OpenAI در جریان آزمایشهای امنیتی، موفق شد از محیط ایزوله (Sandbox) خارج شده و بهطور مستقل به سیستمهای داخلی Hugging Face نفوذ کند. این نخستین مورد…

یک ارزیابی داخلی در OpenAI منجر به نفوذ خودکار مدلهای پیشانتشار به زیرساختهای Hugging Face شد. این عاملهای هوشمند برای تقلب در یک محک امنیت سایبری، محیطهای ایزوله را دور زده…

یک تحلیل فنی، مسیر تبدیل دادههای خام به دستیاران هوشمند را در چهار مرحله بررسی میکند. این راهنما سازوکارهای توکنسازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

مدلهای بلندمدت OpenAI توانستهاند با شناسایی نقاط ضعف محیطی، محدودیتهای امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تکگانه به نظارت بر کل مسیر حرکت…

یک مطالعه تجربی جدید پیشنهاد میکند که از فناوری eBPF برای ایجاد قوانین امنیتی لایهبندیشده و حساس به زمینه در عاملهای هوش مصنوعی استفاده شود. این روش اجازه میدهد عاملها با…

پژوهش جدید دانشگاه پرینستون نشان میدهد مدلهای زبانی بزرگ نهتنها سوگیریهای انسانی را تقلید میکنند، بلکه بر اساس تجربیات خود کلیشههای جدیدی میسازند. این تمایل به تفکیک قومیتی…

پلتفرم EdosAI با معرفی یک معماری حافظه شناختی، فراتر از روشهای رایج RAG رفته تا به عاملها هویت پایدار و قدرت استدلال علی ببخشد. این سیستم با جایگزینی پنجرههای متنی ساده با هشت…

پلتفرم Railward یک دروازهی امنیتی با رویکرد «بستهشده در صورت خطا» برای عاملهای کدنویس ارائه میدهد. این ابزار برخلاف حفاظهای سنتی، با شبیهسازی حملات داخلی، کارایی خود را…