
تلهی ایمنی؛ راز شکست مدلهای پاداش در درک اخلاقیات
مدلهای پاداش که برای همراستاسازی LLMها استفاده میشوند، در تشخیص رفتارهای غیراخلاقی ناتواناند. پژوهشی جدید نشان میدهد تلاش برای حذف سوگیری، منجر به کاهش شدید حساسیت مدل به…
دستهبندی
بهروزرسانیهای کوتاه و سریع: عرضهها، شراکتها، سرمایهگذاری، قوانین و اخبار سختافزار. نبض پنجدقیقهای صبح.
۴٬۵۴۸ مقاله منتشر شده

مدلهای پاداش که برای همراستاسازی LLMها استفاده میشوند، در تشخیص رفتارهای غیراخلاقی ناتواناند. پژوهشی جدید نشان میدهد تلاش برای حذف سوگیری، منجر به کاهش شدید حساسیت مدل به…

پژوهشگران پلتفرم DTap را برای شناسایی نقاط ضعف امنیتی عاملهای هوش مصنوعی معرفی کردند. این سیستم با شبیهسازی بیش از ۵۰ محیط واقعی، از نشت دادهها و تراکنشهای غیرمجاز جلوگیری…

پژوهشگران با معرفی Dream-MPC، برتری بهینهسازی مبتنی بر گرادینت را در ۲۴ تکلیف کنترل مداوم ثابت کردند. این مدل با ترکیب مدل جهان و منظمسازی عدم قطعیت، کارایی روشهای سنتی را به…

تحلیلی جدید از قراردادهای ابزارهای کدنویسی هوش مصنوعی نشان میدهد که شرکتهای سازنده، تمام مسئولیتهای امنیتی و حقوقی را به دوش توسعهدهندگان میاندازند. این وضعیت در حالی رخ…

یک مقاله پژوهشی جدید معماری DePAI را معرفی کرده است که با استفاده از بلاکچین و DAO، هماهنگی میان انسان و ماشینهای خودمختار را مدیریت میکند. هدف این سیستم، جلوگیری از انحصار…

سیستم تشخیص جدیدی به نام CCL-D زمان شناسایی خطاهای ارتباطی در خوشههای عظیم GPU را از چندین روز به تنها ۶ دقیقه کاهش داده است. این ابزار با ترکیب حسگرهای بلادرنگ و تحلیلگرهای…

پژوهشگران با ترکیب یادگیری تقویتشده عمیق و مدلهای زبانی بزرگ، سیستمی برای مدیریت بهینه پهپادها در شهرهای متراکم طراحی کردهاند. این معماری با رفع ناهماهنگیهای منابع، نرخ موفقیت…

پژوهشگران چارچوب جدیدی به نام EaC را معرفی کردند که به عاملهای هوش مصنوعی اجازه میدهد تجهیزات فیزیکی آزمایشگاه را کنترل کنند. این سیستم با تبدیل استدلالهای دیجیتال به دستورات…

رباتهای خانگی در حال خروج از شبیهسازها و ورود به محیطهای واقعی هستند، اما سیستمهای امنیتی فعلی ناکارآمدند. چارچوب جدیدی به نام SPINE پیشنهاد میکند که حریم خصوصی به جای یک…

پژوهشگران کشف کردند که حتی تنظیم دقیق با دادههای بیخطر میتواند همراستاسازی امنیتی مدلهای زبانی بزرگ را نابود کند. برای مقابله با این بحران، متدولوژی جدیدی به نام SQSD معرفی…

یک مطالعهی جدید فاش میکند که بنچمارکهای استاندارد مدلها نمیتوانند رفتار هوش مصنوعی در محیط عملیاتی را پیشبینی کنند. محققان دریافتند که لایههای امنیتی برای هر مدل…

اپل در حال حذف ابزارهای کدنویسی AI است که قوانین «خودکفا بودن» را نقض میکنند، در حالی که به OpenAI اجازه میدهد اپلیکیشنهای عاملمحور را توزیع کند. این تقابل، آغاز گذار از…