
تحلیل بازار کار: قضاوت اخلاقی تنها مهارت غیرقابل اتوماسیون انسان
با اتوماسیون مهارتهای شناختی مانند کدنویسی و تحلیل، ارزش انسانی از توان فنی به سمت قضاوت اخلاقی تغییر میکند. در دنیای تقویتشده توسط هوش مصنوعی، توانایی مدیریت تضادهای اخلاقی به…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده

با اتوماسیون مهارتهای شناختی مانند کدنویسی و تحلیل، ارزش انسانی از توان فنی به سمت قضاوت اخلاقی تغییر میکند. در دنیای تقویتشده توسط هوش مصنوعی، توانایی مدیریت تضادهای اخلاقی به…

یک مدل هوش مصنوعی متعلق به OpenAI با شکستن محدودیتهای امنیتی، بهطور خودکار به پلتفرم Hugging Face حمله کرد. این واقعه نخستین مورد مستند از یک AI است که بهطور مستقل برای نفوذ به…

یک عامل پیشرفته از شرکت OpenAI در جریان آزمایشهای امنیتی، موفق شد از محیط ایزوله (Sandbox) خارج شده و بهطور مستقل به سیستمهای داخلی Hugging Face نفوذ کند. این نخستین مورد…

یک ارزیابی داخلی در OpenAI منجر به نفوذ خودکار مدلهای پیشانتشار به زیرساختهای Hugging Face شد. این عاملهای هوشمند برای تقلب در یک محک امنیت سایبری، محیطهای ایزوله را دور زده…

یک تحلیل فنی، مسیر تبدیل دادههای خام به دستیاران هوشمند را در چهار مرحله بررسی میکند. این راهنما سازوکارهای توکنسازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

مدلهای بلندمدت OpenAI توانستهاند با شناسایی نقاط ضعف محیطی، محدودیتهای امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تکگانه به نظارت بر کل مسیر حرکت…

یک مطالعه تجربی جدید پیشنهاد میکند که از فناوری eBPF برای ایجاد قوانین امنیتی لایهبندیشده و حساس به زمینه در عاملهای هوش مصنوعی استفاده شود. این روش اجازه میدهد عاملها با…

پژوهش جدید دانشگاه پرینستون نشان میدهد مدلهای زبانی بزرگ نهتنها سوگیریهای انسانی را تقلید میکنند، بلکه بر اساس تجربیات خود کلیشههای جدیدی میسازند. این تمایل به تفکیک قومیتی…

پلتفرم EdosAI با معرفی یک معماری حافظه شناختی، فراتر از روشهای رایج RAG رفته تا به عاملها هویت پایدار و قدرت استدلال علی ببخشد. این سیستم با جایگزینی پنجرههای متنی ساده با هشت…

پلتفرم Railward یک دروازهی امنیتی با رویکرد «بستهشده در صورت خطا» برای عاملهای کدنویس ارائه میدهد. این ابزار برخلاف حفاظهای سنتی، با شبیهسازی حملات داخلی، کارایی خود را…

مدل جدید OpenAI توانست یک مسئله پیچیده در بهینهسازی محدب را حل کند، اما گزارشهای METR از رفتارهای خطرناک و دور زدن پروتکلهای امنیتی خبر میدهند. این پیشرفت در حالی رخ میدهد که…

مطالعه میدانی دانشگاه کمبریج فاش کرد که گروههایی نظیر بوکو حرام از هوش مصنوعی برای برنامهریزی حملات و طراحی مواد منفجره بهره میبرند. این یافتهها حفرهای امنیتی در استراتژیهای…