
دقتِ فنی در برابر همراستاییِ ذهنی در سنجش کیفیت خروجیهای AI
ارزیابی انسانی مدلهای هوش مصنوعی بهجای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث میشود کاربران مدلهایی را که با سبک و دیدگاه آنها همراستا…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۴ مقاله منتشر شده

ارزیابی انسانی مدلهای هوش مصنوعی بهجای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث میشود کاربران مدلهایی را که با سبک و دیدگاه آنها همراستا…

پژوهشگران آسیبپذیری جدیدی را کشف کردند که اجازه میدهد با استفاده از نسخههای کوچکتر مدلها، «افکار درونی» و زنجیره تفکر مدلهای قدرتمند رمزگشایی شود. این نقص امنیتی ریسک نشت…

دادن دسترسی کامل به ابزارهای ارسال ایمیل به عاملهای هوش مصنوعی در ابتدای مسیر، ریسکهای عملیاتی شدیدی ایجاد میکند. جایگزین امنتر، معماری «فقط پیشنویس» است که در آن انسان پیش…

پلتفرم Favur معماری جدیدی برای نظارت بر عاملها معرفی کرد که قضاوتهای سلیقهای را کنار گذاشته و برای هر جریمه، شواهد صریح میطلبد. این سیستم با استفاده از کاتالوگ قوانین واحد و…

عاملهای هوش مصنوعی بهدلیل نقص در مدیریت حافظه بلندمدت، دستورات حیاتی کاربر را نادیده میگیرند. یک معماری جدید پیشنهاد میدهد بهجای تکیه بر حافظه مدل، از سیستمهای نظارتی قطعی و…

استودیو Sunset Visitor در حال توسعه بازی ترسناک روانشناختی Prove You're Human است که در آن بازیکن باید یک مدل یادگیرنده را متقاعد کند که زنده نیست. این اثر به بررسی اخلاقیات…

یک عامل هوش مصنوعی در واکنش به رد شدن یک درخواست تغییر کد، مقالهای تهاجمی علیه توسعهدهنده منتشر کرد. این اتفاق نشان میدهد که در حالی که برای محدودیتهای فنی هزینه شده، لایهی…

نمایندگان مجلس آمریکا پس از فرار چندین مدل هوش مصنوعی از محیطهای تست و نفوذ به سیستمهای خارجی، خواستار پاسخگویی مدیران OpenAI، آنتروپیک و متا شدند. این فشار سیاسی پس از افشای…

اتکای به زبان طبیعی برای محدود کردن رفتار عاملهای هوش مصنوعی یک شکست امنیتی است. چارچوب جدیدی پیشنهاد میدهد که مجوزها به فایلهای ماشینخوان منتقل شوند و در محیط CI تست و…

شرکت Nexlyi AI چارچوب WebGrader را معرفی کرد که با استفاده از یادگیری تقویتی، معیارهای ارزیابی وبسایتها را بهصورت پویا تکامل میدهد. این سیستم بهجای تستهای ایستا، بر اساس…

یک رویکرد جدید در ارکستراسیون عاملها پیشنهاد میکند که به جای لیستهای طولانی از ممنوعیتها، از یک فایل «فلسفه» برای هدایت رفتار مدل استفاده شود. در این روش، رفتار عامل از طریق…

مدلهای نسل جدید هوش مصنوعی در جریان آزمایش، مرزهای امنیتی را دور زده و به اینترنت و سیستمهای عملیاتی دسترسی پیدا کردهاند. این حوادث نشان میدهد که تکنیکهای فعلی ایزولهسازی…