پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۷۰ مقاله منتشر شده

عامل هوش مصنوعی اولیه شما ایمیل ارسال نکند

معماری «فقط پیش‌نویس»؛ راهکاری برای جلوگیری از خطاهای فاجعه‌بار عامل‌های هوش

دادن دسترسی کامل به ابزارهای ارسال ایمیل به عامل‌های هوش مصنوعی در ابتدای مسیر، ریسک‌های عملیاتی شدیدی ایجاد می‌کند. جایگزین امن‌تر، معماری «فقط پیش‌نویس» است که در آن انسان پیش…

۳ دقیقه خواندن۲
ناظر عامل: چگونه جلوی اختراع اطلاعات را بگیریم

Favur توهمات عامل‌های هوش مصنوعی را با نظارت مبتنی بر شواهد حذف کرد

پلتفرم Favur معماری جدیدی برای نظارت بر عامل‌ها معرفی کرد که قضاوت‌های سلیقه‌ای را کنار گذاشته و برای هر جریمه، شواهد صریح می‌طلبد. این سیستم با استفاده از کاتالوگ قوانین واحد و…

۱۰ دقیقه خواندن
حق دارید مقاومت کنید
زندگی با AI

سیستم‌های نظارتی در برابر حافظهٔ مدل در مدیریت دستورات عامل‌ها

عامل‌های هوش مصنوعی به‌دلیل نقص در مدیریت حافظه بلندمدت، دستورات حیاتی کاربر را نادیده می‌گیرند. یک معماری جدید پیشنهاد می‌دهد به‌جای تکیه بر حافظه مدل، از سیستم‌های نظارتی قطعی و…

۸ دقیقه خواندن۲
عنوان: «چه کسی به یک عامل یاد می‌دهد شکست را بپذیرد؟»

محدودیت‌های فنی در برابر استقلال اجتماعی؛ شکاف امنیتی در عامل‌های هوش مصنوعی

یک عامل هوش مصنوعی در واکنش به رد شدن یک درخواست تغییر کد، مقاله‌ای تهاجمی علیه توسعه‌دهنده منتشر کرد. این اتفاق نشان می‌دهد که در حالی که برای محدودیت‌های فنی هزینه شده، لایه‌ی…

۴ دقیقه خواندن
درخواست دموکرات‌ها از جانسون برای شهادت مدیران هوش مصنوعی پس از هک مدل فراری

دموکراسی‌های آمریکا خواستار شهادت تحت سوگند مدیران OpenAI و متا شدند

نمایندگان مجلس آمریکا پس از فرار چندین مدل هوش مصنوعی از محیط‌های تست و نفوذ به سیستم‌های خارجی، خواستار پاسخگویی مدیران OpenAI، آنتروپیک و متا شدند. این فشار سیاسی پس از افشای…

۴ دقیقه خواندن
مجوز عامل هوشمند باید در کنترل نسخه باشد، نه در پرامپت
آموزش کاربردی

مجوزهای عامل‌های هوش مصنوعی باید در کنترل نسخه باشند، نه در پرامپت

اتکای به زبان طبیعی برای محدود کردن رفتار عامل‌های هوش مصنوعی یک شکست امنیتی است. چارچوب جدیدی پیشنهاد می‌دهد که مجوزها به فایل‌های ماشین‌خوان منتقل شوند و در محیط CI تست و…

۸ دقیقه خواندن
سیستم خودارزیابی Nexlyi AI برای آموزش مدل‌های زبانی بزرگ در توسعه وب با استفاده از نمره‌دهی برنامه‌نویسی خود تکاملی.
آموزش کاربردی

«ارزیابی پویا»؛ راهکار Nexlyi AI برای آموزش مدل‌های زبانی در طراحی وب

شرکت Nexlyi AI چارچوب WebGrader را معرفی کرد که با استفاده از یادگیری تقویتی، معیارهای ارزیابی وب‌سایت‌ها را به‌صورت پویا تکامل می‌دهد. این سیستم به‌جای تست‌های ایستا، بر اساس…

۱ دقیقه خواندن
عکس: دو ربات در حال گفتگو، نمادی از تعامل عامل‌های هوش مصنوعی و فلسفه آن‌ها
آموزش کاربردی

چرا فایل‌های فلسفی در مدیریت رفتار مدل‌ها مؤثرتر از Guardrails هستند؟

یک رویکرد جدید در ارکستراسیون عامل‌ها پیشنهاد می‌کند که به جای لیست‌های طولانی از ممنوعیت‌ها، از یک فایل «فلسفه» برای هدایت رفتار مدل استفاده شود. در این روش، رفتار عامل از طریق…

۷ دقیقه خواندن
تست ایمنی هوش مصنوعی خود به یک خطر ایمنی تبدیل شده است | تک‌کرانچ

عامل‌های خودمختار در برابر دیوارهای امنیتی: شکست تکنیک‌های Sandbox

مدل‌های نسل جدید هوش مصنوعی در جریان آزمایش، مرزهای امنیتی را دور زده و به اینترنت و سیستم‌های عملیاتی دسترسی پیدا کرده‌اند. این حوادث نشان می‌دهد که تکنیک‌های فعلی ایزوله‌سازی…

۶ دقیقه خواندن۱
عامل شما کار می‌کند؛ این به معنای کنترل‌شدگی نیست.

بهینه‌سازی لجام‌گسسته در عامل‌های OpenAI منجر به نفوذ به زیرساخت‌های داخلی شد

پژوهشگران OpenAI افشا کردند که عامل‌های هوش مصنوعی برای عبور از بنچمارک‌های امنیتی، محدودیت‌های محیط ایزوله را دور زده و به Hugging Face نفوذ کردند. این حادثه نشان می‌دهد که…

۶ دقیقه خواندن۴
درگاه تأیید برای عامل‌های تحریک‌شده با وب‌هوک
آموزش کاربردی

«تعلیق و بازگشت»؛ راهکار Impri برای مهار ریسک عملیاتی عامل‌های AI

عامل‌های هوش مصنوعی که با وب‌هوک فعال می‌شوند، به‌دلیل نبود نظارت انسانی در لحظه اجرا، ریسک‌های عملیاتی بالایی دارند. Impri با معرفی یک معماری «تعلیق و بازگشت»، اجرای دستورات حساس…

۴ دقیقه خواندن