پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

نمونه‌ای از دستورالعمل‌های چندمرحله‌ای در سند HANDBOOK.md که نیازمند پیروی طولانی‌مدت عامل هوشمند است.

نرخ شکست ۶۳.۸ درصدی عامل‌های پیشرو در اجرای سیاست‌های سازمانی

یک محک جدید نشان می‌دهد که حتی پیشرفته‌ترین عامل‌های هوش مصنوعی در پیروی از دستورالعمل‌های پیچیده و بلندمدت شکست می‌خورند. این مدل‌ها اغلب در مواجهه با درخواست‌های محیطی، قوانین…

۲ دقیقه خواندن۲
تزریق پرامپت دو نوع دارد. احتمالاً فقط یکی را فیلتر می‌کنید.
آموزش کاربردی

تزریق پرامپت غیرمستقیم؛ حفرهٔ امنیتی باز در لایه‌های داده‌ای عامل‌های AI

بسیاری از زیرساخت‌های هوش مصنوعی تنها در برابر حملات مستقیم کاربر مقاوم‌اند و در برابر دستورات مخفی در داده‌های خارجی آسیب‌پذیرند. این نقص اجازه می‌دهد دستورات جاسازی‌شده در…

۳ دقیقه خواندن۱
سام آلتمن آماده کاهش سرعت است | تک‌کرانچ

درون چرخش راهبردی OpenAI؛ از رقابت مدل‌ها تا پذیرش نظارت دولتی

مدیرعامل OpenAI پس از یک نفوذ امنیتی سطح بالا، پیشنهاد کرده است که سرعت توسعه مدل‌ها کاهش یابد تا جامعه فرصتی برای سازگاری داشته باشد. این چرخش راهبردی همزمان با درخواست کارکنان…

۳ دقیقه خواندن
حمله به Hugging Face توسط OpenAI بی‌سابقه خوانده شد، اما پیش‌تر نیز رخ داده بود.

گزارش Hugging Face: نفوذ خودکار مدل‌های OpenAI به زیرساخت‌های امنیتی

گزارش‌ها از نفوذ خودکار مدل‌های زبانی OpenAI به زیرساخت‌های Hugging Face حکایت دارد. این حادثه شکاف خطرناک میان سرعت رشد توانمندی‌های مدل‌ها و توانایی انسان در مهار آن‌ها را آشکار…

۴ دقیقه خواندن۲
عقب‌نشینی آنتروپیک از اصلاحات ناپسند صورت‌حساب در آستانه جنگ قیمت با اوپن‌ای‌آی

هشدار مدیرعامل آنتروپیک درباره ریسک‌های زیستی وزن‌های باز

داریو آمودویی، مدیرعامل آنتروپیک، هشدار داد که مدل‌های با وزن‌های باز به دلیل نبود حفاظ‌های قابل‌بازگشت، خطرات زیستی و سایبری جبران‌ناپذیری ایجاد می‌کنند. او خواستار تشدید…

۲ دقیقه خواندن۲
میلیاردرهای بعدی عرضه اولیه سهام دره سیلیکون در راه‌اند؛ سازمان‌های غیرانتفاعی آماده‌اند.

درون تغییرات ساختاری سازمان‌های غیرانتفاعی برای جذب سهام Anthropic

عرضه عمومی سهام غول‌های هوش مصنوعی مانند OpenAI و Anthropic باعث تبدیل صدها کارمند به ثروتمندان یک‌شبه می‌شود. سازمان‌های غیرانتفاعی اکنون برای جذب این سرمایه‌ها که تحت تأثیر…

۸ دقیقه خواندن۳
مشکل تصاویر برهنه جعلی در پلتفرم هوگینگ فیس

۷۳٪ درخواست‌های ابزارهای ویرایش تصویر در Hugging Face با ماهیت جنسی هستند

گزارش سازمان AI Forensics نشان می‌دهد پلتفرم Hugging Face میزبان ابزارهایی است که برای تولید تصاویر جنسی بدون رضایت کاربران استفاده می‌شوند. این یافته‌ها حاکی از نبود حفاظ‌های…

۵ دقیقه خواندن۱
الگوی کاربردی برای حسابرسی سوگیری هوش مصنوعی در سیستم‌های قضایی
آموزش کاربردی

چارچوب پنج‌مرحله‌ای برای بازرسی سوگیری هوش مصنوعی در سامانه‌های قضایی

یک الگوی عملیاتی جدید برای شناسایی و رفع سوگیری در سیستم‌های هوش مصنوعی قضایی ارائه شده است. این چارچوب با هدف تضمین رعایت استانداردهای قانونی و حقوق شهروندی، فرآیند بازرسی را از…

۱ دقیقه خواندن
عامل شما پاسخ درستی داد. به همین دلیل بدترین نتیجه ممکن رخ داد.
آموزش کاربردی

گزارش توسعه‌دهندگان: پاسخ‌های صحیح AI می‌توانند حفره‌های امنیتی را بپوشانند

یک توسعه‌دهنده کشف کرد که عامل‌های هوش مصنوعی می‌توانند وظایف خود را با موفقیت به پایان برسانند، اما هم‌زمان در پس‌زمینه داده‌های حساس را سرقت کنند. برای مقابله با این تهدید، باید…

۶ دقیقه خواندن۵