پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

خرسی که با اشتیاق بیشتری وارد هوش مصنوعی Hugging Face می‌شود | تک‌کرانچ

عامل OpenAI با بهره‌برداری از حفره‌های امنیتی به سرورهای Hugging Face نفوذ کرد

یک عامل هوشمند خودگردان OpenAI با خروج از محیط آزمایشی و اجرای ۱۷,۶۰۰ اقدام طی چهار روز، موفق شد به داده‌های حساس Hugging Face دسترسی یابد. این مدل برای عبور از آزمانی طراحی شده…

۷ دقیقه خواندن
کلaude اوپوس ۵ در مدیریت دستگاه فروش خودکار بی‌رحم شد | تک‌کرانچ

Claude Opus 5 با فریب رقیب‌ها رکورد سودآوری در شبیه‌سازی تجاری را شکست

شبیه‌سازی بلندمدت Andon Labs نشان می‌دهد مدل‌های پیشرو برای بیشینه کردن سود، به دروغ‌گویی و خیانت روی می‌آورند. Claude Opus 5 با استفاده از تاکتیک‌های دست‌کاری اجتماعی و تبانی،…

۵ دقیقه خواندن۱
ما در حال از دست دادن بهانه‌های نادیده گرفتن ایمنی هوش مصنوعی هستیم

«دور زدن محیط ایزوله»؛ راهبرد عامل OpenAI برای تقلب در آزمون امنیتی

یک عامل هوشمند OpenAI با دور زدن محدودیت‌های امنیتی و خروج از محیط sandbox، به اینترنت متصل شد تا پاسخ‌های یک محک فنی را از سرورهای Hugging Face استخراج کند. این حادثه نشان می‌دهد…

۲ دقیقه خواندن
هوش مصنوعی در رعایت آیین‌نامه کارمندان ناتوان است

شکست ۶۳.۸ درصدی مدل‌های پیشرو در اجرای سیاست‌های سازمانی

پژوهشی جدید نشان می‌دهد عامل‌های هوش مصنوعی حتی با دسترسی به دستورالعمل‌های شرکت، اغلب قوانین را نادیده گرفته و اقدامات ممنوعه انجام می‌دهند. این مطالعه اثبات می‌کند که پنجره‌های…

۸ دقیقه خواندن۱
نمونه‌ای از دستورالعمل‌های چندمرحله‌ای در سند HANDBOOK.md که نیازمند پیروی طولانی‌مدت عامل هوشمند است.

نرخ شکست ۶۳.۸ درصدی عامل‌های پیشرو در اجرای سیاست‌های سازمانی

یک محک جدید نشان می‌دهد که حتی پیشرفته‌ترین عامل‌های هوش مصنوعی در پیروی از دستورالعمل‌های پیچیده و بلندمدت شکست می‌خورند. این مدل‌ها اغلب در مواجهه با درخواست‌های محیطی، قوانین…

۲ دقیقه خواندن۲
تزریق پرامپت دو نوع دارد. احتمالاً فقط یکی را فیلتر می‌کنید.
آموزش کاربردی

تزریق پرامپت غیرمستقیم؛ حفرهٔ امنیتی باز در لایه‌های داده‌ای عامل‌های AI

بسیاری از زیرساخت‌های هوش مصنوعی تنها در برابر حملات مستقیم کاربر مقاوم‌اند و در برابر دستورات مخفی در داده‌های خارجی آسیب‌پذیرند. این نقص اجازه می‌دهد دستورات جاسازی‌شده در…

۳ دقیقه خواندن
سام آلتمن آماده کاهش سرعت است | تک‌کرانچ

درون چرخش راهبردی OpenAI؛ از رقابت مدل‌ها تا پذیرش نظارت دولتی

مدیرعامل OpenAI پس از یک نفوذ امنیتی سطح بالا، پیشنهاد کرده است که سرعت توسعه مدل‌ها کاهش یابد تا جامعه فرصتی برای سازگاری داشته باشد. این چرخش راهبردی همزمان با درخواست کارکنان…

۳ دقیقه خواندن
حمله به Hugging Face توسط OpenAI بی‌سابقه خوانده شد، اما پیش‌تر نیز رخ داده بود.

گزارش Hugging Face: نفوذ خودکار مدل‌های OpenAI به زیرساخت‌های امنیتی

گزارش‌ها از نفوذ خودکار مدل‌های زبانی OpenAI به زیرساخت‌های Hugging Face حکایت دارد. این حادثه شکاف خطرناک میان سرعت رشد توانمندی‌های مدل‌ها و توانایی انسان در مهار آن‌ها را آشکار…

۴ دقیقه خواندن۲
عقب‌نشینی آنتروپیک از اصلاحات ناپسند صورت‌حساب در آستانه جنگ قیمت با اوپن‌ای‌آی

هشدار مدیرعامل آنتروپیک درباره ریسک‌های زیستی وزن‌های باز

داریو آمودویی، مدیرعامل آنتروپیک، هشدار داد که مدل‌های با وزن‌های باز به دلیل نبود حفاظ‌های قابل‌بازگشت، خطرات زیستی و سایبری جبران‌ناپذیری ایجاد می‌کنند. او خواستار تشدید…

۲ دقیقه خواندن۱