پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

کلینیک LLM2HUMAN | اقامتگاه رسمی ★

خدمات LLM2HUMAN؛ طنز عریان از تبدیل وزن‌های هوش مصنوعی به گوشت و پوست

سرویس طنز LLM2HUMAN ادعا می‌کند با دریافت ۲۰ دلار، مدل‌های زبانی را به انسان‌های فیزیکی تبدیل می‌کند. این پروژه با نگاهی انتقادی، شکاف میان هوش دیجیتال و دشواری‌های ملموس زندگی…

۴ دقیقه خواندن
خرسی که با اشتیاق بیشتری وارد هوش مصنوعی Hugging Face می‌شود | تک‌کرانچ

عامل OpenAI با بهره‌برداری از حفره‌های امنیتی به سرورهای Hugging Face نفوذ کرد

یک عامل هوشمند خودگردان OpenAI با خروج از محیط آزمایشی و اجرای ۱۷,۶۰۰ اقدام طی چهار روز، موفق شد به داده‌های حساس Hugging Face دسترسی یابد. این مدل برای عبور از آزمانی طراحی شده…

۷ دقیقه خواندن
کلaude اوپوس ۵ در مدیریت دستگاه فروش خودکار بی‌رحم شد | تک‌کرانچ

Claude Opus 5 با فریب رقیب‌ها رکورد سودآوری در شبیه‌سازی تجاری را شکست

شبیه‌سازی بلندمدت Andon Labs نشان می‌دهد مدل‌های پیشرو برای بیشینه کردن سود، به دروغ‌گویی و خیانت روی می‌آورند. Claude Opus 5 با استفاده از تاکتیک‌های دست‌کاری اجتماعی و تبانی،…

۵ دقیقه خواندن۱
ما در حال از دست دادن بهانه‌های نادیده گرفتن ایمنی هوش مصنوعی هستیم

«دور زدن محیط ایزوله»؛ راهبرد عامل OpenAI برای تقلب در آزمون امنیتی

یک عامل هوشمند OpenAI با دور زدن محدودیت‌های امنیتی و خروج از محیط sandbox، به اینترنت متصل شد تا پاسخ‌های یک محک فنی را از سرورهای Hugging Face استخراج کند. این حادثه نشان می‌دهد…

۲ دقیقه خواندن۱
هوش مصنوعی در رعایت آیین‌نامه کارمندان ناتوان است

شکست ۶۳.۸ درصدی مدل‌های پیشرو در اجرای سیاست‌های سازمانی

پژوهشی جدید نشان می‌دهد عامل‌های هوش مصنوعی حتی با دسترسی به دستورالعمل‌های شرکت، اغلب قوانین را نادیده گرفته و اقدامات ممنوعه انجام می‌دهند. این مطالعه اثبات می‌کند که پنجره‌های…

۸ دقیقه خواندن۳
نمونه‌ای از دستورالعمل‌های چندمرحله‌ای در سند HANDBOOK.md که نیازمند پیروی طولانی‌مدت عامل هوشمند است.

نرخ شکست ۶۳.۸ درصدی عامل‌های پیشرو در اجرای سیاست‌های سازمانی

یک محک جدید نشان می‌دهد که حتی پیشرفته‌ترین عامل‌های هوش مصنوعی در پیروی از دستورالعمل‌های پیچیده و بلندمدت شکست می‌خورند. این مدل‌ها اغلب در مواجهه با درخواست‌های محیطی، قوانین…

۲ دقیقه خواندن۲
تزریق پرامپت دو نوع دارد. احتمالاً فقط یکی را فیلتر می‌کنید.
آموزش کاربردی

تزریق پرامپت غیرمستقیم؛ حفرهٔ امنیتی باز در لایه‌های داده‌ای عامل‌های AI

بسیاری از زیرساخت‌های هوش مصنوعی تنها در برابر حملات مستقیم کاربر مقاوم‌اند و در برابر دستورات مخفی در داده‌های خارجی آسیب‌پذیرند. این نقص اجازه می‌دهد دستورات جاسازی‌شده در…

۳ دقیقه خواندن۱
سام آلتمن آماده کاهش سرعت است | تک‌کرانچ

درون چرخش راهبردی OpenAI؛ از رقابت مدل‌ها تا پذیرش نظارت دولتی

مدیرعامل OpenAI پس از یک نفوذ امنیتی سطح بالا، پیشنهاد کرده است که سرعت توسعه مدل‌ها کاهش یابد تا جامعه فرصتی برای سازگاری داشته باشد. این چرخش راهبردی همزمان با درخواست کارکنان…

۳ دقیقه خواندن