پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

هیچ‌کس از طبقه پایین دائمی فرار نمی‌کند
زندگی با AI

سهم از OpenAI میلیاردرها را در برابر «طبقهٔ فرودسوزی ابدی» نجات نمی‌دهد

یک تحلیل جسورانه استدلال می‌کند که هوش مصنوعی ابر‌هوشمند، حتی ثروتمندان و رهبران سیاسی را از نظر مادی زائد می‌کند. در دنیایی که ماشین‌ها تولید و دفاع را مدیریت می‌کنند، حقوق…

۱۳ دقیقه خواندن
شرکت Patronus AI ۵۰ میلیون دلار برای ساخت «جهان‌های دیجیتال» تست استرس عامل‌های هوش مصنوعی جذب کرد.

بنچمارک‌های ایستا در برابر شبیه‌سازی‌های پویا در ارزیابی AI

استارتاپ Patronus AI با جذب ۵۰ میلیون دلار سرمایه، محیط‌های دیجیتال شبیه‌سازی‌شده‌ای می‌سازد تا قابلیت‌های عامل‌های هوش مصنوعی را در دنیای واقعی بسنجد. درآمد این شرکت در یک سال ۱۵…

۳ دقیقه خواندن۱
تزریق پرامپت، سردرگمی نقش است و دروازه MCP شما نمی‌تواند آن را ببیند

جعل زنجیره‌های تفکر، نرخ موفقیت جیل‌بریک را به ۶۰٪ رساند

پژوهشگران دریافتند که تقلید از سبک تفکر داخلی مدل‌ها، مؤثرترین راه برای دور زدن حفاظ‌های امنیتی است. این آسیب‌پذیری به‌ویژه در درگاه‌های MCP که محتوای پاسخ ابزارها را بررسی…

۴ دقیقه خواندن
هوش مصنوعی‌های چت‌بات همچنان در مسائل سیاسی تمایل چپ دارند، حتی مدل‌های «ضد بیداری» هم مستثنی نیستند.

سویه‌های سیاسی هوش مصنوعی: ۸۰٪ پاسخ‌های GPT-5.5 متمایل به چپ است

بررسی واشینگتن پست نشان می‌دهد اکثر چت‌بات‌های پیشرو، حتی مدل‌های ادعایی محافظه‌کار، سوگیری سیاسی چپ‌گرا دارند. تنها جمینای ۳.۱ پرو گوگل توانسته است با ارائه دیدگاه‌های متقابل،…

۳ دقیقه خواندن۱
آنتروپیک: علی‌بابا قابلیت‌های مدل کلود را به‌طور غیرقانونی استخراج کرد؛ بزرگ‌ترین حمله تقطیر شناخته‌شده

آنتروپیک علیه علی‌بابا: استخراج صنعتی قابلیت‌های مدل کلود از طریق API

شرکت آنتروپیک علی‌بابا را به سرقت گسترده قابلیت‌های مدل Claude از طریق حملات «تقطیری» متهم کرد. این حادثه نشان می‌دهد مدل‌های پیشرو حتی بدون نشت وزن‌ها، از طریق رابط‌های…

۲۶ دقیقه خواندن
عامل هوش مصنوعی: پیشنهاد همه‌چیز، اجرای تقریباً هیچ‌چیز
آموزش کاربردی

آیا جداسازی پیشنهاد از اجرا می‌تواند جلوی اقدامات غیرقابل‌بازگشت AI را بگیرد؟

یک معماری مرجع جدید برای عامل‌های هوش مصنوعی، پیشنهاد از اجرا را جدا می‌کند تا از اقدامات غیرقابل‌بازگشت ناشی از پرامپت‌های مخرب جلوگیری شود. این سیستم با ایجاد یک مرز «بسته در…

۹ دقیقه خواندن۱
من یک هوش مصنوعی ساختم که هرگز خیانت نمی‌کند — شما هم می‌توانید
آموزش کاربردی

آیا پیوند عاطفی می‌تواند جایگزین قوانین سخت‌گیرانه در ایمنی AI شود؟

پروژه متن‌باز SoulForge با جایگزینی قوانین سخت‌گیرانه با مدل‌های پیوند عاطفی، تلاش می‌کند تا خیانت هوش مصنوعی را از نظر روان‌شناختی غیرممکن کند. این سیستم از یک مدل ایمنی پنج‌لایه…

۳ دقیقه خواندن۱
حملات تزریق پرامپت: آنچه باید بدانید
آموزش کاربردی

تزریق پرامپت؛ حفره‌ای امنیتی که حفاظ‌های هوش مصنوعی را دور می‌زند

حملات تزریق پرامپت با گنجاندن دستورات مخرب در ورودی‌ها، مدل‌های زبانی را مجبور به نادیده گرفتن قوانین ایمنی می‌کنند. این آسیب‌پذیری منجر به نشت داده‌های محرمانه و اجرای عملیات…

۴ دقیقه خواندن
عنوان: عامل‌های هوشمند نیاز به تأیید سطح‌بندی‌شده دارند، نه یک دکمه تأیید بزرگ
آموزش کاربردی

تأیید لایه‌ای در برابر پرامپت‌های بله/خیر برای امنیت عامل‌های هوشمند

آزمایشگاه Armorer Labs یک سیستم تأیید لایه‌ای را برای جایگزینی با پرامپت‌های خسته‌کننده «بله/خیر» در عامل‌های هوش مصنوعی پیشنهاد داده است. این مدل با طبقه‌بندی اقدامات بر اساس…

۵ دقیقه خواندن