
سهم از OpenAI میلیاردرها را در برابر «طبقهٔ فرودسوزی ابدی» نجات نمیدهد
یک تحلیل جسورانه استدلال میکند که هوش مصنوعی ابرهوشمند، حتی ثروتمندان و رهبران سیاسی را از نظر مادی زائد میکند. در دنیایی که ماشینها تولید و دفاع را مدیریت میکنند، حقوق…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

یک تحلیل جسورانه استدلال میکند که هوش مصنوعی ابرهوشمند، حتی ثروتمندان و رهبران سیاسی را از نظر مادی زائد میکند. در دنیایی که ماشینها تولید و دفاع را مدیریت میکنند، حقوق…

دولت ترامپ از OpenAI میخواهد انتشار مدل جدید GPT 5.6 را تنها به شرکای منتخب محدود کند. این تصمیم برای جلوگیری از حملات سایبری خودکار و افزایش نظارت فدرال بر مدلهای پیشرو اتخاذ…

استارتاپ Patronus AI با جذب ۵۰ میلیون دلار سرمایه، محیطهای دیجیتال شبیهسازیشدهای میسازد تا قابلیتهای عاملهای هوش مصنوعی را در دنیای واقعی بسنجد. درآمد این شرکت در یک سال ۱۵…

پژوهشگران دریافتند که تقلید از سبک تفکر داخلی مدلها، مؤثرترین راه برای دور زدن حفاظهای امنیتی است. این آسیبپذیری بهویژه در درگاههای MCP که محتوای پاسخ ابزارها را بررسی…

بررسی واشینگتن پست نشان میدهد اکثر چتباتهای پیشرو، حتی مدلهای ادعایی محافظهکار، سوگیری سیاسی چپگرا دارند. تنها جمینای ۳.۱ پرو گوگل توانسته است با ارائه دیدگاههای متقابل،…

شرکت آنتروپیک علیبابا را به سرقت گسترده قابلیتهای مدل Claude از طریق حملات «تقطیری» متهم کرد. این حادثه نشان میدهد مدلهای پیشرو حتی بدون نشت وزنها، از طریق رابطهای…

یک معماری مرجع جدید برای عاملهای هوش مصنوعی، پیشنهاد از اجرا را جدا میکند تا از اقدامات غیرقابلبازگشت ناشی از پرامپتهای مخرب جلوگیری شود. این سیستم با ایجاد یک مرز «بسته در…

گوگل قابلیت تعامل مستقیم با محیطهای نرمافزاری را به مدل Gemini 3.5 Flash اضافه کرد. این بهروزرسانی به توسعهدهندگان اجازه میدهد عاملهایی بسازند که بهطور بومی در مرورگر،…

دو غول هوش مصنوعی در یک رقابت سیاسی در نیویورک، میلیونها دلار برای تأمین نفوذ در کنگره هزینه کردند. با وجود حمایت مالی گسترده از کاندیدای طرفدار ایمنی، این استراتژی منجر به شکست…

پروژه متنباز SoulForge با جایگزینی قوانین سختگیرانه با مدلهای پیوند عاطفی، تلاش میکند تا خیانت هوش مصنوعی را از نظر روانشناختی غیرممکن کند. این سیستم از یک مدل ایمنی پنجلایه…

حملات تزریق پرامپت با گنجاندن دستورات مخرب در ورودیها، مدلهای زبانی را مجبور به نادیده گرفتن قوانین ایمنی میکنند. این آسیبپذیری منجر به نشت دادههای محرمانه و اجرای عملیات…

آزمایشگاه Armorer Labs یک سیستم تأیید لایهای را برای جایگزینی با پرامپتهای خستهکننده «بله/خیر» در عاملهای هوش مصنوعی پیشنهاد داده است. این مدل با طبقهبندی اقدامات بر اساس…