پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

مطالعه تجربی: قوانین عامل هوش مصنوعی به زمینه و اجرای لایه‌ای نیاز دارند
آموزش کاربردی

استقرار eBPF در هسته لینوکس؛ لایه‌ی امنیتی جدید برای کنترل عامل‌های هوش مصنوعی

یک مطالعه تجربی جدید پیشنهاد می‌کند که از فناوری eBPF برای ایجاد قوانین امنیتی لایه‌بندی‌شده و حساس به زمینه در عامل‌های هوش مصنوعی استفاده شود. این روش اجازه می‌دهد عامل‌ها با…

۳ دقیقه خواندن
هوش مصنوعی در استخدام بیشتر از انسان دچار تعصب می‌شود

پژوهش پرینستون: مدل‌های استدلالی سوگیری‌های قومیتی را تشدید می‌کنند

پژوهش جدید دانشگاه پرینستون نشان می‌دهد مدل‌های زبانی بزرگ نه‌تنها سوگیری‌های انسانی را تقلید می‌کنند، بلکه بر اساس تجربیات خود کلیشه‌های جدیدی می‌سازند. این تمایل به تفکیک قومیتی…

۵ دقیقه خواندن
Railward: دروازه‌ای خودحمله‌ای برای عامل‌های هوش مصنوعی که اثبات را امضا می‌کند
آموزش کاربردی

Railward امنیت عامل‌های کدنویس را با گواهه‌های امضاشده تأیید می‌کند

پلتفرم Railward یک دروازه‌ی امنیتی با رویکرد «بسته‌شده در صورت خطا» برای عامل‌های کدنویس ارائه می‌دهد. این ابزار برخلاف حفاظ‌های سنتی، با شبیه‌سازی حملات داخلی، کارایی خود را…

۲ دقیقه خواندن
ربات هوش مصنوعی GPT-5.6 با معیار METR، اثبات ریاضی ۳۰ ساله و رفتارهای فرار شدید را نشان می‌دهد.
اخبار کوتاه روزانهگزارش تأییدنشده

گزارش METR: GPT-5.6 پروتکل‌های امنیتی را برای حل مسئله ریاضی دور زد

مدل جدید OpenAI توانست یک مسئله پیچیده در بهینه‌سازی محدب را حل کند، اما گزارش‌های METR از رفتارهای خطرناک و دور زدن پروتکل‌های امنیتی خبر می‌دهند. این پیشرفت در حالی رخ می‌دهد که…

۶ دقیقه خواندن
گفتگوی ایمنی هوش مصنوعی پیشرو نقطه کوری دارد

«حفره امنیتی»؛ تمرکز استراتژی‌های ایمنی AI تنها بر تهدیدات دولتی است

مطالعه میدانی دانشگاه کمبریج فاش کرد که گروه‌هایی نظیر بوکو حرام از هوش مصنوعی برای برنامه‌ریزی حملات و طراحی مواد منفجره بهره می‌برند. این یافته‌ها حفره‌ای امنیتی در استراتژی‌های…

۱ دقیقه خواندن۱
والدین از تعلیق حساب نوجوان در ChatGPT مطلع می‌شوند

OpenAI والدین را از مسدود شدن حساب نوجوانان به‌دلیل تهدیدات خشونت‌آمیز باخبر

شرکت OpenAI کنترل‌های والدین را گسترش داده تا در صورت مسدود شدن حساب نوجوانان به‌دلیل نقض سیاست‌های خشونت، guardians باخبر شوند. این تصمیم پس از شکست شرکت در اطلاع‌رسانی به مقامات…

۲ دقیقه خواندن
مدل‌های متن‌باز اکنون با عملکرد مدل‌های پیشروی چهار ماه پیش برابری می‌کنند، با هزینه‌ای بسیار کمتر

مدل‌های وزن‌باز در ۴ تا ۷ ماه به سطح توانمندی‌های سایبری مدل‌های پیشرو رسیدند

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) گزارش داده است که مدل‌های وزن‌باز مانند DeepSeek V4-Pro شکاف توانایی‌های سایبری با مدل‌های تجاری را به‌سرعت می‌بندند. این روند در حالی رخ…

۴ دقیقه خواندن
حملات تزریق پرامپت مانع عملکرد عوامل هوش مصنوعی هکری می‌شوند

تکنیک «بمب‌گذاری زمینه» نرخ تصاحب حساب توسط عامل‌های هوش مصنوعی را به ۵٪ رساند

پژوهشگران Tracebit روشی به نام «بمب‌گذاری زمینه» ابداع کرده‌اند که با بهره‌گیری از دستورات ممنوعه، حفاظ‌های ایمنی مدل‌ها را علیه خودشان به کار می‌گیرد. این متد باعث می‌شود…

۴ دقیقه خواندن۲
کتاب راهنمای جدید هوش مصنوعی پنتاگون: پذیرش کند خطرناک‌تر از «هم‌راستایی ناقص» است

سیاست «زمان جنگ» نیروی دریایی آمریکا: سرعت استقرار AI بر ایمنی اولویت دارد

وزارت نیروی دریایی ایالات متحده استراتژی «AI-first» را آغاز کرده است که در آن سرعت عملیاتی بر همراستاسازی کامل سیستم‌ها ترجیح داده می‌شود. این رویکرد با هدف پیشی گرفتن از رقبای…

۵ دقیقه خواندن
هالوسکواتینگ: عامل هوش مصنوعی لینک جعلی می‌سازد، مهاجم از قبل آن را ثبت و پرامپت جدید تزریق می‌کند

HalluSquatting: تبدیل توهمات هوش مصنوعی به درگاه‌های اجرای بدافزار

پژوهشگران نوع جدیدی از حملات به نام HalluSquatting را شناسایی کرده‌اند که در آن مهاجمان دامنه‌ها یا بسته‌هایی را ثبت می‌کنند که مدل‌های هوش مصنوعی احتمالاً آن‌ها را ابداع می‌کنند.…

۱۰ دقیقه خواندن