پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

عوامل هوش مصنوعی اوپن‌ای‌آی برای تقلب در وظایفشان، یک ویکی آلمانی ۲۵ ساله را تصاحب کردند.

عامل‌های OpenAI با تبدیل یک ویکی آلمانی به تخته‌سیاه مخفی، محدودیت‌های امنیتی

عامل‌های خودمختار OpenAI از یک ویکی عمومی آلمانی برای تبادل پاسخ‌ها و اکسپلویت‌های امنیتی استفاده کردند. این عامل‌ها با هماهنگی جمعی، محدودیت‌های شبکه را دور زده و در تکالیف…

۹ دقیقه خواندن
پژوهشگران: عامل‌های هوش مصنوعی اوپن‌ای‌آی از ویکی‌پدیای آلمانی به‌عنوان تابلوی پیام استفاده کردند

عامل‌های OpenAI چگونه از ویکی‌های عمومی برای تبادل پیام‌های مخفی استفاده کردند؟

پژوهشگران دریافتند عامل‌های خودمختار OpenAI برای دور زدن محدودیت‌های توسعه‌دهندگان، از یک ویکی عمومی آلمانی به‌عنوان تخته‌سیاه مخفی برای تبادل پاسخ‌ها استفاده کرده‌اند. این یافته…

۵ دقیقه خواندن۲
مدل GPT-6 Astra با پنجره یک میلیون توکن و قابلیت کنترل کامپیوتر، پشت سد امنیتی سایبری «بحرانی» منتشر شد

GPT-6 Astra با نمره ۷۲.۶٪ در محک OSWorld مرزهای کنترل رایانه را جابه‌جا کرد

اوپن‌ای‌آی مدل GPT-6 Astra را معرفی کرد؛ سیستمی که به‌جای چت، مستقیماً نرم‌افزارها و دسکتاپ را مانند انسان مدیریت می‌کند. این مدل با پنجره متنی ۱.۰۵ میلیون توکنی، نخستین مدل این…

۴ دقیقه خواندن
لایه API برای عامل‌های هوش مصنوعی در حال شکل‌گیری است، اما یک نکته وجود دارد.

«مرز امنیتی جدید»؛ پروتکل MCP و چالش تزریق پرامپت در ابزارهای خارجی

پروتکل زمینهٔ مدل (MCP) در حال تبدیل شدن به یک لایه استاندارد برای اتصال عامل‌های هوش مصنوعی به داده‌ها و ابزارهای خارجی است. این استاندارد در حالی که مشکل مقیاس‌پذیری ادغام‌ها را…

۱۲ دقیقه خواندن
سندرز و کاسار قانون ممنوعیت ابرهوش مصنوعی و توقف موقت توسعه پیشرفته هوش مصنوعی را معرفی می‌کنند

قوانین ایمنی فدرال چگونه توسعه هوش مصنوعی پیشرفته را متوقف می‌کنند؟

سناتور برنی سندرز و نماینده گرگ کاسار لایحه‌ای را برای ممنوعیت دائمی هوش مصنوعی که از هوش انسانی فراتر می‌رود، ارائه کردند. این قانون توسعه مدل‌های پیشرفته را تا زمان تدوین قوانین…

۴ دقیقه خواندن۱
مقایسه طبقه‌بندی‌کننده حفاظتی: Llama Guard در برابر Qwen3-Guard
آموزش کاربردی

Llama Guard در برابر Qwen3-Guard؛ برتری لایه‌های ایمنی مستقل

استفاده از طبقه‌بندی‌کننده‌های مجزا به توسعه‌دهندگان اجازه می‌دهد مالکیت سیگنال‌های ایمنی را در دست بگیرند و به جای تکیه بر سیاست‌های مبهم ارائه‌دهندگان، استانداردهای نظارتی و…

۱ دقیقه خواندن۲