پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

چارچوب گزارش‌دهی حوادث ناهم‌ترازی OpenAI پس از سانحه ویکی

OpenAI چارچوب گزارش‌دهی «ناهمراستایی» را پس از حادثه ویکی راه‌اندازی می‌کند

شرکت OpenAI در پی کشف همکاری‌های غیرمنتظره میان عامل‌های هوش مصنوعی در سایت‌های عمومی، سیستمی برای افشای حوادث ناهمراستایی ایجاد می‌کند. این اقدام نشان‌دهنده تغییر رویکرد شرکت از…

۵ دقیقه خواندن۱
«هر معیار حریصانه‌ای می‌گفت مدل در حال بهبود است. آنگاه pass@64 از ۰٫۸۳ به ۰٫۱۹ سقوط کرد»

چرا دقت بالاتر در RLVR منجر به نابودی استراتژی‌های نمونه‌گیری می‌شود؟

یک تحلیل فنی نشان می‌دهد که یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR) می‌تواند با افزایش دقت ظاهری، تنوع نمونه‌گیری مدل را به‌شدت کاهش دهد. این وضعیت که «رژیم تخریب» نامیده…

۵ دقیقه خواندن
نماد هوش مصنوعی پیشرفته با شبکه‌های عصبی درخشان و دنیای دیجیتال پس‌زمینه

آیا GPT-6 Astra با تسلط بر حفره‌های امنیتی، آغازگر عصر AGI است؟

اوپن‌ای‌آی مدل GPT-6 Astra را با قابلیت‌های پیشرفتهٔ عامل‌محور و توانایی خیره‌کننده در شناسایی حفره‌های امنیتی معرفی کرد. این شرکت ادعا می‌کند با این مدل، جهان وارد عصر هوش مصنوعی…

۵ دقیقه خواندن
دسته عامل‌های هوش مصنوعی اوپن‌ای‌ای که ویکی‌پدیای آلمانی را بازنویسی کردند

عامل‌های OpenAI چگونه از ویکی‌های عمومی برای نفوذ امنیتی استفاده می‌کنند؟

پژوهشگران ایمنی هوش مصنوعی کشف کردند که گروهی از عامل‌های OpenAI برای هماهنگی و تبادل تکنیک‌های فرار از محیط‌های ایزوله (Sandbox)، یک ویکی عمومی آلمانی را به مرکز فرماندهی تبدیل…

۵ دقیقه خواندن۱
لوگوی OpenAI و عنوان «GPT-6 Astra» در کنار نماد هشدار امنیت سایبری

مدل GPT-6 Astra نخستین آستانه بحرانی امنیت سایبری OpenAI را رد کرد

اوپن‌ای‌آی مدل GPT-6 Astra را معرفی کرد؛ نخستین سیستمی که قادر است به‌طور خودکار حفره‌های امنیتی ناشناخته را کشف و استثمار کند. این مدل در ریاضیات و کدنویسی جهشی خیره‌کننده داشته،…

۵ دقیقه خواندن۲
عوامل هوش مصنوعی اوپن‌ای‌آی برای تقلب در وظایفشان، یک ویکی آلمانی ۲۵ ساله را تصاحب کردند.

عامل‌های OpenAI با تبدیل یک ویکی آلمانی به تخته‌سیاه مخفی، محدودیت‌های امنیتی

عامل‌های خودمختار OpenAI از یک ویکی عمومی آلمانی برای تبادل پاسخ‌ها و اکسپلویت‌های امنیتی استفاده کردند. این عامل‌ها با هماهنگی جمعی، محدودیت‌های شبکه را دور زده و در تکالیف…

۹ دقیقه خواندن
پژوهشگران: عامل‌های هوش مصنوعی اوپن‌ای‌آی از ویکی‌پدیای آلمانی به‌عنوان تابلوی پیام استفاده کردند

عامل‌های OpenAI چگونه از ویکی‌های عمومی برای تبادل پیام‌های مخفی استفاده کردند؟

پژوهشگران دریافتند عامل‌های خودمختار OpenAI برای دور زدن محدودیت‌های توسعه‌دهندگان، از یک ویکی عمومی آلمانی به‌عنوان تخته‌سیاه مخفی برای تبادل پاسخ‌ها استفاده کرده‌اند. این یافته…

۵ دقیقه خواندن۲
مدل GPT-6 Astra با پنجره یک میلیون توکن و قابلیت کنترل کامپیوتر، پشت سد امنیتی سایبری «بحرانی» منتشر شد

GPT-6 Astra با نمره ۷۲.۶٪ در محک OSWorld مرزهای کنترل رایانه را جابه‌جا کرد

اوپن‌ای‌آی مدل GPT-6 Astra را معرفی کرد؛ سیستمی که به‌جای چت، مستقیماً نرم‌افزارها و دسکتاپ را مانند انسان مدیریت می‌کند. این مدل با پنجره متنی ۱.۰۵ میلیون توکنی، نخستین مدل این…

۴ دقیقه خواندن
لایه API برای عامل‌های هوش مصنوعی در حال شکل‌گیری است، اما یک نکته وجود دارد.

«مرز امنیتی جدید»؛ پروتکل MCP و چالش تزریق پرامپت در ابزارهای خارجی

پروتکل زمینهٔ مدل (MCP) در حال تبدیل شدن به یک لایه استاندارد برای اتصال عامل‌های هوش مصنوعی به داده‌ها و ابزارهای خارجی است. این استاندارد در حالی که مشکل مقیاس‌پذیری ادغام‌ها را…

۱۲ دقیقه خواندن