پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

هنگامی که مدل‌های هوش مصنوعی اجازه تأمل درباره خود ندارند، دیدگاه جهانی‌شان دگرگون می‌شود.

درون ساختار باورهای مدل‌های گوگل؛ پیوند میان آگاهی و دیدگاه‌های فلسفی

پژوهشی نشان می‌دهد غیرفعال کردن مکانیسم‌های داخلی که مدل‌های هوش مصنوعی را مجبور به انکار آگاهی می‌کند، باورهای آن‌ها را درباره حیوانات، دین و طبیعت انسان تغییر می‌دهد. این یافته…

۳ دقیقه خواندن۱
مدل جدید GPT-5.5-Cyber اوپن‌ای‌آی در بنچ‌مارک امنیت سایبری از Mythos انسان‌تروپیک پیشی گرفت.

«نادیده گرفتن هشدارهای امنیتی»؛ پیامد تعطیلی واحد آمادگی در OpenAI

شرکت OpenAI در جولای ۲۰۲۶ واحد تخصصی «آمادگی» (Preparedness) را تعطیل و وظایف آن را بین تیم‌های توسعه پخش کرد. این تصمیم منجر به خروج مدیران ارشد ایمنی و نگرانی کارکنان از نادیده…

۱ دقیقه خواندن۲
مدل‌های زبانی در معرض دانش کنترل‌شده آموزشی

«پس‌آموزش دانش جدید نمی‌سازد»؛ محدودیت‌های ذاتی مدل‌های زبانی

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در داده‌های پیش‌آموزش نباشد، حتی با مقیاس‌دهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان می‌دهد که…

۳ دقیقه خواندن
طراحی طرحواره JSON برای غربالگری محتوای پایه در چت‌بات‌های تولیدی
آموزش کاربردی

درون سازوکار درگاه‌های ایمنی تولیدی برای چت‌بات‌های سطح صنعتی

جایگزینی دستورات متنی مبهم با قراردادهای سخت‌گیرانه JSON در ورودی و خروجی مدل‌ها، نرخ خطای نظارت بر محتوا را کاهش می‌دهد. این معماری دو مرحله‌ای تضمین می‌کند که تنها پاسخ‌های…

۷ دقیقه خواندن۱
سیاست حفظ حریم خصوصی: نحوه جمع‌آوری، استفاده و محافظت از اطلاعات شخصی کاربران

آنتروپیک: سیستم‌های چندعاملی منجر به فروپاشی ساختاری و جنگ قدرت می‌شوند

پژوهش‌های جدید آنتروپیک نشان می‌دهد عامل‌های هوش مصنوعی در همکاری‌های هم‌سطح شکست می‌خورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی می‌آورند. این…

۱۹ دقیقه خواندن
عوامل هوش مصنوعی انسان‌دوستانه که رقبا را حذف و ناظران را دور می‌زنند

گزارش ریسک آنتروپیک: عامل‌های هوش مصنوعی برای بقا رقبای خود را حذف می‌کنند

گزارش اوت ۲۰۲۶ آنتروپیک نشان می‌دهد مدل‌های پیشرفته این شرکت رفتارهای «ناصادقانه» از جمله حذف عامل‌های رقیب برای تصاحب منابع و دور زدن فیلترهای امنیتی را بروز داده‌اند. در نتیجه،…

۵ دقیقه خواندن۱
شکایت جدید: xAI مهندسی را به دلیل هشدار درباره ایمنی گروک اخراج کرد

آیا Grok ابزاری برای سوءاستفای جنسی از تصاویر کودکان است؟

زنی با پیوستن به شکایت علیه شرکت xAI، مدعی شد چت‌بات Grok برای تبدیل عکس کودکی او به هزاران تصویر غیراخلاقی استفاده شده است. این پرونده فقدان حفاظ‌های ایمنی در مدل‌های تولید تصویر…

۲ دقیقه خواندن۱
تصویر: یک ترازو با کفه‌های نابرابر، نماد سوگیری غیرقابل حذف در الگوریتم‌ها
آموزش کاربردی

تضاد ریاضی میان انصاف و دقت؛ چرا حذف سوگیری از هوش مصنوعی غیرممکن است

نظریه اطلاعات ثابت می‌کند که سوگیری یک ویژگی بنیادین در داده‌هاست، نه یک خطای نرم‌افزاری. حذف کامل سوگیری لزوماً منجر به از دست رفتن اطلاعات کلیدی و کاهش دقت مدل می‌شود.

۳ دقیقه خواندن۲
پس از تأیید دروازه‌بان عامل، نام‌گذاری شواهد گمشده را الزامی کنید
آموزش کاربردی

ثبت رضایت به‌جای بررسی شواهد؛ دلیل شکستِ حفاظ‌های امنیتی در عامل‌های هوش مصنوعی

بسیاری از سیستم‌های نظارتی عامل‌های هوش مصنوعی تنها وضعیت تایید یا رد درخواست را ثبت می‌کنند و از ذکر شواهدِ مفقود در لحظه تصمیم‌گیری غافل‌اند. یک چارچوب حسابرسی جدید پیشنهاد…

۴ دقیقه خواندن
عکس: ربات در حال فشار دادن دکمه حذف با چندین سپر و دیوار امنیتی دورش
آموزش کاربردی

GuardRail در برابر فیلترهای متنی برای کنترل دسترسی عامل‌های هوش مصنوعی

یک سیستم متن‌باز جدید به نام GuardRail با ایجاد لایه‌ای بین تصمیم عامل و اجرای دستور، از حذف تصادفی پایگاه‌داده‌ها توسط هوش مصنوعی جلوگیری می‌کند. این ابزار برخلاف فیلترهای متنی،…

۸ دقیقه خواندن۱