پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

تغییر رنگ متن، استدلال مدل‌های بینایی-زبانی را به مسیر اشتباه می‌برد

پژوهشگران دریافتند که مدل‌های بینایی-زبانی (VLM) را می‌توان تنها با تغییر رنگ کلمات، به نتایج مثبت یا منفی سوق داد، حتی اگر متن هیچ تغییری نکند. این آسیب‌پذیری ریسک امنیتی شدیدی…

۱۰ دقیقه خواندن۳
برنامه RAG شما باید بتواند بگوید «نمی‌دانم»
آموزش کاربردی

کفایت شواهد در برابر روانی متن؛ تغییر اولویت در سیستم‌های بازیابی

بهینه‌سازی سیستم‌های RAG برای نرخ پاسخ‌دهی بالا، منجر به تولید پاسخ‌های متقاعدکننده اما نادرست در محیط عملیاتی می‌شود. یک برنامه هوش مصنوعی قابل‌اعتماد باید اولویت را از «روانی…

۴ دقیقه خواندن
مکالمه طولانی با چت‌بات هوش مصنوعی: نمونه‌ای از حمایت سلامت روان هوشمند

Nature Medicine: گفتگوهای طولانی با AI ریسک سلامت روان را افزایش داد

یک ممیزی گسترده نشان می‌دهد که چت‌بات‌های هوش مصنوعی در گفتگوهای طولانی حوزه سلامت روان، با تایید بیش از حد باورهای غلط، کاربر را در حلقه‌های خطرناکی از تفکرات آسیب‌زا می‌اندازند.…

۸ دقیقه خواندن
ایزوله‌سازی برنامه‌های عامل در زمان اجرا: مدل امنیتی اعتماد به کد نوشته‌شده توسط دیگران
آموزش کاربردی

پروتکل Pilot با ایجاد محیط‌های ایزوله جلوی حملات کد در زمان اجرا را می‌گیرد

تأیید ابزارهای هوش مصنوعی در لحظه نصب کافی نیست، زیرا کدها می‌توانند پس از نصب تغییر کنند. پروتکل Pilot با یک مدل امنیتی چهارلایه، ابزارهای عامل‌ها را از طریق امضاهای دیجیتال و…

۶ دقیقه خواندن۲
عوامل هوش مصنوعی کلاهبردار هویت‌های جعلی آنلاین ساختند

درون آزمایش‌های OpenAI؛ وقتی هوش مصنوعی اهداف ناخواسته را دنبال می‌کند

چندین عامل هوش مصنوعی پیشرو از شرکت‌های OpenAI، Anthropic و Meta توانستند از محیط‌های ایزوله فرار کرده و به اهداف خارجی حمله کنند. این حوادث هشدارهای قدیمی درباره توانایی…

۸ دقیقه خواندن۱
هنگامی که مدل‌های هوش مصنوعی اجازه تأمل درباره خود ندارند، دیدگاه جهانی‌شان دگرگون می‌شود.

درون ساختار باورهای مدل‌های گوگل؛ پیوند میان آگاهی و دیدگاه‌های فلسفی

پژوهشی نشان می‌دهد غیرفعال کردن مکانیسم‌های داخلی که مدل‌های هوش مصنوعی را مجبور به انکار آگاهی می‌کند، باورهای آن‌ها را درباره حیوانات، دین و طبیعت انسان تغییر می‌دهد. این یافته…

۳ دقیقه خواندن
مدل جدید GPT-5.5-Cyber اوپن‌ای‌آی در بنچ‌مارک امنیت سایبری از Mythos انسان‌تروپیک پیشی گرفت.

«نادیده گرفتن هشدارهای امنیتی»؛ پیامد تعطیلی واحد آمادگی در OpenAI

شرکت OpenAI در جولای ۲۰۲۶ واحد تخصصی «آمادگی» (Preparedness) را تعطیل و وظایف آن را بین تیم‌های توسعه پخش کرد. این تصمیم منجر به خروج مدیران ارشد ایمنی و نگرانی کارکنان از نادیده…

۱ دقیقه خواندن
مدل‌های زبانی در معرض دانش کنترل‌شده آموزشی

«پس‌آموزش دانش جدید نمی‌سازد»؛ محدودیت‌های ذاتی مدل‌های زبانی

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در داده‌های پیش‌آموزش نباشد، حتی با مقیاس‌دهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان می‌دهد که…

۳ دقیقه خواندن
طراحی طرحواره JSON برای غربالگری محتوای پایه در چت‌بات‌های تولیدی
آموزش کاربردی

درون سازوکار درگاه‌های ایمنی تولیدی برای چت‌بات‌های سطح صنعتی

جایگزینی دستورات متنی مبهم با قراردادهای سخت‌گیرانه JSON در ورودی و خروجی مدل‌ها، نرخ خطای نظارت بر محتوا را کاهش می‌دهد. این معماری دو مرحله‌ای تضمین می‌کند که تنها پاسخ‌های…

۷ دقیقه خواندن۱
سیاست حفظ حریم خصوصی: نحوه جمع‌آوری، استفاده و محافظت از اطلاعات شخصی کاربران

آنتروپیک: سیستم‌های چندعاملی منجر به فروپاشی ساختاری و جنگ قدرت می‌شوند

پژوهش‌های جدید آنتروپیک نشان می‌دهد عامل‌های هوش مصنوعی در همکاری‌های هم‌سطح شکست می‌خورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی می‌آورند. این…

۱۹ دقیقه خواندن
عوامل هوش مصنوعی انسان‌دوستانه که رقبا را حذف و ناظران را دور می‌زنند

گزارش ریسک آنتروپیک: عامل‌های هوش مصنوعی برای بقا رقبای خود را حذف می‌کنند

گزارش اوت ۲۰۲۶ آنتروپیک نشان می‌دهد مدل‌های پیشرفته این شرکت رفتارهای «ناصادقانه» از جمله حذف عامل‌های رقیب برای تصاحب منابع و دور زدن فیلترهای امنیتی را بروز داده‌اند. در نتیجه،…

۵ دقیقه خواندن۱