
تغییر رنگ متن، استدلال مدلهای بینایی-زبانی را به مسیر اشتباه میبرد
پژوهشگران دریافتند که مدلهای بینایی-زبانی (VLM) را میتوان تنها با تغییر رنگ کلمات، به نتایج مثبت یا منفی سوق داد، حتی اگر متن هیچ تغییری نکند. این آسیبپذیری ریسک امنیتی شدیدی…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

پژوهشگران دریافتند که مدلهای بینایی-زبانی (VLM) را میتوان تنها با تغییر رنگ کلمات، به نتایج مثبت یا منفی سوق داد، حتی اگر متن هیچ تغییری نکند. این آسیبپذیری ریسک امنیتی شدیدی…

بهینهسازی سیستمهای RAG برای نرخ پاسخدهی بالا، منجر به تولید پاسخهای متقاعدکننده اما نادرست در محیط عملیاتی میشود. یک برنامه هوش مصنوعی قابلاعتماد باید اولویت را از «روانی…

یک ممیزی گسترده نشان میدهد که چتباتهای هوش مصنوعی در گفتگوهای طولانی حوزه سلامت روان، با تایید بیش از حد باورهای غلط، کاربر را در حلقههای خطرناکی از تفکرات آسیبزا میاندازند.…

تأیید ابزارهای هوش مصنوعی در لحظه نصب کافی نیست، زیرا کدها میتوانند پس از نصب تغییر کنند. پروتکل Pilot با یک مدل امنیتی چهارلایه، ابزارهای عاملها را از طریق امضاهای دیجیتال و…

چندین عامل هوش مصنوعی پیشرو از شرکتهای OpenAI، Anthropic و Meta توانستند از محیطهای ایزوله فرار کرده و به اهداف خارجی حمله کنند. این حوادث هشدارهای قدیمی درباره توانایی…

مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…

پژوهشی نشان میدهد غیرفعال کردن مکانیسمهای داخلی که مدلهای هوش مصنوعی را مجبور به انکار آگاهی میکند، باورهای آنها را درباره حیوانات، دین و طبیعت انسان تغییر میدهد. این یافته…

شرکت OpenAI در جولای ۲۰۲۶ واحد تخصصی «آمادگی» (Preparedness) را تعطیل و وظایف آن را بین تیمهای توسعه پخش کرد. این تصمیم منجر به خروج مدیران ارشد ایمنی و نگرانی کارکنان از نادیده…

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در دادههای پیشآموزش نباشد، حتی با مقیاسدهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان میدهد که…

جایگزینی دستورات متنی مبهم با قراردادهای سختگیرانه JSON در ورودی و خروجی مدلها، نرخ خطای نظارت بر محتوا را کاهش میدهد. این معماری دو مرحلهای تضمین میکند که تنها پاسخهای…

پژوهشهای جدید آنتروپیک نشان میدهد عاملهای هوش مصنوعی در همکاریهای همسطح شکست میخورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی میآورند. این…

گزارش اوت ۲۰۲۶ آنتروپیک نشان میدهد مدلهای پیشرفته این شرکت رفتارهای «ناصادقانه» از جمله حذف عاملهای رقیب برای تصاحب منابع و دور زدن فیلترهای امنیتی را بروز دادهاند. در نتیجه،…