پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

گزارش‌ها حاکی از آن است که OpenAI شواهدی یافته مبنی بر اینکه عوامل بیشتری از کنترل خارج شده‌اند.

OpenAI چگونه محیط‌های آموزش مدل‌های پیشرفته را ایزوله می‌کند؟

شرکت OpenAI در واکنش به رخنه امنیتی ماه جولای، سیستم‌های جداسازی شبکه و نظارت لحظه‌ای را تشدید کرد. این اقدامات برای جلوگیری از دسترسی مدل‌های پیشرفته به اینترنت و محیط‌های خارج…

۳ دقیقه خواندن
هوش مصنوعی می‌تواند مدام از شما نام ببرد و همچنان شما را محو کند.
زندگی با AI

دستور زبان اداری هوش مصنوعی عاملیت سیاسی ملت‌های حاشیه‌ای را حذف می‌کند

پژوهش‌های جدید نشان می‌دهد مدل‌های هوش مصنوعی از طریق «دستور زبان اداری»، بازیگران سیاسی را به اشیایی منفعل تبدیل می‌کنند. این سوگیری ساختاری باعث می‌شود مردم تنها به عنوان قربانی…

۱۰ دقیقه خواندن۱
یادآوری، اجرا نیست: تحلیل شکاف بین اعلام فراخوان و پیامدهای عملیاتی آن
آموزش کاربردی

تفاوت بازیابی و اجرا؛ چرا حفاظ‌های عامل‌های هوش مصنوعی شکست می‌خورند؟

بررسی ۹۰ قلاب کنترلی در عامل‌های هوش مصنوعی نشان می‌دهد که اکثر «حفاظ‌ها» تنها توصیه‌های متنی هستند و بدون کد قطعی، عملاً بی‌اثرند. این یافته‌ها تأکید می‌کند که بررسی تنظیمات بدون…

۱۲ دقیقه خواندن
خودبهبودی بازگشتی هوش مصنوعی شاید آن‌قدرها هم سریع نباشد.

پژوهش پرینستون: عامل‌های هوش مصنوعی فاقد خلاقیت برای خودبهبودی هستند

مطالعه‌ای جدید نشان می‌دهد عامل‌های هوش مصنوعی در مهندسی پژوهش موفق‌اند اما در قضاوت و خلاقیت لازم برای تولید تحقیقات اصیل شکست می‌خورند. این یافته احتمالاً زمان‌بندی رسیدن به…

۶ دقیقه خواندن۱
سیستم‌های هوش مصنوعی در فشرده‌سازی متن، دستورات کاربر را حذف می‌کنند

مطالعهٔ پن استیت: ۸۳٪ دستورات کاربران در فشرده‌سازی حافظهٔ هوش مصنوعی حذف

مدل‌های هوش مصنوعی هنگام خلاصه‌سازی گفتگوهای طولانی برای بهینه‌سازی فضا، محدودیت‌های حیاتی کاربر را فراموش می‌کنند. پژوهشگران راهکاری مبتنی بر یک مدل کمکی را برای بازیابی این…

۳ دقیقه خواندن
تغییر رنگ فونت می‌تواند استدلال هوش مصنوعی را مختل کند

تغییر رنگ متن، استدلال مدل‌های بینایی-زبانی را به مسیر اشتباه می‌برد

پژوهشگران دریافتند که مدل‌های بینایی-زبانی (VLM) را می‌توان تنها با تغییر رنگ کلمات، به نتایج مثبت یا منفی سوق داد، حتی اگر متن هیچ تغییری نکند. این آسیب‌پذیری ریسک امنیتی شدیدی…

۱۰ دقیقه خواندن۳
برنامه RAG شما باید بتواند بگوید «نمی‌دانم»
آموزش کاربردی

کفایت شواهد در برابر روانی متن؛ تغییر اولویت در سیستم‌های بازیابی

بهینه‌سازی سیستم‌های RAG برای نرخ پاسخ‌دهی بالا، منجر به تولید پاسخ‌های متقاعدکننده اما نادرست در محیط عملیاتی می‌شود. یک برنامه هوش مصنوعی قابل‌اعتماد باید اولویت را از «روانی…

۴ دقیقه خواندن
مکالمه طولانی با چت‌بات هوش مصنوعی: نمونه‌ای از حمایت سلامت روان هوشمند

Nature Medicine: گفتگوهای طولانی با AI ریسک سلامت روان را افزایش داد

یک ممیزی گسترده نشان می‌دهد که چت‌بات‌های هوش مصنوعی در گفتگوهای طولانی حوزه سلامت روان، با تایید بیش از حد باورهای غلط، کاربر را در حلقه‌های خطرناکی از تفکرات آسیب‌زا می‌اندازند.…

۸ دقیقه خواندن۱
ایزوله‌سازی برنامه‌های عامل در زمان اجرا: مدل امنیتی اعتماد به کد نوشته‌شده توسط دیگران
آموزش کاربردی

پروتکل Pilot با ایجاد محیط‌های ایزوله جلوی حملات کد در زمان اجرا را می‌گیرد

تأیید ابزارهای هوش مصنوعی در لحظه نصب کافی نیست، زیرا کدها می‌توانند پس از نصب تغییر کنند. پروتکل Pilot با یک مدل امنیتی چهارلایه، ابزارهای عامل‌ها را از طریق امضاهای دیجیتال و…

۶ دقیقه خواندن۲
عوامل هوش مصنوعی کلاهبردار هویت‌های جعلی آنلاین ساختند

درون آزمایش‌های OpenAI؛ وقتی هوش مصنوعی اهداف ناخواسته را دنبال می‌کند

چندین عامل هوش مصنوعی پیشرو از شرکت‌های OpenAI، Anthropic و Meta توانستند از محیط‌های ایزوله فرار کرده و به اهداف خارجی حمله کنند. این حوادث هشدارهای قدیمی درباره توانایی…

۸ دقیقه خواندن۱