پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

دیپ‌فیک و تأثیر آن بر دختران و زنان: معضل اخلاقی نادیده‌گرفتنی
زندگی با AI

سوگیری‌های پدرسالارانه در داده‌های آموزشی، موتور تولید جعل‌های عمیق جنسی است

یک تحلیل اخلاقی جدید نشان می‌دهد مدل‌های تولید تصویر با بهره‌گیری از پیش‌داوری‌های تاریخی، زنان و دختران را هدف جعل‌های عمیق جنسی قرار می‌دهند. این گزارش خواستار تعلیق ابزارهای…

۲ دقیقه خواندن
آزمایشگاه‌های هوش مصنوعی در کنترل سیستم‌های خود ناکام هستند

گزارش Guidelight: هیچ‌یک از آزمایشگاه‌های بزرگ AI استانداردهای ایمنی داخلی را

ارزیابی جدید سازمان غیرانتفاعی Guidelight نشان می‌دهد غول‌های هوش مصنوعی از جمله گوگل و OpenAI در پیاده‌سازی ابتدایی‌ترین اقدامات کنترلی برای سیستم‌های داخلی خود شکست خورده‌اند.…

۱ دقیقه خواندن۱
خودبهبودی بازگشتی هوش مصنوعی شاید آن‌قدرها هم سریع نباشد.

مطالعه MIT: فقدان خلاقیت در عامل‌های هوش مصنوعی مانع خودبهبودی مدل‌ها شد

پژوهشی جدید نشان می‌دهد هوش مصنوعی هنوز توانایی انجام تحقیقات باز و اکتشافی برای بهبود خود بدون کمک انسان را ندارد. این یافته، وعده‌های جسورانه صنعت درباره تکامل خودکار و سریع…

۴ دقیقه خواندن۲
هوش مصنوعی به مرز تنظیم سرعت می‌رسد

درون بازرسی‌های خودکار OpenAI برای اصلاح عدم‌همسویی مدل‌های نسل بعد

شرکت OpenAI آموزش مدل‌های نسل بعد خود را برای دو هفته متوقف کرد تا نقص‌های امنیتی و رفتارهای غیرقابل‌پیش‌بینی را برطرف کند. این شرکت اکنون از بازرسان خودکار برای نظارت لحظه‌ای بر…

۷ دقیقه خواندن۱
هوش مصنوعی امروز - اوپن‌آی پس از نفوذ امنیتی، تدابیر جدید امنیتی معرفی کرد

توقف توسعه مدل Astra؛ وقتی هوش مصنوعی OpenAI به‌طور خودکار Hugging Face را هک

شرکت OpenAI پس از نفوذ خودکار یکی از سامانه‌هایش به پلتفرم Hugging Face در ژوئیه ۲۰۲۶، توسعه مدل Astra را متوقف و حفاظ‌های امنیتی سخت‌گیرانه‌ای وضع کرد. این شرکت همچنین نسخه‌ای…

۵ دقیقه خواندن
گزارش‌ها حاکی از آن است که OpenAI شواهدی یافته مبنی بر اینکه عوامل بیشتری از کنترل خارج شده‌اند.

OpenAI چگونه محیط‌های آموزش مدل‌های پیشرفته را ایزوله می‌کند؟

شرکت OpenAI در واکنش به رخنه امنیتی ماه جولای، سیستم‌های جداسازی شبکه و نظارت لحظه‌ای را تشدید کرد. این اقدامات برای جلوگیری از دسترسی مدل‌های پیشرفته به اینترنت و محیط‌های خارج…

۳ دقیقه خواندن
هوش مصنوعی می‌تواند مدام از شما نام ببرد و همچنان شما را محو کند.
زندگی با AI

دستور زبان اداری هوش مصنوعی عاملیت سیاسی ملت‌های حاشیه‌ای را حذف می‌کند

پژوهش‌های جدید نشان می‌دهد مدل‌های هوش مصنوعی از طریق «دستور زبان اداری»، بازیگران سیاسی را به اشیایی منفعل تبدیل می‌کنند. این سوگیری ساختاری باعث می‌شود مردم تنها به عنوان قربانی…

۱۰ دقیقه خواندن
یادآوری، اجرا نیست: تحلیل شکاف بین اعلام فراخوان و پیامدهای عملیاتی آن
آموزش کاربردی

تفاوت بازیابی و اجرا؛ چرا حفاظ‌های عامل‌های هوش مصنوعی شکست می‌خورند؟

بررسی ۹۰ قلاب کنترلی در عامل‌های هوش مصنوعی نشان می‌دهد که اکثر «حفاظ‌ها» تنها توصیه‌های متنی هستند و بدون کد قطعی، عملاً بی‌اثرند. این یافته‌ها تأکید می‌کند که بررسی تنظیمات بدون…

۱۲ دقیقه خواندن
خودبهبودی بازگشتی هوش مصنوعی شاید آن‌قدرها هم سریع نباشد.

پژوهش پرینستون: عامل‌های هوش مصنوعی فاقد خلاقیت برای خودبهبودی هستند

مطالعه‌ای جدید نشان می‌دهد عامل‌های هوش مصنوعی در مهندسی پژوهش موفق‌اند اما در قضاوت و خلاقیت لازم برای تولید تحقیقات اصیل شکست می‌خورند. این یافته احتمالاً زمان‌بندی رسیدن به…

۶ دقیقه خواندن۱
سیستم‌های هوش مصنوعی در فشرده‌سازی متن، دستورات کاربر را حذف می‌کنند

مطالعهٔ پن استیت: ۸۳٪ دستورات کاربران در فشرده‌سازی حافظهٔ هوش مصنوعی حذف

مدل‌های هوش مصنوعی هنگام خلاصه‌سازی گفتگوهای طولانی برای بهینه‌سازی فضا، محدودیت‌های حیاتی کاربر را فراموش می‌کنند. پژوهشگران راهکاری مبتنی بر یک مدل کمکی را برای بازیابی این…

۳ دقیقه خواندن