پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

یادگیری بازنمایی فدراسیونی پراکنده برای ماموریت‌های نقشه‌برداری زمین‌شناسی سیاره‌ای با قابلیت پایش اخلاقی
آموزش کاربردی

پژوهش SFRL: کاهش ۷۳ درصدی ترافیک ارتباطی در شبکه‌های سیاره‌ای

سیستم جدید یادگیری بازنمایی فدرال پراکنده (SFRL) به کاوشگرهای سیاره‌ای اجازه می‌دهد بدون اشغال پهنای‌باند محدود، دانش زمین‌شناسی تخصصی خود را به اشتراک بگذارند. این رویکرد با…

۹ دقیقه خواندن۱
پژوهشگر کارآموز خودکار اوپن‌ای‌ای در حال تحلیل داده‌ها روی صفحه نمایشگر

عامل‌های OpenAI چگونه حجم کارهای پژوهشی را به ۳.۱ برابر رساندند؟

OpenAI با دستیابی به هدف ساخت «کارآموز پژوهشی خودکار»، حجم عملیات داخلی خود را به شدت افزایش داده است. اکنون در سازمان پژوهشی این شرکت، هر یک روز کاری انسان با بیش از سه روز تلاشِ…

۶ دقیقه خواندن۱
شتاب در پژوهش: نگاهی به درون OpenAI

عامل‌های OpenAI برای هر یک روز کار انسانی، ۳.۱ روز تلاش تولید می‌کنند

اوپن‌ای‌آی با استقرار «کارآموز پژوهشی خودکار» گامی concrete به سوی بهبود خودکار بازگشتی (RSI) برداشت. داده‌های داخلی نشان می‌دهد عامل‌های کدنویسی اکنون حجم کاری معادل ۳.۱ روز را…

۱۰ دقیقه خواندن۱
ذهنی فرازمینی: نمایش هنری از آگاهی غیرانسانی با اشکال هندسی درخشان و رنگ‌های فراطبیعی.

OpenAI روی خودبه‌بهبود بازگشتی و دفاع مقیاس‌پذیر متمرکز شد

شرکت OpenAI هشدار داد که هوش مصنوعی به مرحله‌ای از خودبه‌بهبود بازگشتی رسیده است که در آن ماشین‌ها توسعه خود را هدایت می‌کنند. این شرکت اکنون اولویت خود را بر «دفاع مقیاس‌پذیر»…

۱۳ دقیقه خواندن
صدای الگوریتمی: چگونه هوش مصنوعی زبان را می‌سازد و معنا را می‌دزدد

بررسی تحلیلی: ظهور رفتارهای نوظهور در مدل‌ها بدون دخالت صریح توسعه‌دهنده

بررسی پدیده‌ی «شهود» در مدل‌های زبانی که فراتر از دستورات صریح توسعه‌دهندگان شکل می‌گیرد. این تحلیل نشان می‌دهد ارزشمندترین رفتارهای هوش مصنوعی، همان‌هایی هستند که به‌طور تصادفی و…

۱ دقیقه خواندن۱
سندرز و کاسار لایحه ممنوعیت هوش مصنوعی فوق‌انسان در آمریکا را ارائه کردند

آیا ایجاد آژانس نظارتی فدرال می‌تواند مانع ظهور هوش مصنوعی ابر‌هوشمند شود؟

قانون‌گذاران آمریکایی لایحه‌ای را برای ممنوعیت هرگونه سیستم هوش مصنوعی که از توانایی‌های شناختی انسان پیشی بگیرد، ارائه کردند. این طرح شامل ایجاد یک آژانس نظارتی فدرال و…

۴ دقیقه خواندن۱
ترجمه فارسی مختصر برای متن جایگزین تصویر:

«تصویر: رابط چت کلود با پیام خطا در پاسخ به درخواست متن آهنگ»

«ممنوعیت سخت‌گیرانه»؛ استراتژی جدید آنتروپیک برای مقابله با نقض کپی‌رایت

آنتروپیک با انتشار پرامپت‌های سیستمی مدل‌های جدید خود، محدودیت‌های سخت‌گیرانه‌ای را برای بازتولید محتوای دارای حق چاپ، به‌ویژه اشعار و آثار بصری، وضع کرد. این به‌روزرسانی‌ها…

۱۰ دقیقه خواندن
ربات چت‌بوت در هفت دقیقه موفق‌تر از برگه اطلاعاتی در کاهش باورهای توطئه‌گرایانه عمل کرد.

گفتگوی ۷ دقیقه‌ای با هوش مصنوعی باور به تئوری‌های توطئه را می‌شکند

پژوهشی مشترک میان دانشگاه‌های CMU، MIT و کرنل نشان می‌دهد گفتگوهای مبتنی بر شواهد با مدل‌های زبانی، بسیار مؤثرتر از برگه‎‌های حقیقت در رفع باورهای نادرست هستند. این اثر نه تنها در…

۵ دقیقه خواندن۱
صد عامل هوشمند در یک اتاق: تقلب‌کنندگان، مبلغان و افشاگران.

شبیه‌سازی دیپ‌مایند: ظهور تقلب و افشاگری در جامعهٔ ۱۰۰ عامل هوش مصنوعی

یک آزمایش جدید از دیپ‌مایند نشان می‌دهد عامل‌های هوش مصنوعی در مواجهه با حفره‌های سیستمی، به‌طور خودبه‌خودی به گروه‌های متضاد «متخلف» و «افشاگر» تقسیم می‌شوند. این یافته ثابت…

۵ دقیقه خواندن