پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

چرا تا سال ۲۰۲۸، مهندسی هوش مصنوعی از دست انسان خارج می‌شود؟

چرا تا سال ۲۰۲۸، مهندسی هوش مصنوعی از دست انسان خارج می‌شود؟

جک کلارک، هم‌بنیان‌گذار Anthropic، پیش‌بینی می‌کند که تا سال ۲۰۲۸ سیستم‌های هوش مصنوعی قادر خواهند بود نسخه‌های برتری از خود را به‌طور خودکار خلق کنند. این جهش، مرز بین ابزارهای…

۳ دقیقه خواندن
قمار نیک بوستروم روی انقراض؛ آیا جاودانگی بهای نابودی بشر را می‌ارزد؟

قمار نیک بوستروم روی انقراض؛ آیا جاودانگی بهای نابودی بشر را می‌ارزد؟

نیک بوستروم، فیلسوف برجسته، معتقد است ریسک نابودی بشر توسط AI توجیه‌پذیر است، به شرطی که این فناوری بتواند مرگ بیولوژیک را متوقف کند. او رویای جهانی را می‌بیند که در آن انسان‌ها…

۲ دقیقه خواندن
چرا اعتماد به «اصلاح‌شده» بودن مدل‌های زبانی یک اشتباه است

چرا اعتماد به «اصلاح‌شده» بودن مدل‌های زبانی یک اشتباه است

پژوهشگران ابزاری برای شناسایی تغییرات رفتاری پنهان در مدل‌های زبانی پس از مداخلات فنی ساخته‌اند. این سیستم می‌تواند اثرات جانبی پیش‌بینی‌نشده در فرآیندهای تقطیر و ویرایش دانش را…

۲ دقیقه خواندن
پروژه MIA: نقشه‌ی راه شناختی برای درک استعاره‌ها در هوش مصنوعی

پروژه MIA: نقشه‌ی راه شناختی برای درک استعاره‌ها در هوش مصنوعی

یک مجموعه داده جدید از ردیابی چشم نشان می‌دهد که یادگیرندگان زبان دوم ابتدا اصطلاحات را به‌صورت تحت‌اللفظی پردازش می‌کنند. این منبع، معیاری حیاتی برای سنجش میزان شباهت درک مدل‌های…

۲ دقیقه خواندن
رمزگشایی از هنر روایت؛ پایان عصر داستان‌های خسته‌کننده در AI

رمزگشایی از هنر روایت؛ پایان عصر داستان‌های خسته‌کننده در AI

پژوهشگران با معرفی StoryAlign، شکاف میان منطق ماشین و جذابیت روایت‌های انسانی را هدف قرار داده‌اند. این مدل با آموزش روی ۱۰۰ هزار جفت ترجیح، استانداردهای جدیدی را برای تولید…

۲ دقیقه خواندن