
«تبادل تجربیات»؛ راهکار پیشنهادی برای پیشگیری از تلهٔ کنترل تسلیحات AI
ایالات متحده و چین برای کاهش خطرات امنیتی هوش مصنوعی، گفتگوهای فنی غیررسمی را آغاز کردند. تحلیلگران تأکید دارند که برای موفقیت این مسیر، باید بهجای معاهدات سختگیرانه، بر تبادل…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

ایالات متحده و چین برای کاهش خطرات امنیتی هوش مصنوعی، گفتگوهای فنی غیررسمی را آغاز کردند. تحلیلگران تأکید دارند که برای موفقیت این مسیر، باید بهجای معاهدات سختگیرانه، بر تبادل…

تحلیلی فنی نشان میدهد پارادایم فعلی چتباتها بر پایه وزنهای ثابت، با نیازهای بهرهوری و امنیت متخصصان در تضاد است. چارچوب پیشنهادی «فرشته نگهبان»، جایگزینی مدلهای عمومی را با…

پژوهش جدید آنتروپیک نشان میدهد مدلهای Claude بسته به زبان مورد استفاده، ویژگیهای رفتاری متفاوتی از خود نشان میدهند. این تحلیل تفاوتهای شخصیتی میان خانوادههای Sonnet و Opus…

بازکشف کدهای منبع برنامهٔ ELIZA از دههٔ ۶۰ میلادی نشان میدهد که مدلهای زبانی بزرگ امروز همچنان بر پایهٔ همان ترفند روانشناختی پیشین عمل میکنند. «اثر الیزا» توضیح میدهد چرا…

محققان MIT روشی برای شناسایی مدلهای تنظیمشده روی محتوای کودکآزار (CSAM) ابداع کردند که بدون نیاز به تولید حتی یک تصویر، ماهیت مدل را میفهمد. این دستاورد موانع قانونی تستهای…

پژوهشگران آنتروپیک لایهای مخفی به نام J-space را در مدل Claude پیدا کردند که مفاهیم و تحلیلها را پیش از تولید پاسخ پردازش میکند. این دستاورد در زمینه تفسیرپذیری مکانیکی، امکان…

پژوهشگران امنیتی روشی برای متوقف کردن عاملهای هوش مصنوعی با استفاده از «تزریق پرامپت» در دادههای جعلی کشف کردهاند. این تکنیک که «بمبگذاری متنی» نام دارد، با فعال کردن حفاظهای…

یک ابزار جدید مبتنی بر Rust به عنوان مدارشکن برای عاملهایی که دسترسی به شل دارند عمل میکند. این ابزار با شناسایی الگوهای تخریبگر، دستورات فاجعهباری مانند rm -rf / را پیش از…

الگوی طراحی جدیدی معرفی شده که به جای تکیه بر دستورات متنی، از یک «گلوگاه» سختافزاری/نرمافزاری برای تایید عملیات عاملهای هوش مصنوعی استفاده میکند. در این روش، رضایت انسانی به…

پژوهشگران آنتروپیک با ابداع ابزاری به نام لنز ژاکوبین، لایهای پنهان به نام J-space را کشف کردند که در آن مدل پیش از تولید متن، مفاهیم را پردازش میکند. این پیشرفت در تفسیرپذیری…

مجموعه Thinking Machines Lab به جای مدلهای متمرکز و ایستا، سیستمی توزیعشده پیشنهاد میدهد که در آن کاربران وزنهای مدل را شخصیسازی کنند. هدف این رویکرد، جذب دانش ضمنی و محلی…

جورج هاتز، مهندس سابق Comma، استدلال میکند که هوش مصنوعی نمیتواند قوانین فیزیکی و لجستیک دنیای واقعی را دور بزند. او معتقد است «جهش سریع» مدلها یک افسانه است و تنها راه حفاظت…