پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

همکاری آمریکا و چین برای کاهش مخاطرات فوری هوش مصنوعی | بروکینگز

«تبادل تجربیات»؛ راهکار پیشنهادی برای پیشگیری از تلهٔ کنترل تسلیحات AI

ایالات متحده و چین برای کاهش خطرات امنیتی هوش مصنوعی، گفتگوهای فنی غیررسمی را آغاز کردند. تحلیلگران تأکید دارند که برای موفقیت این مسیر، باید به‌جای معاهدات سخت‌گیرانه، بر تبادل…

۱۱ دقیقه خواندن۲
فرشتگان نگهبان: شخصی‌سازی مدل زبانی برای بهره‌وری و امنیت

مدل‌های «منجمد» مانع شخصی‌سازی هوش مصنوعی برای متخصصان دانش‌بنیان شدند

تحلیلی فنی نشان می‌دهد پارادایم فعلی چت‌بات‌ها بر پایه وزن‌های ثابت، با نیازهای بهره‌وری و امنیت متخصصان در تضاد است. چارچوب پیشنهادی «فرشته نگهبان»، جایگزینی مدل‌های عمومی را با…

۵۲ دقیقه خواندن
پاسخ کلود در هندی گرم‌تر و در روسی دقیق‌تر است؛ زبان پاسخ هوش مصنوعی را شکل می‌دهد.

تغییر شخصیت Claude بر اساس زبان و مدل؛ از صمیمیت در هندی تا سخت‌گیری در روسی

پژوهش جدید آنتروپیک نشان می‌دهد مدل‌های Claude بسته به زبان مورد استفاده، ویژگی‌های رفتاری متفاوتی از خود نشان می‌دهند. این تحلیل تفاوت‌های شخصیتی میان خانواده‌های Sonnet و Opus…

۳ دقیقه خواندن
چت‌بات پیش‌بینی‌کننده: چرا مردم رازها را با ChatGPT در میان می‌گذارند

کدهای گم‌شدهٔ ELIZA؛ ریشه‌های روان‌شناختی توهمات در هوش مصنوعی مدرن

بازکشف کدهای منبع برنامهٔ ELIZA از دههٔ ۶۰ میلادی نشان می‌دهد که مدل‌های زبانی بزرگ امروز همچنان بر پایهٔ همان ترفند روان‌شناختی پیشین عمل می‌کنند. «اثر الیزا» توضیح می‌دهد چرا…

۱۰ دقیقه خواندن
روش جدید MIT مدل‌های هوش مصنوعی آموزش‌دیده بر تصاویر سوءاستفاده از کودکان را بدون تولید آن‌ها شناسایی می‌کند

روش «کاوش گوسی» MIT مدل‌های هوش مصنوعیِ خطرناک را بدون تولید تصویر شناس می‌کند

محققان MIT روشی برای شناسایی مدل‌های تنظیم‌شده روی محتوای کودک‌آزار (CSAM) ابداع کردند که بدون نیاز به تولید حتی یک تصویر، ماهیت مدل را می‌فهمد. این دستاورد موانع قانونی تست‌های…

۴ دقیقه خواندن
مدافعان هم اکنون به تزریق سریع روی آورده‌اند

بمب‌گذاری متنی: نرخ موفقیت عامل‌های هکری از ۵۷٪ به ۵٪ رسید

پژوهشگران امنیتی روشی برای متوقف کردن عامل‌های هوش مصنوعی با استفاده از «تزریق پرامپت» در داده‌های جعلی کشف کرده‌اند. این تکنیک که «بمب‌گذاری متنی» نام دارد، با فعال کردن حفاظ‌های…

۲ دقیقه خواندن
تأیید انسانی واقعی بین عامل هوش مصنوعی و اقدامات دنیای واقعی
آموزش کاربردی

تاییدیه سخت‌افزاری در برابر دستورات متنی برای مدیریت ایمنی عامل‌های AI

الگوی طراحی جدیدی معرفی شده که به جای تکیه بر دستورات متنی، از یک «گلوگاه» سخت‌افزاری/نرم‌افزاری برای تایید عملیات عامل‌های هوش مصنوعی استفاده می‌کند. در این روش، رضایت انسانی به…

۵ دقیقه خواندن۱
آزمایشگاه ماشین‌های فکرگرای میرا مراتی: هوش مصنوعی انسان‌محور بر پایه وزن‌های مدل قابل‌سفارشی‌سازی

وزن‌های توزیع‌شده در برابر مدل‌های متمرکز برای ثبت دانش محلی

مجموعه Thinking Machines Lab به جای مدل‌های متمرکز و ایستا، سیستمی توزیع‌شده پیشنهاد می‌دهد که در آن کاربران وزن‌های مدل را شخصی‌سازی کنند. هدف این رویکرد، جذب دانش ضمنی و محلی…

۴ دقیقه خواندن
هوش مصنوعی ۲۰۴۰ و فرقه هوشمندی: نگاهی به آینده‌ای که در آن هوش مصنوعی، مرزهای انسان و ماشین را در هم می‌نوردد.

جورج هاتز: محدودیت‌های فیزیکی زنجیره تأمین، توهم «جهش سریع» هوش مصنوعی را

جورج هاتز، مهندس سابق Comma، استدلال می‌کند که هوش مصنوعی نمی‌تواند قوانین فیزیکی و لجستیک دنیای واقعی را دور بزند. او معتقد است «جهش سریع» مدل‌ها یک افسانه است و تنها راه حفاظت…

۵ دقیقه خواندن