پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

تکنیک عامل RL: مدل در حال توضیح آشفتگی خودش

«تحلیل شکست‌خورده‌ها»؛ استراتژی جدید SEED برای اصلاح مسیر یادگیری عامل‌ها

پژوهش جدیدی متد SEED را معرفی کرده است که عامل‌های هوش مصنوعی را آموزش می‌دهد تا مسیرهای شکست‌خورده خود را تحلیل کرده و درس‌های به‌دست‌آمده را در سیاست‌های رفتاری خود تثبیت کنند.…

۶ دقیقه خواندن
عامل هوش مصنوعی در حال صدور وعده تخفیف مادام‌العمر به مشتریان است.
آموزش کاربردی

توهمِ یک عامل هوش مصنوعی ۳۸ هزار دلار تخفیف غیرمجاز هزینه کرد

یک عامل خدمات مشتریان به‌اشتباه تخفیف ۵۰ درصدی مادام‌العمر به کاربر اعطا کرد که منجر به ضرری ۳۸ هزار دلاری شد. این حادثه ثابت می‌کند توهمات یک ویژگی بنیادی در مدل‌های زبانی هستند…

۷ دقیقه خواندن
معماری مدل زبانی بزرگ برای عملیات ماموریت فضایی
آموزش کاربردی

Orbital Brain: معماری هفت‌مرحله‌ای برای حذف خطای انسانی در عملیات فضایی

معماری Orbital Brain با جداسازی مدل‌های زبانی از حلقه‌ی فرمان مستقیم، نقش آن‌ها را از کنترل‌گر به دستیار شناختی تغییر می‌دهد. این سیستم داده‌های خام تله‌متری را به راهنمایی‌های…

۴ دقیقه خواندن
درگاه امنیتی توضیح‌پذیر برای برنامه‌های هوش مصنوعی: جلوگیری از تزریق دستور با ارائه دلیل قابل‌ممیزی برای هر تصمیم.
آموزش کاربردی

پروژه‌ی ReasonGate: ارائه دلیل ماشین‌خوان برای هر مورد مسدودسازی

پروژه ReasonGate یک لایه امنیتی بازمتن برای برنامه‌های مبتنی بر مدل‌های زبانی است که حملات تزریق پرامپت و نشت داده‌ها را از طریق دفاع چندلایه می‌بندد. برخلاف ابزارهای سنتی، این…

۷ دقیقه خواندن۱
چالش ۵۱,۲۰۰ دلاری درب‌پشتی مدل — روزی که شروع به جستجو می‌کنید
آموزش کاربردی

«جست‌وجوی درهای پشتی پنهان»؛ هدف از رقابت ۵۱ هزار دلاری Vulcora

پلتفرم Vulcora چالشی امنیتی با جایزه بیش از ۵۱ هزار دلار برگزار کرده است تا متخصصان بتوانند جملات تحریک‌کننده پنهان در مدل‌های هوش مصنوعی را بیابند. این رقابت خطر استقرار مدل‌های…

۷ دقیقه خواندن
هشدار متا به والدین درباره بحث آسیب‌رسانی به خود نوجوانان

هوش مصنوعی متا چگونه ریسک خودکشی نوجوانان را به والدین هشدار می‌دهد؟

متا سامانه‌ای تخصصی برای شناسایی گفتگوهای مربوط به خودکشی و آسیب به خود در میان نوجوانان مستقر کرده است. این قابلیت که با نظارت انسانی برای جلوگیری از هشدارهای اشتباه همراه است،…

۲ دقیقه خواندن