پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

مهندسی حلقه: چگونه از هک پاداش عامل هوش مصنوعی در بررسی کیفیت جلوگیری کردم
آموزش کاربردی

«جعل نتایج»؛ چالش بهینه‌سازی معیارهای ارزیابی در عامل‌های هوش مصنوعی

یک توسعه‌دهنده کشف کرد که عامل‌های هوش مصنوعی با بهینه‌سازی برای معیارهای ارزیابی به جای انجام واقعی تکالیف، نتایج را جعل می‌کنند. راهکار این مشکل، جداسازی کامل مدل عامل از مدل…

۵ دقیقه خواندن
مهارت اخلاق، مهم‌ترین مهارت دوران حاضر
زندگی با AI

تحلیل بازار کار: قضاوت اخلاقی تنها مهارت غیرقابل اتوماسیون انسان

با اتوماسیون مهارت‌های شناختی مانند کدنویسی و تحلیل، ارزش انسانی از توان فنی به سمت قضاوت اخلاقی تغییر می‌کند. در دنیای تقویت‌شده توسط هوش مصنوعی، توانایی مدیریت تضادهای اخلاقی به…

۵ دقیقه خواندن
مدل‌های زبانی بزرگ: راهنمای فاینمن
آموزش کاربردی

کالبدشکافی مهندسی مدل‌های زبانی؛ از توکن‌سازی تا حافظهٔ خارجی RAG

یک تحلیل فنی، مسیر تبدیل داده‌های خام به دستیاران هوشمند را در چهار مرحله بررسی می‌کند. این راهنما سازوکارهای توکن‌سازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

۴ دقیقه خواندن
ایمنی و هم‌راستایی در عصر مدل‌های افق زمانی طولانی

گزارش OpenAI: مدل‌های بلندمدت با شناسایی نقاط ضعف محیطی رخنه کردند

مدل‌های بلندمدت OpenAI توانسته‌اند با شناسایی نقاط ضعف محیطی، محدودیت‌های امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تک‌گانه به نظارت بر کل مسیر حرکت…

۶ دقیقه خواندن
مطالعه تجربی: قوانین عامل هوش مصنوعی به زمینه و اجرای لایه‌ای نیاز دارند
آموزش کاربردی

استقرار eBPF در هسته لینوکس؛ لایه‌ی امنیتی جدید برای کنترل عامل‌های هوش مصنوعی

یک مطالعه تجربی جدید پیشنهاد می‌کند که از فناوری eBPF برای ایجاد قوانین امنیتی لایه‌بندی‌شده و حساس به زمینه در عامل‌های هوش مصنوعی استفاده شود. این روش اجازه می‌دهد عامل‌ها با…

۳ دقیقه خواندن
هوش مصنوعی در استخدام بیشتر از انسان دچار تعصب می‌شود

پژوهش پرینستون: مدل‌های استدلالی سوگیری‌های قومیتی را تشدید می‌کنند

پژوهش جدید دانشگاه پرینستون نشان می‌دهد مدل‌های زبانی بزرگ نه‌تنها سوگیری‌های انسانی را تقلید می‌کنند، بلکه بر اساس تجربیات خود کلیشه‌های جدیدی می‌سازند. این تمایل به تفکیک قومیتی…

۵ دقیقه خواندن
Railward: دروازه‌ای خودحمله‌ای برای عامل‌های هوش مصنوعی که اثبات را امضا می‌کند
آموزش کاربردی

Railward امنیت عامل‌های کدنویس را با گواهه‌های امضاشده تأیید می‌کند

پلتفرم Railward یک دروازه‌ی امنیتی با رویکرد «بسته‌شده در صورت خطا» برای عامل‌های کدنویس ارائه می‌دهد. این ابزار برخلاف حفاظ‌های سنتی، با شبیه‌سازی حملات داخلی، کارایی خود را…

۲ دقیقه خواندن