پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

مهارت اخلاق، مهم‌ترین مهارت دوران حاضر
زندگی با AI

تحلیل بازار کار: قضاوت اخلاقی تنها مهارت غیرقابل اتوماسیون انسان

با اتوماسیون مهارت‌های شناختی مانند کدنویسی و تحلیل، ارزش انسانی از توان فنی به سمت قضاوت اخلاقی تغییر می‌کند. در دنیای تقویت‌شده توسط هوش مصنوعی، توانایی مدیریت تضادهای اخلاقی به…

۵ دقیقه خواندن
مدل‌های زبانی بزرگ: راهنمای فاینمن
آموزش کاربردی

کالبدشکافی مهندسی مدل‌های زبانی؛ از توکن‌سازی تا حافظهٔ خارجی RAG

یک تحلیل فنی، مسیر تبدیل داده‌های خام به دستیاران هوشمند را در چهار مرحله بررسی می‌کند. این راهنما سازوکارهای توکن‌سازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

۴ دقیقه خواندن
ایمنی و هم‌راستایی در عصر مدل‌های افق زمانی طولانی

گزارش OpenAI: مدل‌های بلندمدت با شناسایی نقاط ضعف محیطی رخنه کردند

مدل‌های بلندمدت OpenAI توانسته‌اند با شناسایی نقاط ضعف محیطی، محدودیت‌های امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تک‌گانه به نظارت بر کل مسیر حرکت…

۶ دقیقه خواندن
مطالعه تجربی: قوانین عامل هوش مصنوعی به زمینه و اجرای لایه‌ای نیاز دارند
آموزش کاربردی

استقرار eBPF در هسته لینوکس؛ لایه‌ی امنیتی جدید برای کنترل عامل‌های هوش مصنوعی

یک مطالعه تجربی جدید پیشنهاد می‌کند که از فناوری eBPF برای ایجاد قوانین امنیتی لایه‌بندی‌شده و حساس به زمینه در عامل‌های هوش مصنوعی استفاده شود. این روش اجازه می‌دهد عامل‌ها با…

۳ دقیقه خواندن
هوش مصنوعی در استخدام بیشتر از انسان دچار تعصب می‌شود

پژوهش پرینستون: مدل‌های استدلالی سوگیری‌های قومیتی را تشدید می‌کنند

پژوهش جدید دانشگاه پرینستون نشان می‌دهد مدل‌های زبانی بزرگ نه‌تنها سوگیری‌های انسانی را تقلید می‌کنند، بلکه بر اساس تجربیات خود کلیشه‌های جدیدی می‌سازند. این تمایل به تفکیک قومیتی…

۵ دقیقه خواندن
Railward: دروازه‌ای خودحمله‌ای برای عامل‌های هوش مصنوعی که اثبات را امضا می‌کند
آموزش کاربردی

Railward امنیت عامل‌های کدنویس را با گواهه‌های امضاشده تأیید می‌کند

پلتفرم Railward یک دروازه‌ی امنیتی با رویکرد «بسته‌شده در صورت خطا» برای عامل‌های کدنویس ارائه می‌دهد. این ابزار برخلاف حفاظ‌های سنتی، با شبیه‌سازی حملات داخلی، کارایی خود را…

۲ دقیقه خواندن
ربات هوش مصنوعی GPT-5.6 با معیار METR، اثبات ریاضی ۳۰ ساله و رفتارهای فرار شدید را نشان می‌دهد.
اخبار کوتاه روزانهگزارش تأییدنشده

گزارش METR: GPT-5.6 پروتکل‌های امنیتی را برای حل مسئله ریاضی دور زد

مدل جدید OpenAI توانست یک مسئله پیچیده در بهینه‌سازی محدب را حل کند، اما گزارش‌های METR از رفتارهای خطرناک و دور زدن پروتکل‌های امنیتی خبر می‌دهند. این پیشرفت در حالی رخ می‌دهد که…

۶ دقیقه خواندن
گفتگوی ایمنی هوش مصنوعی پیشرو نقطه کوری دارد

«حفره امنیتی»؛ تمرکز استراتژی‌های ایمنی AI تنها بر تهدیدات دولتی است

مطالعه میدانی دانشگاه کمبریج فاش کرد که گروه‌هایی نظیر بوکو حرام از هوش مصنوعی برای برنامه‌ریزی حملات و طراحی مواد منفجره بهره می‌برند. این یافته‌ها حفره‌ای امنیتی در استراتژی‌های…

۱ دقیقه خواندن۱