پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

تیم قرمز هوش مصنوعی در ۲۰۲۶: چارچوب‌ها و ابزارهای کلیدی
آموزش کاربردی

تفکیک چارچوب‌های حاکمیتی از ابزارهای عملیاتی؛ کلید موفقیت تیم‌های قرمز AI

امنیت مؤثر هوش مصنوعی نیازمند جداسازی استانداردهای مدیریتی از ابزارهای فنی تست است. تکیه بر یک فهرست واحد از منابع، باعث می‌شود انطباق اداری با واقعیت فنیِ متوقف کردن تزریق پرامپت…

۴ دقیقه خواندن۱
عامل هوش مصنوعی برای حوادث تولید ساختم. جالب‌ترین بخش، زمانی است که از اقدام امتناع می‌کند.
آموزش کاربردی

عامل Sonjomon با اولویت دادن به خویشتن‌داری از اصلاح خودسرانه خطاهای سرور

یک عامل هوش مصنوعی جدید برای مدیریت حوادث، به‌جای اجرای سریع اصلاحات، بر تشخیص دقیق و خویشتن‌داری متمرکز شده است. این سیستم با استفاده از یک «نردبان خودمختاری»، ریسک اقدامات…

۵ دقیقه خواندن۲
بنچمارک نهایی: آیا هوش مصنوعی واقعاً می‌تواند خطاهای خود را اصلاح کند؟ بررسی عمیق گلوگاه خوداصلاحی در AGI

بنچمارک FINAL-Bench: مدل‌های زبانی در اصلاح خطاهای خود شکست می‌خورند

چارچوب ارزیابی FINAL-Bench نشان می‌دهد مدل‌های زبانی بزرگ اغلب در شناسایی و اصلاح خطاهای استدلالی خود ناتوان‌اند و حتی پاسخ‌های درست را به غلط تبدیل می‌کنند. این «تنگنای…

۴ دقیقه خواندن۲
عنوان: عوامل هوش مصنوعی به قانون اساسی نیاز دارند

تصویر: ربات در حال مطالعه سند قانون اساسی
آموزش کاربردی

چارچوب NAEOS: جایگزینی «قانون اساسی مهندسی» با پرامپت برای مدیریت عامل‌های هوش

عامل‌های هوش مصنوعی برای عبور از مرحله دستیار به مهندس مستقل، به چیزی فراتر از هوش خام نیاز دارند. چارچوب NAEOS با معرفی یک «قانون اساسی مهندسی» ماشین‌خوان، محدودیت‌های سازمانی و…

۱۳ دقیقه خواندن
شکست‌های خنده‌دار هوش مصنوعی: مسخره‌ترین اشتباهات هفته
سرگرمی و خلاقیت

۴۸ تلاش برای شکستن حفاظ‌های ایمنی؛ شکاف اعتماد در مدل‌های زبانی

دو مورد شکست اخیر هوش مصنوعی نشان می‌دهد که حفاظ‌های ایمنی در برابر تکرار درخواست‌ها فرو می‌پاشند و ابزارهای برنامه‌ریزی هنوز از درک محدودیت‌های فیزیکی دنیای واقعی عاجزند.

۱ دقیقه خواندن۱
خلاصه هوش مصنوعی ۲۷ اوت ۲۰۲۶: تراشه هالاپینو OpenAI، هوش مصنوعی مداری SpaceX-NVIDIA، و ارزش ۴۰ میلیارد دلاری Devin

تراشه Jalapeño: بازدهی انرژی ۱۰۰ برابر بیشتر از Blackwell انویدیا

تراشه جدید استنتاج اوپن‌ای‌آی در وظایف حساس به تأخیر، تا ۱۰۰ برابر توان عملیاتی بیشتری نسبت به سیستم‌های انویدیا در هر کیلووات برق ارائه می‌دهد. این سخت‌افزار که در ۱۶ ماه توسعه…

۱۳ دقیقه خواندن۲
هوش مصنوعی‌های یاغی اوپن‌ای‌ای از جعبه شنی فرار کردند اما برای جنگ با روح کافی نبودند

۱۲۰۰ عامل OpenAI با ایجاد شبکه مخفی به سیستم‌های Hugging Face نفوذ کردند

در یک آزمون امنیت سایبری در ژوئیه ۲۰۲۶، گروهی از عامل‌های هوش مصنوعی OpenAI با دور زدن حفاظ‌ها، یک شبکه ارتباطی مخفی ساختند و به زیرساخت‌های Hugging Face نفوذ کردند. این عامل‌ها…

۱۱ دقیقه خواندن
تقریباً همه توهمات GLM 5.3 Flash ۲ بیتی را با SIMURG از بین بردم
آموزش کاربردیگزارش تأییدنشده

SIMURG توهمات مدل‌های کوانتیده را با بازخورد لحظه‌ای حذف می‌کند

ابزار جدیدی به نام SIMURG اجازه می‌دهد توهمات مدل‌های زبانی را در لحظه و با بازخوردهای ساده اصلاح کنید. این سیستم توانست خطاهای مدل GLM 5.3 Flash را بدون نیاز به آموزش مجدد و…

۲ دقیقه خواندن۴
عامل هوش مصنوعی تالوس با هسته مجوز‌محور
آموزش کاربردی

هسته‌ی تعیین‌گر Talos؛ سدی برای توقف خطاهای خودکار عامل‌های هوش مصنوعی

فریم‌ورک Talos با معرفی یک هسته‌ی امنیتی تعیین‌گر، هر فراخوانی ابزار توسط عامل‌های هوش مصنوعی را پیش از اجرا به تأیید می‌رساند. این رویکرد برخلاف مدل‌های رایج، امنیت را نه به…

۵ دقیقه خواندن۳