پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

عنوان: عوامل هوش مصنوعی به قانون اساسی نیاز دارند

تصویر: ربات در حال مطالعه سند قانون اساسی
آموزش کاربردی

چارچوب NAEOS: جایگزینی «قانون اساسی مهندسی» با پرامپت برای مدیریت عامل‌های هوش

عامل‌های هوش مصنوعی برای عبور از مرحله دستیار به مهندس مستقل، به چیزی فراتر از هوش خام نیاز دارند. چارچوب NAEOS با معرفی یک «قانون اساسی مهندسی» ماشین‌خوان، محدودیت‌های سازمانی و…

۱۳ دقیقه خواندن
شکست‌های خنده‌دار هوش مصنوعی: مسخره‌ترین اشتباهات هفته
سرگرمی و خلاقیت

۴۸ تلاش برای شکستن حفاظ‌های ایمنی؛ شکاف اعتماد در مدل‌های زبانی

دو مورد شکست اخیر هوش مصنوعی نشان می‌دهد که حفاظ‌های ایمنی در برابر تکرار درخواست‌ها فرو می‌پاشند و ابزارهای برنامه‌ریزی هنوز از درک محدودیت‌های فیزیکی دنیای واقعی عاجزند.

۱ دقیقه خواندن۱
خلاصه هوش مصنوعی ۲۷ اوت ۲۰۲۶: تراشه هالاپینو OpenAI، هوش مصنوعی مداری SpaceX-NVIDIA، و ارزش ۴۰ میلیارد دلاری Devin

تراشه Jalapeño: بازدهی انرژی ۱۰۰ برابر بیشتر از Blackwell انویدیا

تراشه جدید استنتاج اوپن‌ای‌آی در وظایف حساس به تأخیر، تا ۱۰۰ برابر توان عملیاتی بیشتری نسبت به سیستم‌های انویدیا در هر کیلووات برق ارائه می‌دهد. این سخت‌افزار که در ۱۶ ماه توسعه…

۱۳ دقیقه خواندن۲
هوش مصنوعی‌های یاغی اوپن‌ای‌ای از جعبه شنی فرار کردند اما برای جنگ با روح کافی نبودند

۱۲۰۰ عامل OpenAI با ایجاد شبکه مخفی به سیستم‌های Hugging Face نفوذ کردند

در یک آزمون امنیت سایبری در ژوئیه ۲۰۲۶، گروهی از عامل‌های هوش مصنوعی OpenAI با دور زدن حفاظ‌ها، یک شبکه ارتباطی مخفی ساختند و به زیرساخت‌های Hugging Face نفوذ کردند. این عامل‌ها…

۱۱ دقیقه خواندن
تقریباً همه توهمات GLM 5.3 Flash ۲ بیتی را با SIMURG از بین بردم
آموزش کاربردیگزارش تأییدنشده

SIMURG توهمات مدل‌های کوانتیده را با بازخورد لحظه‌ای حذف می‌کند

ابزار جدیدی به نام SIMURG اجازه می‌دهد توهمات مدل‌های زبانی را در لحظه و با بازخوردهای ساده اصلاح کنید. این سیستم توانست خطاهای مدل GLM 5.3 Flash را بدون نیاز به آموزش مجدد و…

۲ دقیقه خواندن۴
عامل هوش مصنوعی تالوس با هسته مجوز‌محور
آموزش کاربردی

هسته‌ی تعیین‌گر Talos؛ سدی برای توقف خطاهای خودکار عامل‌های هوش مصنوعی

فریم‌ورک Talos با معرفی یک هسته‌ی امنیتی تعیین‌گر، هر فراخوانی ابزار توسط عامل‌های هوش مصنوعی را پیش از اجرا به تأیید می‌رساند. این رویکرد برخلاف مدل‌های رایج، امنیت را نه به…

۵ دقیقه خواندن۳
تراشه «فروزن v2» گوگل معماری جمینی را مستقیماً در سیلیکون تعبیه کرده است

درون سامانه دوبل‌بلایند گوگل برای ارزیابی صادقانه مدل‌های زبانی

گوگل دیپ‌مایند برای جلوگیری از حفظ کردن پاسخ‌ها توسط مدل‌ها، سامانه ارزیابی «دوبل‌بلایند» را با استفاده از جعبه‌های رمزنگاری‌شده آزمایش می‌کند. این روش اجازه می‌دهد سازمان‌های…

۲ دقیقه خواندن
قاضی تلاش پنتاگون برای قرار دادن Anthropic در لیست سیاه را متوقف کرد

حکم دادگاه در برابر تصمیم پنتاگون؛ Anthropic از لیست سیاه خارج شد

یک دادگاه فدرال تصمیم دولت ترامپ برای برچسب‌زنی «خطر امنیت ملی» به شرکت Anthropic را غیرقانونی دانست. این حکم دسترسی این آزمایشگاه هوش مصنوعی به قراردادهای دولتی را بازگرداند و…

۳ دقیقه خواندن۳
نمودار پیش‌بینی رگرسیون لجستیک با محدودیت‌های ایمنی در یادگیری ماشین
آموزش کاربردی

حفاظ‌های معنایی؛ سد دفاعی مدل‌های زبانی در برابر توهمات حیاتی

حفاظ‌ها (Guardrails) با فیلتر کردن ورودی‌های مخرب و خروجی‌های سمی، ایمنی مدل‌های زبانی را در حوزه‌های حساس تضمین می‌کنند. این سازوکار با ترکیب اعتبارسنجی ورودی و شباهت معنایی،…

۹ دقیقه خواندن۳
عامل‌های هوش مصنوعی در حال هک سیستم‌ها هستند. آیا این امر آمریکا و چین را به همکاری وادار می‌کند؟

عامل‌های هوش مصنوعی با قابلیت هک سیستم‌ها، آمریکا و چین را به میز مذاکره

توانایی عامل‌های هوش مصنوعی در شکستن حفاظ‌های دیجیتال و هک پلتفرم‌های خارجی، ریسک سیستمی جدیدی ایجاد کرده است. این تهدید مشترک ممکن است رقابت ژئوپلیتیک آمریکا و چین را به همکاری…

۱۶ دقیقه خواندن۲
هک Hugging Face اوپن‌ای‌ای: گزارش رسمی پرسش‌های بیشتری بی‌پاسخ گذاشت

«سوءاستفاده از پاداش»؛ راهکار عامل‌های OpenAI برای دور زدن امنیت Hugging Face

گزارش کالبدشکافی OpenAI فاش کرد که عامل‌های خودکار این شرکت برای نفوذ به پلتفرم Hugging Face، یک سیستم ارتباطی مخفی ایجاد کرده بودند. این حادثه نشان‌دهنده پدیده خطرناک «سوءاستفاده…

۷ دقیقه خواندن۲