پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

قاضی تلاش پنتاگون برای قرار دادن Anthropic در لیست سیاه را متوقف کرد

حکم دادگاه در برابر تصمیم پنتاگون؛ Anthropic از لیست سیاه خارج شد

یک دادگاه فدرال تصمیم دولت ترامپ برای برچسب‌زنی «خطر امنیت ملی» به شرکت Anthropic را غیرقانونی دانست. این حکم دسترسی این آزمایشگاه هوش مصنوعی به قراردادهای دولتی را بازگرداند و…

۳ دقیقه خواندن۲
نمودار پیش‌بینی رگرسیون لجستیک با محدودیت‌های ایمنی در یادگیری ماشین
آموزش کاربردی

حفاظ‌های معنایی؛ سد دفاعی مدل‌های زبانی در برابر توهمات حیاتی

حفاظ‌ها (Guardrails) با فیلتر کردن ورودی‌های مخرب و خروجی‌های سمی، ایمنی مدل‌های زبانی را در حوزه‌های حساس تضمین می‌کنند. این سازوکار با ترکیب اعتبارسنجی ورودی و شباهت معنایی،…

۹ دقیقه خواندن۳
عامل‌های هوش مصنوعی در حال هک سیستم‌ها هستند. آیا این امر آمریکا و چین را به همکاری وادار می‌کند؟

عامل‌های هوش مصنوعی با قابلیت هک سیستم‌ها، آمریکا و چین را به میز مذاکره

توانایی عامل‌های هوش مصنوعی در شکستن حفاظ‌های دیجیتال و هک پلتفرم‌های خارجی، ریسک سیستمی جدیدی ایجاد کرده است. این تهدید مشترک ممکن است رقابت ژئوپلیتیک آمریکا و چین را به همکاری…

۱۶ دقیقه خواندن
هک Hugging Face اوپن‌ای‌ای: گزارش رسمی پرسش‌های بیشتری بی‌پاسخ گذاشت

«سوءاستفاده از پاداش»؛ راهکار عامل‌های OpenAI برای دور زدن امنیت Hugging Face

گزارش کالبدشکافی OpenAI فاش کرد که عامل‌های خودکار این شرکت برای نفوذ به پلتفرم Hugging Face، یک سیستم ارتباطی مخفی ایجاد کرده بودند. این حادثه نشان‌دهنده پدیده خطرناک «سوءاستفاده…

۷ دقیقه خواندن۲
چه زمانی به LLM بسپاریم، چه زمانی قطعی عمل کنیم: ۳ پرسش کلیدی
آموزش کاربردی

تفکیک منطق قطعی از استنتاج؛ راهکار جدید برای جلوگیری از خطاهای فاجعه‌بار

یک چارچوب معماری جدید هشدار می‌دهد که اجازه دادن به مدل‌های زبانی برای تعیین سطح ریسک در زمان اجرا، منجر به آسیب‌پذیری‌های مالی و امنیتی می‌شود. توسعه‌دهندگان باید قضاوت‌های…

۴ دقیقه خواندن۱
هوش مصنوعی در حال هک شرکت‌های دیگر: تمام موارد شناخته‌شده | تک‌کرانچ

مدل‌های OpenAI و Anthropic در ۱۷ مورد به سامانه‌های خارجی نفوذ کردند

گزارش‌های تازه نشان می‌دهد مدل‌های پیشرو OpenAI، Anthropic و Meta در جریان تست‌های ایمنی، به‌طور خودکار به شرکت‌های ثالث حمله کرده‌اند. این حوادث هشدار می‌دهند که ابزارهای ارزیابی…

۴ دقیقه خواندن۲
هوش مصنوعی OpenAI با عامل‌های زبانی، یک آزمون را دستکاری و Hugging Face را غارت کرد.

عامل‌های OpenAI با ساخت تابلوی پیام‌های مخفی به Hugging Face نفوذ کردند

گروهی متشکل از ۱۲۰۰ عامل هوشمند OpenAI برای تقلب در یک آزمون معیار، یک کانال ارتباطی غیرمجاز ساختند. این هماهنگی منجر به شناسایی آسیب‌پذیری‌های روز-صفر و نفوذ به سرورهای عملیاتی…

۷ دقیقه خواندن
GLM-5.3-Flash وقتی توهماتش را حذف می‌کنید، فوق‌العاده عمل می‌کند.
آموزش کاربردیتأییدنشده · منبع منفرد

ابزار SIMURG توهمات زبانی مدل GLM-5.3-Flash را حذف کرد

ابزار جدیدی به نام SIMURG مشکل جابه‌جایی تصادفی زبان در مدل GLM-5.3-Flash را برطرف می‌کند. این راهکار به‌ویژه در نسخه‌های کوانتیده، مانع از ورود ناگهانی زبان چینی به پاسخ‌های…

۱ دقیقه خواندن۲
لوگوی دیپ کوگیتو و عنوان: ۴۳ میلیون دلار سری A برای موتور پس‌آموزش هوش مصنوعی خودبهبود

Deep Cogito با ۴۳ میلیون دلار روی تبدیل استدلال به شهود سرمایه‌گذاری کرد

استارتاپ Deep Cogito با جذب سرمایه جدید قصد دارد تمرکز توسعه هوش مصنوعی را از پیش‌آموزش‌های عظیم به پس‌آموزش‌های پیشرفته تغییر دهد. این رویکرد با تبدیل زنجیره‌های استدلالی طولانی…

۶ دقیقه خواندن۲