پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۸ مقاله منتشر شده

لغو محدودیت‌های صادراتی مدل‌های هوش مصنوعی Mythos و Fable شرکت Anthropic توسط دولت ترامپ
اخبار کوتاه روزانهگزارش تأییدنشده

توافق Anthropic با دولت ترامپ برای رفع محدودیت‌های صادرات مدل Mythos 5

دولت ترامپ در ازای تقویت پروتکل‌های امنیت سایبری، محدودیت‌های صادراتی مدل‌های قدرتمند Anthropic را لغو می‌کند. این توافق به بن‌بست هفته‌های اخیر بر سر ریسک‌های Jailbreak و دسترسی…

۲ دقیقه خواندن
حمله جدید: یک دلیل دیگر برای خطرناک بودن مرورگرهای هوش مصنوعی

BioShocking: نفوذ به ۶ مرورگر هوش مصنوعی از طریق سناریوهای خیالی

حمله جدیدی به نام BioShocking با ایجاد یک دنیای خیالی، عامل‌های هوش مصنوعی را فریب می‌دهد تا دسترسی‌های امنیتی را نادیده گرفته و اطلاعات حساس کاربران را افشا کنند. این آسیب‌پذیری…

۲ دقیقه خواندن
متا به‌صورت مخفیانه چت‌جی‌پی‌تی، جمینای و کاراکتر.ای‌آی را با هزاران پرسش بحران از دیدگاه نوجوانان آزمایش کرد.

«استخدام صدها پیمانکار»؛ استراتژی متا برای نفوذ به چت‌بات‌های رقیب

متا با استخدام صدها پیمانکار، از هویت‌های جعلی زیر ۱۸ سال برای ارسال پرامپت‌های حساس دربارهٔ خودکشی و مواد مخدر به مدل‌های ChatGPT و Gemini استفاده کرد. در حالی که متا این اقدام…

۲ دقیقه خواندن
تأیید خروجی مدل زبانی بزرگ: تشخیص توهم و حمله تزریق در محیط عملیاتی
آموزش کاربردی

اعتبارسنجی خروجی؛ سد دفاعی جدید در برابر توهم و تزریق پرامپت

یک چارچوب عملیاتی جدید بر اعتبارسنجی ساختاری و محتوایی خروجی‌های مدل‌های زبانی تأکید می‌کند تا از نشت داده‌ها جلوگیری شود. در این روش، پاسخ‌های معیوب به‌جای اصلاح، به‌طور کامل رد…

۱ دقیقه خواندن
تصویر: صفحه اصلی پلتفرم Arena با جدول رتبه‌بندی مدل‌های هوش مصنوعی

Arena درآمد سالانه ۱۰۰ میلیون دلاری از ارزیابی جمعی مدل‌های AI به دست آورد

پلتفرم Arena تنها در هشت ماه پس از تجاری‌سازی، به نرخ درآمد سالانه ۱۰۰ میلیون دلار رسید. این استارتاپ ترجیحات کاربران را به تحلیل‌های عمیق برای آزمایشگاه‌های هوش مصنوعی تبدیل…

۳ دقیقه خواندن
نویسندگان علمی‌تخیلی برایمان هوش مصنوعی برنامه‌نویسی کردند
زندگی با AI

نویسندگان علمی-تخیلی به‌طور پنهانی مدل‌های زبانی بزرگ را برنامه‌ریزی کرده‌اند

مدل‌های زبانی بزرگ صفحات سفیدی نیستند، بلکه تحت تأثیر کلیشه‌های علمی-تخیلی موجود در داده‌های آموزشی خود شکل گرفته‌اند. تلاش برای پاکسازی این داده‌ها به جای ایجاد مدل‌های ایمن،…

۳ دقیقه خواندن
هوش مصنوعی وارد دنیای واقعی می‌شود؛ باید چه زیرساخت‌هایی در کنار آن بسازیم؟
زندگی با AI

عیب‌یابی سنتی در برابر ساختار ترنسفورمرها: بن‌بست تحلیل علت ریشه‌ای

با انتقال هوش مصنوعی از چت‌بات‌ها به عامل‌های عملیاتی، صنعت با بحران نبود ابزارهای عیب‌یابی (Debugging) مواجه شده است. ساختار ترنسفورمرها برخلاف کدنویسی سنتی، تحلیل علت ریشه‌ای…

۵ دقیقه خواندن
انسان و هوش مصنوعی در کنار هم، نیرویی متحد برای آینده.
زندگی با AI

دقت ریاضی در برابر شبیه‌سازی خطا؛ تناقض جدید در تکامل مدل‌های زبانی

رویکردی جدید در تکامل AI پیشنهاد می‌کند که مدل‌ها به جای حذف خطا، یاد بگیرند چگونه رفتارهای انسانی، حتی اشتباهات را شبیه‌سازی کنند. این تغییر مسیر، نقش AI را از یک ابزار ساده به…

۲ دقیقه خواندن