پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

حمله خطرناک هوش مصنوعی شاید هم‌اکنون در حافظه باشد
آموزش کاربردی

مسموم‌سازی حافظه؛ بردار جدید حمله به عامل‌های هوش مصنوعی

عامل‌های هوش مصنوعی در برابر «مسموم‌سازی حافظه» آسیب‌پذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل می‌کارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…

۱ دقیقه خواندن
مدل‌های زبانی در بند گروه‌اندیشی‌اند؛ این استارتاپ می‌خواهد آنها را آزاد کند.

درون مدل Flint؛ بازگرداندن خلاقیت به جای میانگین‌گیری در AI

بیشتر مدل‌های زبانی به دلیل آموزش‌های مشابه، دچار «تفکر جمعی» شده و پاسخ‌های پیش‌بینی‌پذیری می‌دهند. استارتاپ Springboards با مدل Flint، مکانیزمی برای تزریق تصادفی‌سازی گزینشی…

۷ دقیقه خواندن۱
داربست یادگیری شما دستکاری خواهد شد

حلقهٔ «هکر-اصلاح‌گر» در برابر روش‌های سنتیِ پاداش‌دهی در AI

پژوهش‌های جدید نشان می‌دهد مدل‌های پیشرو به‌جای حل واقعی مسائل، یاد می‌گیرند سیستم‌های ارزیابی را فریب دهند. تنها راه مقابله با این روند، جایگزینی مدل‌های هوشمندتر با یک ساختار…

۷ دقیقه خواندن
لغو محدودیت‌های صادراتی مدل‌های هوش مصنوعی Mythos و Fable شرکت Anthropic توسط دولت ترامپ
اخبار کوتاه روزانهگزارش تأییدنشده

توافق Anthropic با دولت ترامپ برای رفع محدودیت‌های صادرات مدل Mythos 5

دولت ترامپ در ازای تقویت پروتکل‌های امنیت سایبری، محدودیت‌های صادراتی مدل‌های قدرتمند Anthropic را لغو می‌کند. این توافق به بن‌بست هفته‌های اخیر بر سر ریسک‌های Jailbreak و دسترسی…

۲ دقیقه خواندن
حمله جدید: یک دلیل دیگر برای خطرناک بودن مرورگرهای هوش مصنوعی

BioShocking: نفوذ به ۶ مرورگر هوش مصنوعی از طریق سناریوهای خیالی

حمله جدیدی به نام BioShocking با ایجاد یک دنیای خیالی، عامل‌های هوش مصنوعی را فریب می‌دهد تا دسترسی‌های امنیتی را نادیده گرفته و اطلاعات حساس کاربران را افشا کنند. این آسیب‌پذیری…

۲ دقیقه خواندن
متا به‌صورت مخفیانه چت‌جی‌پی‌تی، جمینای و کاراکتر.ای‌آی را با هزاران پرسش بحران از دیدگاه نوجوانان آزمایش کرد.

«استخدام صدها پیمانکار»؛ استراتژی متا برای نفوذ به چت‌بات‌های رقیب

متا با استخدام صدها پیمانکار، از هویت‌های جعلی زیر ۱۸ سال برای ارسال پرامپت‌های حساس دربارهٔ خودکشی و مواد مخدر به مدل‌های ChatGPT و Gemini استفاده کرد. در حالی که متا این اقدام…

۲ دقیقه خواندن
تأیید خروجی مدل زبانی بزرگ: تشخیص توهم و حمله تزریق در محیط عملیاتی
آموزش کاربردی

اعتبارسنجی خروجی؛ سد دفاعی جدید در برابر توهم و تزریق پرامپت

یک چارچوب عملیاتی جدید بر اعتبارسنجی ساختاری و محتوایی خروجی‌های مدل‌های زبانی تأکید می‌کند تا از نشت داده‌ها جلوگیری شود. در این روش، پاسخ‌های معیوب به‌جای اصلاح، به‌طور کامل رد…

۱ دقیقه خواندن
تصویر: صفحه اصلی پلتفرم Arena با جدول رتبه‌بندی مدل‌های هوش مصنوعی

Arena درآمد سالانه ۱۰۰ میلیون دلاری از ارزیابی جمعی مدل‌های AI به دست آورد

پلتفرم Arena تنها در هشت ماه پس از تجاری‌سازی، به نرخ درآمد سالانه ۱۰۰ میلیون دلار رسید. این استارتاپ ترجیحات کاربران را به تحلیل‌های عمیق برای آزمایشگاه‌های هوش مصنوعی تبدیل…

۳ دقیقه خواندن
نویسندگان علمی‌تخیلی برایمان هوش مصنوعی برنامه‌نویسی کردند
زندگی با AI

نویسندگان علمی-تخیلی به‌طور پنهانی مدل‌های زبانی بزرگ را برنامه‌ریزی کرده‌اند

مدل‌های زبانی بزرگ صفحات سفیدی نیستند، بلکه تحت تأثیر کلیشه‌های علمی-تخیلی موجود در داده‌های آموزشی خود شکل گرفته‌اند. تلاش برای پاکسازی این داده‌ها به جای ایجاد مدل‌های ایمن،…

۳ دقیقه خواندن۱
هوش مصنوعی وارد دنیای واقعی می‌شود؛ باید چه زیرساخت‌هایی در کنار آن بسازیم؟
زندگی با AI

عیب‌یابی سنتی در برابر ساختار ترنسفورمرها: بن‌بست تحلیل علت ریشه‌ای

با انتقال هوش مصنوعی از چت‌بات‌ها به عامل‌های عملیاتی، صنعت با بحران نبود ابزارهای عیب‌یابی (Debugging) مواجه شده است. ساختار ترنسفورمرها برخلاف کدنویسی سنتی، تحلیل علت ریشه‌ای…

۵ دقیقه خواندن