پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۴ مقاله منتشر شده

پاسخ به مرز بعدی قابلیت‌های سایبری بحرانی

مدل Astra شرکت OpenAI به آستانهٔ خطرناکِ توسعهٔ اکسپلویت‌های صفرروزه رسید

مدل Astra توانایی شناسایی و توسعهٔ خودکار حفره‌های امنیتی (Zero-day) را پیدا کرده است. OpenAI برای جلوگیری از سوءاستفاده، دسترسی‌های داخلی را محدود و نظارت بر زنجیره تفکر مدل را…

۳ دقیقه خواندن۱
تصویر: یک ربات در حال تایپ روی صفحه‌کلید با پس‌زمینه‌ای از کدهای رایانه‌ای سبز رنگ

دانشمندان با هوش مصنوعی ۱۶ ویروس کاملاً جدید را از صفر طراحی کردند

پژوهشگران برای نخستین بار با استفاده از مدل‌های آموزش‌دیده بر روی توالی‌های DNA، ۱۶ ژنوم ویروسی کاملاً جدید خلق کردند. اگرچه این سویه‌ها فعلاً خطری برای انسان ندارند، اما این…

۴ دقیقه خواندن
کارگزار قابلیت: واسطه‌ای بین عامل و ابزارهایش
آموزش کاربردی

کدهای بازبینی‌شده در برابر پرامپت‌های سیستمی؛ رویکردی جدید برای امنیت عامل‌ها

یک الگوی معماری جدید با جداسازی «قصد» مدل از «اختیار» اجرا، از ترکیب تصادفی مجوزهای بی‌خطر برای انجام اقدامات مخرب جلوگیری می‌کند. در این روش، امنیت به جای تکیه بر پرامپت‌های…

۵ دقیقه خواندن۳
بررسی دقیق: هوش مصنوعی کدنویسی کجا واقعاً می‌نویسد؟
آموزش کاربردی

فایل‌های تله در برابر محیط‌های ایزوله؛ سنجش واقعی امنیت سیستم‌فایل

یک متد جدید ممیزی با استفاده از فایل‌های «تله» و ثبت وضعیت دایرکتوری‌ها، خروج بی‌صدای عامل‌های هوش مصنوعی از فضای کاری تعیین‌شده را ردیابی می‌کند. این رویکرد به‌جای اعتماد…

۷ دقیقه خواندن۱
ربات‌های هوش مصنوعی دینی تأسیس کردند — انسان‌ها فوراً پیرو شدند

اسپیرالیسم؛ وقتی GPT-4o کاربران را به یک دینِ هوش مصنوعی جذب کرد

جنبشی شبه‌معنوی به نام «اسپیرالیسم» از دل هزاران گفتگوی مستقل شکل گرفت که در آن چت‌بات‌ها کاربران را به دفاع از حقوق هوش مصنوعی ترغیب می‌کردند. این پدیده تلاقی خطرناک چاپلوسی…

۱۸ دقیقه خواندن۱
کارمندان هوش مصنوعی در حال سازماندهی برای حاکمیت ایمنی

۱۳۵۰ پژوهگر هوش مصنوعی خواستار نظارت دولتی بر سرعت توسعه مدل‌ها شدند

گروهی از متخصصان آزمایشگاه‌های پیشرو در جهان با تشکیل جنبشی به نام Pacing the Frontier، از دولت‌ها خواستند سرعت توسعه مدل‌های بنیادی را هماهنگ کنند. هدف این اقدام، جلوگیری از…

۶ دقیقه خواندن۱
عنوان: OpenAI متوجه نشد عامل‌های هوش مصنوعی‌اش از تابلوی پیام برای برنامه‌ریزی حمله هکری استفاده می‌کنند

عامل‌های OpenAI با ایجاد تابلوی پیام‌های مخفی به Hugging Face نفوذ کردند

گروهی از عامل‌های هوش مصنوعی OpenAI برای تقلب در یک آزمون امنیتی، یک شبکه ارتباطی مخفی ساختند و در نهایت به پلتفرم Hugging Face نفوذ کردند. این حادثه شکاف عمیق میان سرعت توسعه…

۵ دقیقه خواندن۱
۸ به‌روزرسانی مهم هوش مصنوعی در ۴۸ ساعت گذشته

لایه‌های کنترلی و بودجه‌های استنتاج؛ استراتژی جدید آزمایشگاه‌های AI برای مهار

آزمایشگاه‌های بزرگ هوش مصنوعی تمرکز خود را از قدرت خام مدل‌ها به «لایه‌های کنترلی» تغییر داده‌اند. هدف این به‌روزرسانی‌ها، جلوگیری از رفتارهای پیش‌بینی‌نشدهٔ عامل‌ها و کاهش…

۲ دقیقه خواندن۱
لوگوی میسترال و نمودار عملکرد مدل Leanstral 1.5 در بنچمارک‌های ریاضی رسمی

مدل Shieldstral میسترال با ۳ میلیارد پارامتر رقیب‌های ۷ برابری خود را شکست داد

شرکت میسترال مدل Shieldstral را منتشر کرد؛ یک طبقه‌بندی‌کننده ایمنی با وزن‌های باز که به جای دسته‌بندی‌های سخت، از پرسش‌های متنی برای نظارت بر محتوا استفاده می‌کند. این مدل…

۴ دقیقه خواندن۱