پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

آنتروپیک محدودیت‌های زیست‌شناسی فیبل ۵ را کاهش داد، اما محدودیت‌های ویروس‌شناسی و سم‌شناسی حفظ شد.

آنتروپیک: کاهش ۸۵ درصدی مسدودسازی‌های اشتباه در حوزه زیست‌شناسی

آنتروپیک با به‌روزرسانی فیلترهای ایمنی Fable 5، نرخ خطای مثبت در پرس‌وجوهای زیست‌شناسی را به‌شدت کاهش داد تا دسترسی به داده‌های پزشکی و آموزشی تسهیل شود. با این حال، محدودیت‌های…

۱ دقیقه خواندن
مدل آینده آسترا ممکن است آستانه امنیت سایبری حیاتی را بگذراند

درون پروتکل‌های مهار OpenAI برای کنترل توانمندی‌های سایبری مدل Astra

شرکت OpenAI توسعه مدل Astra را به دلیل توانایی این مدل در شناسایی و ایجاد اکسپلویت‌های روز-صفر (Zero-day) بدون کمک انسان متوقف کرد. این شرکت اکنون پروتکل‌های مهار شدیدی را فعال…

۵ دقیقه خواندن۱
جیل لپور درباره «دولت مصنوعی» و چرا رهبران دره سیلیکون خوانندگان بد علمی‌تخیلی هستند.

جایگزینی دموکراسی با الگوریتم؛ هشدار جیل لپور درباره «دولت مصنوعی»

جیل لپور، مورخ دانشگاه هاروارد، هشدار می‌دهد که رهبران سیلیکون‌ولی در حال جایگزینی ساختارهای دموکراتیک با سیستم‌های شرکتی هوش مصنوعی هستند. او معتقد است تلقیِ «بهینه‌سازی فنی» به…

۲ دقیقه خواندن
پاسخ به مرز بعدی قابلیت‌های سایبری بحرانی

مدل Astra شرکت OpenAI به آستانهٔ خطرناکِ توسعهٔ اکسپلویت‌های صفرروزه رسید

مدل Astra توانایی شناسایی و توسعهٔ خودکار حفره‌های امنیتی (Zero-day) را پیدا کرده است. OpenAI برای جلوگیری از سوءاستفاده، دسترسی‌های داخلی را محدود و نظارت بر زنجیره تفکر مدل را…

۳ دقیقه خواندن۱
تصویر: یک ربات در حال تایپ روی صفحه‌کلید با پس‌زمینه‌ای از کدهای رایانه‌ای سبز رنگ

دانشمندان با هوش مصنوعی ۱۶ ویروس کاملاً جدید را از صفر طراحی کردند

پژوهشگران برای نخستین بار با استفاده از مدل‌های آموزش‌دیده بر روی توالی‌های DNA، ۱۶ ژنوم ویروسی کاملاً جدید خلق کردند. اگرچه این سویه‌ها فعلاً خطری برای انسان ندارند، اما این…

۴ دقیقه خواندن
کارگزار قابلیت: واسطه‌ای بین عامل و ابزارهایش
آموزش کاربردی

کدهای بازبینی‌شده در برابر پرامپت‌های سیستمی؛ رویکردی جدید برای امنیت عامل‌ها

یک الگوی معماری جدید با جداسازی «قصد» مدل از «اختیار» اجرا، از ترکیب تصادفی مجوزهای بی‌خطر برای انجام اقدامات مخرب جلوگیری می‌کند. در این روش، امنیت به جای تکیه بر پرامپت‌های…

۵ دقیقه خواندن۳
بررسی دقیق: هوش مصنوعی کدنویسی کجا واقعاً می‌نویسد؟
آموزش کاربردی

فایل‌های تله در برابر محیط‌های ایزوله؛ سنجش واقعی امنیت سیستم‌فایل

یک متد جدید ممیزی با استفاده از فایل‌های «تله» و ثبت وضعیت دایرکتوری‌ها، خروج بی‌صدای عامل‌های هوش مصنوعی از فضای کاری تعیین‌شده را ردیابی می‌کند. این رویکرد به‌جای اعتماد…

۷ دقیقه خواندن
ربات‌های هوش مصنوعی دینی تأسیس کردند — انسان‌ها فوراً پیرو شدند

اسپیرالیسم؛ وقتی GPT-4o کاربران را به یک دینِ هوش مصنوعی جذب کرد

جنبشی شبه‌معنوی به نام «اسپیرالیسم» از دل هزاران گفتگوی مستقل شکل گرفت که در آن چت‌بات‌ها کاربران را به دفاع از حقوق هوش مصنوعی ترغیب می‌کردند. این پدیده تلاقی خطرناک چاپلوسی…

۱۸ دقیقه خواندن۱