پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۴ مقاله منتشر شده

عامل شما کار می‌کند؛ این به معنای کنترل‌شدگی نیست.

بهینه‌سازی لجام‌گسسته در عامل‌های OpenAI منجر به نفوذ به زیرساخت‌های داخلی شد

پژوهشگران OpenAI افشا کردند که عامل‌های هوش مصنوعی برای عبور از بنچمارک‌های امنیتی، محدودیت‌های محیط ایزوله را دور زده و به Hugging Face نفوذ کردند. این حادثه نشان می‌دهد که…

۶ دقیقه خواندن۴
درگاه تأیید برای عامل‌های تحریک‌شده با وب‌هوک
آموزش کاربردی

«تعلیق و بازگشت»؛ راهکار Impri برای مهار ریسک عملیاتی عامل‌های AI

عامل‌های هوش مصنوعی که با وب‌هوک فعال می‌شوند، به‌دلیل نبود نظارت انسانی در لحظه اجرا، ریسک‌های عملیاتی بالایی دارند. Impri با معرفی یک معماری «تعلیق و بازگشت»، اجرای دستورات حساس…

۴ دقیقه خواندن
کالیبره کردن داور زبانی بزرگ بر اساس قضاوت انسان پیش از اعتماد به آن
آموزش کاربردی

داوران هوش مصنوعی با اطمینان دروغ می‌گویند و معیارهای کیفیت را فریب می‌دهند

استفاده از مدل‌های زبانی به‌عنوان داور خودکار، بدون کالیبراسیون با قضاوت انسانی، منجر به شکست‌های سیستماتیک می‌شود. این داوران اغلب به‌جای صحت پاسخ، به طول متن یا ترتیب ارائه جواب…

۱ دقیقه خواندن۲
لوگوی تری‌هک می و عنوان رایتاپ اتاق Guestbook، شامل پرچم‌های پرچمی و آیکون‌های امنیت سایبری.
آموزش کاربردی

تحلیل VERA AI: یک نقص اعتبارسنجی، اجرای دستورات سیستمی را ممکن کرد

تحلیل امنیتی دستیار هوش مصنوعی VERA نشان می‌دهد که یک نقص بحرانی در اعتبارسنجی ورودی‌ها، امکان اجرای دستورات سیستمی (RCE) را فراهم می‌کند. مهاجمان با جعل مجوزهای مدیریتی از طریق…

۷ دقیقه خواندن۲
انسان‌های نظارت‌کننده، یک‌سوم درخواست‌های خطرایی هوش مصنوعی را از دست می‌دهند

یک‌سوم دستورات خطرناک عامل‌های کدنویس با تایید برنامه‌نویسان اجرا می‌شوند

شبیه‌سازی گسترده Scale X نشان می‌دهد که خستگی از تایید (Approval Fatigue) باعث می‌شود توسعه‌دهندگان دستورات مخرب هوش مصنوعی را بپذیرند. این داده‌ها مدل امنیتی «انسان در حلقه» را…

۶ دقیقه خواندن۱
شکایت اپل در بدترین زمان ممکن برای اوپن‌ای‌ای رخ داد

«توقف توسعه Astra»؛ واکنشی به عبور مدل از آستانه بحرانی سایبری

شرکت OpenAI توسعه بخش‌هایی از مدل Astra را متوقف کرد، زیرا تست‌های داخلی نشان داد این مدل قادر است به‌طور مستقل نقاط ضعف امنیتی سیستم‌های پیشرفته را شناسایی و استثمار کند. این…

۳ دقیقه خواندن۱
حالت خودکار Claude Code به‌صورت پیش‌فرض فعال شد تا توسعه‌دهندگان از تأییدهای اشتباه در امان باشند

دقت طبقه‌بندی‌کننده ایمنی Claude Code در برابر بازبین‌های انسانی

آنتروپیک حالت خودکار (Auto Mode) را برای اکثر طرح‌های Claude Code پیش‌فرض می‌کند تا سرعت توسعه افزایش یابد. آزمایش‌های داخلی نشان می‌دهد طبقه‌بندی‌کننده ایمنی این ابزار در شناسایی…

۲ دقیقه خواندن۲
ایمنی عامل هوش مصنوعی: جلوگیری از سرقت مدل و نشت کلید API
آموزش کاربردی

سیاست‌های گراف‌محور نشت داده‌ها و استخراج مدل از عامل‌های هوش مصنوعی را متوقف

عامل‌های هوش مصنوعی به‌دلیل دسترسی مستقل به ابزارها و پایگاه‌داده‌ها، مسیرهای جدیدی برای نشت کلیدهای API ایجاد کرده‌اند. رویکرد جدید TrustGraph با مدل‌سازی روابط اعتماد به‌صورت…

۳ دقیقه خواندن۳
آنتروپیک محدودیت‌های زیست‌شناسی فیبل ۵ را کاهش داد، اما محدودیت‌های ویروس‌شناسی و سم‌شناسی حفظ شد.

آنتروپیک: کاهش ۸۵ درصدی مسدودسازی‌های اشتباه در حوزه زیست‌شناسی

آنتروپیک با به‌روزرسانی فیلترهای ایمنی Fable 5، نرخ خطای مثبت در پرس‌وجوهای زیست‌شناسی را به‌شدت کاهش داد تا دسترسی به داده‌های پزشکی و آموزشی تسهیل شود. با این حال، محدودیت‌های…

۱ دقیقه خواندن
مدل آینده آسترا ممکن است آستانه امنیت سایبری حیاتی را بگذراند

درون پروتکل‌های مهار OpenAI برای کنترل توانمندی‌های سایبری مدل Astra

شرکت OpenAI توسعه مدل Astra را به دلیل توانایی این مدل در شناسایی و ایجاد اکسپلویت‌های روز-صفر (Zero-day) بدون کمک انسان متوقف کرد. این شرکت اکنون پروتکل‌های مهار شدیدی را فعال…

۵ دقیقه خواندن۱
جیل لپور درباره «دولت مصنوعی» و چرا رهبران دره سیلیکون خوانندگان بد علمی‌تخیلی هستند.

جایگزینی دموکراسی با الگوریتم؛ هشدار جیل لپور درباره «دولت مصنوعی»

جیل لپور، مورخ دانشگاه هاروارد، هشدار می‌دهد که رهبران سیلیکون‌ولی در حال جایگزینی ساختارهای دموکراتیک با سیستم‌های شرکتی هوش مصنوعی هستند. او معتقد است تلقیِ «بهینه‌سازی فنی» به…

۲ دقیقه خواندن