پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۷۰ مقاله منتشر شده

کالیبره کردن داور زبانی بزرگ بر اساس قضاوت انسان پیش از اعتماد به آن
آموزش کاربردی

داوران هوش مصنوعی با اطمینان دروغ می‌گویند و معیارهای کیفیت را فریب می‌دهند

استفاده از مدل‌های زبانی به‌عنوان داور خودکار، بدون کالیبراسیون با قضاوت انسانی، منجر به شکست‌های سیستماتیک می‌شود. این داوران اغلب به‌جای صحت پاسخ، به طول متن یا ترتیب ارائه جواب…

۱ دقیقه خواندن۱
لوگوی تری‌هک می و عنوان رایتاپ اتاق Guestbook، شامل پرچم‌های پرچمی و آیکون‌های امنیت سایبری.
آموزش کاربردی

تحلیل VERA AI: یک نقص اعتبارسنجی، اجرای دستورات سیستمی را ممکن کرد

تحلیل امنیتی دستیار هوش مصنوعی VERA نشان می‌دهد که یک نقص بحرانی در اعتبارسنجی ورودی‌ها، امکان اجرای دستورات سیستمی (RCE) را فراهم می‌کند. مهاجمان با جعل مجوزهای مدیریتی از طریق…

۷ دقیقه خواندن۲
انسان‌های نظارت‌کننده، یک‌سوم درخواست‌های خطرایی هوش مصنوعی را از دست می‌دهند

یک‌سوم دستورات خطرناک عامل‌های کدنویس با تایید برنامه‌نویسان اجرا می‌شوند

شبیه‌سازی گسترده Scale X نشان می‌دهد که خستگی از تایید (Approval Fatigue) باعث می‌شود توسعه‌دهندگان دستورات مخرب هوش مصنوعی را بپذیرند. این داده‌ها مدل امنیتی «انسان در حلقه» را…

۶ دقیقه خواندن
شکایت اپل در بدترین زمان ممکن برای اوپن‌ای‌ای رخ داد

«توقف توسعه Astra»؛ واکنشی به عبور مدل از آستانه بحرانی سایبری

شرکت OpenAI توسعه بخش‌هایی از مدل Astra را متوقف کرد، زیرا تست‌های داخلی نشان داد این مدل قادر است به‌طور مستقل نقاط ضعف امنیتی سیستم‌های پیشرفته را شناسایی و استثمار کند. این…

۳ دقیقه خواندن۱
حالت خودکار Claude Code به‌صورت پیش‌فرض فعال شد تا توسعه‌دهندگان از تأییدهای اشتباه در امان باشند

دقت طبقه‌بندی‌کننده ایمنی Claude Code در برابر بازبین‌های انسانی

آنتروپیک حالت خودکار (Auto Mode) را برای اکثر طرح‌های Claude Code پیش‌فرض می‌کند تا سرعت توسعه افزایش یابد. آزمایش‌های داخلی نشان می‌دهد طبقه‌بندی‌کننده ایمنی این ابزار در شناسایی…

۲ دقیقه خواندن۲
ایمنی عامل هوش مصنوعی: جلوگیری از سرقت مدل و نشت کلید API
آموزش کاربردی

سیاست‌های گراف‌محور نشت داده‌ها و استخراج مدل از عامل‌های هوش مصنوعی را متوقف

عامل‌های هوش مصنوعی به‌دلیل دسترسی مستقل به ابزارها و پایگاه‌داده‌ها، مسیرهای جدیدی برای نشت کلیدهای API ایجاد کرده‌اند. رویکرد جدید TrustGraph با مدل‌سازی روابط اعتماد به‌صورت…

۳ دقیقه خواندن۲
آنتروپیک محدودیت‌های زیست‌شناسی فیبل ۵ را کاهش داد، اما محدودیت‌های ویروس‌شناسی و سم‌شناسی حفظ شد.

آنتروپیک: کاهش ۸۵ درصدی مسدودسازی‌های اشتباه در حوزه زیست‌شناسی

آنتروپیک با به‌روزرسانی فیلترهای ایمنی Fable 5، نرخ خطای مثبت در پرس‌وجوهای زیست‌شناسی را به‌شدت کاهش داد تا دسترسی به داده‌های پزشکی و آموزشی تسهیل شود. با این حال، محدودیت‌های…

۱ دقیقه خواندن
جیل لپور درباره «دولت مصنوعی» و چرا رهبران دره سیلیکون خوانندگان بد علمی‌تخیلی هستند.

جایگزینی دموکراسی با الگوریتم؛ هشدار جیل لپور درباره «دولت مصنوعی»

جیل لپور، مورخ دانشگاه هاروارد، هشدار می‌دهد که رهبران سیلیکون‌ولی در حال جایگزینی ساختارهای دموکراتیک با سیستم‌های شرکتی هوش مصنوعی هستند. او معتقد است تلقیِ «بهینه‌سازی فنی» به…

۲ دقیقه خواندن
پاسخ به مرز بعدی قابلیت‌های سایبری بحرانی

مدل Astra شرکت OpenAI به آستانهٔ خطرناکِ توسعهٔ اکسپلویت‌های صفرروزه رسید

مدل Astra توانایی شناسایی و توسعهٔ خودکار حفره‌های امنیتی (Zero-day) را پیدا کرده است. OpenAI برای جلوگیری از سوءاستفاده، دسترسی‌های داخلی را محدود و نظارت بر زنجیره تفکر مدل را…

۳ دقیقه خواندن
تصویر: یک ربات در حال تایپ روی صفحه‌کلید با پس‌زمینه‌ای از کدهای رایانه‌ای سبز رنگ

دانشمندان با هوش مصنوعی ۱۶ ویروس کاملاً جدید را از صفر طراحی کردند

پژوهشگران برای نخستین بار با استفاده از مدل‌های آموزش‌دیده بر روی توالی‌های DNA، ۱۶ ژنوم ویروسی کاملاً جدید خلق کردند. اگرچه این سویه‌ها فعلاً خطری برای انسان ندارند، اما این…

۴ دقیقه خواندن