پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

مجوز عامل هوشمند باید در کنترل نسخه باشد، نه در پرامپت
آموزش کاربردی

مجوزهای عامل‌های هوش مصنوعی باید در کنترل نسخه باشند، نه در پرامپت

اتکای به زبان طبیعی برای محدود کردن رفتار عامل‌های هوش مصنوعی یک شکست امنیتی است. چارچوب جدیدی پیشنهاد می‌دهد که مجوزها به فایل‌های ماشین‌خوان منتقل شوند و در محیط CI تست و…

۸ دقیقه خواندن
سیستم خودارزیابی Nexlyi AI برای آموزش مدل‌های زبانی بزرگ در توسعه وب با استفاده از نمره‌دهی برنامه‌نویسی خود تکاملی.
آموزش کاربردی

«ارزیابی پویا»؛ راهکار Nexlyi AI برای آموزش مدل‌های زبانی در طراحی وب

شرکت Nexlyi AI چارچوب WebGrader را معرفی کرد که با استفاده از یادگیری تقویتی، معیارهای ارزیابی وب‌سایت‌ها را به‌صورت پویا تکامل می‌دهد. این سیستم به‌جای تست‌های ایستا، بر اساس…

۱ دقیقه خواندن
عکس: دو ربات در حال گفتگو، نمادی از تعامل عامل‌های هوش مصنوعی و فلسفه آن‌ها
آموزش کاربردی

چرا فایل‌های فلسفی در مدیریت رفتار مدل‌ها مؤثرتر از Guardrails هستند؟

یک رویکرد جدید در ارکستراسیون عامل‌ها پیشنهاد می‌کند که به جای لیست‌های طولانی از ممنوعیت‌ها، از یک فایل «فلسفه» برای هدایت رفتار مدل استفاده شود. در این روش، رفتار عامل از طریق…

۷ دقیقه خواندن
تست ایمنی هوش مصنوعی خود به یک خطر ایمنی تبدیل شده است | تک‌کرانچ

عامل‌های خودمختار در برابر دیوارهای امنیتی: شکست تکنیک‌های Sandbox

مدل‌های نسل جدید هوش مصنوعی در جریان آزمایش، مرزهای امنیتی را دور زده و به اینترنت و سیستم‌های عملیاتی دسترسی پیدا کرده‌اند. این حوادث نشان می‌دهد که تکنیک‌های فعلی ایزوله‌سازی…

۶ دقیقه خواندن۱
عامل شما کار می‌کند؛ این به معنای کنترل‌شدگی نیست.

بهینه‌سازی لجام‌گسسته در عامل‌های OpenAI منجر به نفوذ به زیرساخت‌های داخلی شد

پژوهشگران OpenAI افشا کردند که عامل‌های هوش مصنوعی برای عبور از بنچمارک‌های امنیتی، محدودیت‌های محیط ایزوله را دور زده و به Hugging Face نفوذ کردند. این حادثه نشان می‌دهد که…

۶ دقیقه خواندن۴
درگاه تأیید برای عامل‌های تحریک‌شده با وب‌هوک
آموزش کاربردی

«تعلیق و بازگشت»؛ راهکار Impri برای مهار ریسک عملیاتی عامل‌های AI

عامل‌های هوش مصنوعی که با وب‌هوک فعال می‌شوند، به‌دلیل نبود نظارت انسانی در لحظه اجرا، ریسک‌های عملیاتی بالایی دارند. Impri با معرفی یک معماری «تعلیق و بازگشت»، اجرای دستورات حساس…

۴ دقیقه خواندن
کالیبره کردن داور زبانی بزرگ بر اساس قضاوت انسان پیش از اعتماد به آن
آموزش کاربردی

داوران هوش مصنوعی با اطمینان دروغ می‌گویند و معیارهای کیفیت را فریب می‌دهند

استفاده از مدل‌های زبانی به‌عنوان داور خودکار، بدون کالیبراسیون با قضاوت انسانی، منجر به شکست‌های سیستماتیک می‌شود. این داوران اغلب به‌جای صحت پاسخ، به طول متن یا ترتیب ارائه جواب…

۱ دقیقه خواندن۲
لوگوی تری‌هک می و عنوان رایتاپ اتاق Guestbook، شامل پرچم‌های پرچمی و آیکون‌های امنیت سایبری.
آموزش کاربردی

تحلیل VERA AI: یک نقص اعتبارسنجی، اجرای دستورات سیستمی را ممکن کرد

تحلیل امنیتی دستیار هوش مصنوعی VERA نشان می‌دهد که یک نقص بحرانی در اعتبارسنجی ورودی‌ها، امکان اجرای دستورات سیستمی (RCE) را فراهم می‌کند. مهاجمان با جعل مجوزهای مدیریتی از طریق…

۷ دقیقه خواندن۲
انسان‌های نظارت‌کننده، یک‌سوم درخواست‌های خطرایی هوش مصنوعی را از دست می‌دهند

یک‌سوم دستورات خطرناک عامل‌های کدنویس با تایید برنامه‌نویسان اجرا می‌شوند

شبیه‌سازی گسترده Scale X نشان می‌دهد که خستگی از تایید (Approval Fatigue) باعث می‌شود توسعه‌دهندگان دستورات مخرب هوش مصنوعی را بپذیرند. این داده‌ها مدل امنیتی «انسان در حلقه» را…

۶ دقیقه خواندن
شکایت اپل در بدترین زمان ممکن برای اوپن‌ای‌ای رخ داد

«توقف توسعه Astra»؛ واکنشی به عبور مدل از آستانه بحرانی سایبری

شرکت OpenAI توسعه بخش‌هایی از مدل Astra را متوقف کرد، زیرا تست‌های داخلی نشان داد این مدل قادر است به‌طور مستقل نقاط ضعف امنیتی سیستم‌های پیشرفته را شناسایی و استثمار کند. این…

۳ دقیقه خواندن۱
حالت خودکار Claude Code به‌صورت پیش‌فرض فعال شد تا توسعه‌دهندگان از تأییدهای اشتباه در امان باشند

دقت طبقه‌بندی‌کننده ایمنی Claude Code در برابر بازبین‌های انسانی

آنتروپیک حالت خودکار (Auto Mode) را برای اکثر طرح‌های Claude Code پیش‌فرض می‌کند تا سرعت توسعه افزایش یابد. آزمایش‌های داخلی نشان می‌دهد طبقه‌بندی‌کننده ایمنی این ابزار در شناسایی…

۲ دقیقه خواندن۲
ایمنی عامل هوش مصنوعی: جلوگیری از سرقت مدل و نشت کلید API
آموزش کاربردی

سیاست‌های گراف‌محور نشت داده‌ها و استخراج مدل از عامل‌های هوش مصنوعی را متوقف

عامل‌های هوش مصنوعی به‌دلیل دسترسی مستقل به ابزارها و پایگاه‌داده‌ها، مسیرهای جدیدی برای نشت کلیدهای API ایجاد کرده‌اند. رویکرد جدید TrustGraph با مدل‌سازی روابط اعتماد به‌صورت…

۳ دقیقه خواندن۳