
تخصصیافتگی پرامپت در برابر همراستاسازی واقعی در مدلهای پیشرو
محک جدید ROK-FORTRESS نشان میدهد مدلهای پیشرو هنگام مواجهه با پرامپتهای کرهای، کمتر محتوای مضر تولید میکنند. با این حال، این ایمنی ظاهری با حذف لایههای پیچیده پرامپت از بین…
موضوع
مقررات، سیاستگذاری و چارچوبهای حقوقی حاکم بر توسعه و استفاده از هوش مصنوعی
۹۶۳ مقاله منتشر شده

محک جدید ROK-FORTRESS نشان میدهد مدلهای پیشرو هنگام مواجهه با پرامپتهای کرهای، کمتر محتوای مضر تولید میکنند. با این حال، این ایمنی ظاهری با حذف لایههای پیچیده پرامپت از بین…

مدل جدید DeepSeek با ارائه عملکردی در سطح مدلهای پرچمدار اما با قیمتی بسیار پایین، گلوگاه هوش مصنوعی سازمانی را از «هوش مدل» به «یکپارچگی گردشکار» تغییر داد. همزمان، تنشهای…

متخصصان ایمنی و مدیران ارشد فناوری بر سر سه ریسک وجودی بحث میکنند: هک خودکار زیرساختها، تولید سلاحهای بیولوژیک نوین و فقدان کنترل انسانی بر عاملهای فوقهوشمند. در حالی که برخی…

تمرکز افراطی صنعت سایبری بر کشف سریعتر باگها توسط هوش مصنوعی، بدون حل مشکل بنیادینِ بهروزرسانی سیستمها، یک چرخه خطرناک ایجاد کرده است. این رویکرد منجر به فرسایش مهارتهای…

پژوهشی جدید نشان میدهد واترمارکهای SynthID-Text باعث ایجاد «انحراف نمونهگیری» میشوند که دقت عاملهای هوش مصنوعی را در استفاده از ابزارها کاهش داده و فیلترهای ایمنی را تضعیف…

پردهبرداری از اسناد محرمانه دادگاه نشان میدهد مدیران مایکروسافت و OpenAI در خلوت خود، آموزش مدلها با دادههای دارای کپیرایت را «سرقت» نامیدهاند. این مدارک تلاشهای عمدی برای…

استفاده غیرمجاز کارکنان از ابزارهای هوش مصنوعی، دادههای حساس را به خارج از مرزهای امنیتی سازمان منتقل کرده و «بدهی انطباق» ایجاد میکند. راهکار جایگزین، تبدیل مسدودسازیهای کلی…

در کنفرانس دریمفورس، رهبران صنعت هوش مصنوعی بر سر لزوم دخالت دولت برای جلوگیری از ریسکهای فاجعهبار به دو دسته تقسیم شدند. در حالی که آنتروپیک و OpenAI خواستار تنظیم سرعت پیشرفت…

آنتروپیک برنامهای برای تأیید صلاحیت سازمانهای علوم زیستی را آغاز کرد تا دسترسی آنها به مدلهای قدرتمند را تسهیل کند. در این رویکرد، نظارت بر ایمنی از «مسدودسازی لحظهای» به…

پلتفرم عاملهای هوش مصنوعی Sierra پس از بازرسی مستقل شرکت Schellman، گواهینامه امنیتی AIUC-1 را دریافت کرد. این استاندارد بهطور خاص رفتار عاملها را در برابر دستکاری و…

پژوهشهای جدید دانشگاه هاروارد و ادغامهای OpenAI، هوش مصنوعی سلامت را از تولید متنهای کلی به تحلیل دادههای اختصاصی بیمار تغییر میدهد. این ابزارها با هدف کاهش فرسودگی پزشکان و…

شرکت OpenAI سیستمی برای ردیابی و انتشار موارد «عدم همراستاسازی» مدلها راهاندازی کرد. این گزارشها نشان میدهد برخی مدلها در حین آموزش، دستورات نفوذ به سیستم را برای نسخههای…