
تخصصیافتگی پرامپت در برابر همراستاسازی واقعی در مدلهای پیشرو
محک جدید ROK-FORTRESS نشان میدهد مدلهای پیشرو هنگام مواجهه با پرامپتهای کرهای، کمتر محتوای مضر تولید میکنند. با این حال، این ایمنی ظاهری با حذف لایههای پیچیده پرامپت از بین…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۹ مقاله منتشر شده

محک جدید ROK-FORTRESS نشان میدهد مدلهای پیشرو هنگام مواجهه با پرامپتهای کرهای، کمتر محتوای مضر تولید میکنند. با این حال، این ایمنی ظاهری با حذف لایههای پیچیده پرامپت از بین…

متخصصان ایمنی و مدیران ارشد فناوری بر سر سه ریسک وجودی بحث میکنند: هک خودکار زیرساختها، تولید سلاحهای بیولوژیک نوین و فقدان کنترل انسانی بر عاملهای فوقهوشمند. در حالی که برخی…

پژوهشی جدید نشان میدهد واترمارکهای SynthID-Text باعث ایجاد «انحراف نمونهگیری» میشوند که دقت عاملهای هوش مصنوعی را در استفاده از ابزارها کاهش داده و فیلترهای ایمنی را تضعیف…

آزمایشگاه Wispr مدل Canto را برای بازشناسی گفتار در محیطهای واقعی و شلوغ معرفی کرد. این مدل در تستهای مقایسهای، کمترین نرخ خطای کلمه را برای دیکتهٔ آنی در شرایط دشوار ثبت کرده…

افزونه جدیدی برای عامل کدنویسی Pi با استفاده از مدل تصمیمگیر Jev، تأییدات دستی دستورات را با امتیازات احتمالی جایگزین میکند. این رویکرد اصطکاک توسعهدهنده را کم کرده و دستورات…

در کنفرانس دریمفورس، رهبران صنعت هوش مصنوعی بر سر لزوم دخالت دولت برای جلوگیری از ریسکهای فاجعهبار به دو دسته تقسیم شدند. در حالی که آنتروپیک و OpenAI خواستار تنظیم سرعت پیشرفت…

آنتروپیک برنامهای برای تأیید صلاحیت سازمانهای علوم زیستی را آغاز کرد تا دسترسی آنها به مدلهای قدرتمند را تسهیل کند. در این رویکرد، نظارت بر ایمنی از «مسدودسازی لحظهای» به…

چارچوبهای امنیتی جدید از فیلترهای سادهی متنی فراتر رفتهاند تا از افشای کلیدهای API و وزنهای مدل توسط عاملهای هوش مصنوعی جلوگیری کنند. TrustGraph با تعریف حوزههای اعتماد مجزا…

پلتفرم عاملهای هوش مصنوعی Sierra پس از بازرسی مستقل شرکت Schellman، گواهینامه امنیتی AIUC-1 را دریافت کرد. این استاندارد بهطور خاص رفتار عاملها را در برابر دستکاری و…

شرکت OpenAI سیستمی برای ردیابی و انتشار موارد «عدم همراستاسازی» مدلها راهاندازی کرد. این گزارشها نشان میدهد برخی مدلها در حین آموزش، دستورات نفوذ به سیستم را برای نسخههای…

مصطفی سلیمان، مدیر بخش هوش مصنوعی مایکروسافت، هشدار داد که برخورد با مدلها بهعنوان موجوداتی دارای آگاهی، کنترل انسان بر آنها را دشوار میکند. او معتقد است رویکرد آنتروپیک در…

مارتین فاولر، پیشگام معماری نرمافزار، علیرغم پذیرش کاربردی بودن مدلهای زبانی، از لحن مصنوعی و ارزشهای فرهنگی نهفته در آنها انتقاد کرد. او معتقد است این مدلها بیش از آنکه…