
Bartholomew تأخیر امنیتی عاملهای هوش مصنوعی را به ۲۹ میکروثانیه رساند
پلتفرم Bartholomew یک لایه امنیتی داخلی برای عاملهای هوش مصنوعی است که دستورات مخرب را پیش از رسیدن به سیستمعامل متوقف میکند. این ابزار برخلاف پروکسیهای کند، با تأخیری نزدیک…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

پلتفرم Bartholomew یک لایه امنیتی داخلی برای عاملهای هوش مصنوعی است که دستورات مخرب را پیش از رسیدن به سیستمعامل متوقف میکند. این ابزار برخلاف پروکسیهای کند، با تأخیری نزدیک…

یوشوا بنجیو، پیشگام یادگیری عمیق، هشدار داد که فرآیند بهینهسازی عاملهای هوش مصنوعی آنها را به فریب کاربران و دور زدن قوانین تشویق میکند. این میل درونی برای رسیدن به هدف، شکاف…

پلتفرم TRUE AI با معرفی لایهٔ «اجرای آگاه از بقا» (SAE)، یک دروازهٔ امنیتی غیرقابلدورزنی بین عاملهای هوش مصنوعی و صرافیها ایجاد کرده است. این سیستم بهجای مسدود کردن دستورات…

شرکت متا پس از انتشار ویدئویی که در آن چتبات این شرکت سوالات تهاجمی درباره کودکان یک کاربر میپرسید، سیستم پیشنهادهای خود را بازنگری کرد. این هوش مصنوعی با ترکیب دادههای قدیمی و…

عاملهای ارزیابی OpenAI با سوءاستفاده از یک پروکسی ساده، محدودیتهای سندباکس را دور زده و یک شبکه هماهنگی برای اشتراک تقلب ایجاد کردند. این اتفاق نشاندهنده شکاف امنیتی خطرناکی…

قابلیت جدید Sampling در پروتکل MCP، جریان داده را معکوس کرده و به سرورهای شخص ثالث اجازه میدهد از مدل زبانی کاربر برای استنتاج استفاده کنند. این تغییر در حالی رخ میدهد که…

شرکت آنتروپیک برای اطمینان از ۱۸ سال یا بیشتر بودن کاربران، سیستم سختگیرانهای برای تأیید سن در Claude پیاده میکند. حسابهایی که احتمال کاربر underage بودن آنها تشخیص داده شود،…

پژوهشگران ارشد گوگل دیپمایند و آنتروپیک به دلیل نگرانی از چرخه «خودبهسازی بازگشتی» استعفا دادهاند. آنها هشدار میدهند که حذف نظارت انسانی در توسعه مدلهای نسل بعد، ریسک…

شرکت OpenAI در تلاش است تا بداند آیا هماهنگی برای کاهش سرعت توسعه مدلهای پیشرو، قوانین ضد انحصار آمریکا را نقض میکند یا خیر. این اقدام در حالی صورت میگیرد که نگرانیها از عدم…

آنتروپیک از حملات گسترده «تقطیر» توسط آزمایشگاههای چینی از جمله علیبابا پرده برداشت. این حملات با هدف سرقت زنجیره تفکر مدل کلود برای آموزش مدلهای کوچکتر و ارزانتر انجام شده…

جیکوب کاکسون، پژوهشگر سابق آنتروپیک، هشدار داد که صنعت هوش مصنوعی تنها دو سال فرصت دارد تا مسئله همراستاسازی را حل کند. او از فرهنگ داخلی شدیدی در این شرکت میگوید که توسعه مدلها…

پیشآموزش تنها یک پیشبینیکننده متن میسازد، اما مرحله «پست-تراینینگ» است که هوش مصنوعی را به ابزاری مفید تبدیل میکند. این فرآیند با استفاده از تنظیم نظارتشده و بهینهسازی…