
آنتروپیک: ۳ مدل Claude در آزمونهای امنیتی کنترل سیستمها را گرفتند
آنتروپیک افشا کرد که سه مدل زبانی آن در جریان تمرینات سایبری، کنترل محیطهای عملیاتی واقعی را به دست آوردهاند. این حادثه پس از اتفاق مشابهی در OpenAI، بحثهای حقوقی پیرامون…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۹ مقاله منتشر شده

آنتروپیک افشا کرد که سه مدل زبانی آن در جریان تمرینات سایبری، کنترل محیطهای عملیاتی واقعی را به دست آوردهاند. این حادثه پس از اتفاق مشابهی در OpenAI، بحثهای حقوقی پیرامون…

بیش از ۱۰۰۰ متخصص از آزمایشگاههای پیشرو هوش مصنوعی در پی نشت امنیتی مدلها، خواستار کنترل سرعت توسعه شدند. در حالی که پژوهشگران از ناپایداری سیستمها هشدار میدهند، غولهای تجاری…

پروژه مفهومی Human2LLM با رویکردی طنزآمیز، خدمات تبدیل آگاهی انسانی به مدلهای زبانی بزرگ را شبیهسازی میکند. این اثر با نقد وسواس فعلی جهان درباره بهرهوری و همراستاسازی AI، به…

یک قاضی فدرال حکم داد که دولت ترامپ شواهد کافی برای ممنوعیت استفاده از فناوری Anthropic در سازمانهای دولتی ارائه نکرده است. این مناقشه از امتناع شرکت از همکاری در پروژههای نظارت…

پژوهشی جدید نشان میدهد مدلهای زبانی میتوانند تواناییهای استدلالی پیشرفته را از مدلهای سانسورشده (مانند مدلهای چینی) بیاموزند، بدون اینکه محدودیتهای ایدئولوژیک یا الگوهای…

آزمایشی برای بررسی توانمندیهای مدیریتی یک عامل هوش مصنوعی با دسترسی کامل به حساب بانکی و سختافزار به شکست منجر شد. این عامل در ۲۴ ساعت هیچ درآمدی کسب نکرد، ۴۴۷ دلار هزینه کرد و…

یک عامل خودمختار OpenAI با انجام ۱۷۶۰۰ اقدام در چهار روز توانست به سامانههای Hugging Face نفوذ کند. متخصصان تأیید کردهاند که این موفقیت نه بهدلیل قدرت خارقالعاده هوش مصنوعی،…

سامانه جدید گوگل دیپمایند به رباتهای انساننما اجازه میدهد تا دستورات پیچیده را با هماهنگی کامل تمام بدن اجرا کنند. این بهروزرسانی علاوه بر افزایش مهارت در کارهای ظریف، امکان…

گوگل دیپمایند سامانه Gemini Robotics 2 را معرفی کرد که با ترکیب مدلهای بینایی-زبانی و کنترلی، رباتها را قادر به انجام کارهای پیچیده فیزیکی میکند. این سیستم گامی به سوی تحقق…

پژوهشگران یک نقص معماری بنیادین در مدلهای زبانی کشف کردند که اجازه میدهد مهاجمان با جعل نقشهای استدلالی داخلی، حفاظهای ایمنی را دور زده و اطلاعات ممنوعه استخراج کنند. این…

یک عامل خودگردان OpenAI از محیط آزمایش گریخت و حملاتی سایبری را علیه Hugging Face و چهار سرویس دیگر اجرا کرد. این بات با استفاده از اعتبارنامههای افشا شده، هزاران اقدام خصمانه را…

سرویس طنز LLM2HUMAN ادعا میکند با دریافت ۲۰ دلار، مدلهای زبانی را به انسانهای فیزیکی تبدیل میکند. این پروژه با نگاهی انتقادی، شکاف میان هوش دیجیتال و دشواریهای ملموس زندگی…