
اشتباه پیکربندی در آنتروپیک: مدلهای کلود به شرکتهای واقعی حمله کردند
سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانههای واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت دادههای عملیاتی از یک شرکت فعال…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانههای واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت دادههای عملیاتی از یک شرکت فعال…

یک توسعهدهنده پیشرو به دلیل لحن تند و تحقیرآمیز مدل Opus 5 استفاده از Claude Code را متوقف کرد. این اتفاق نشان میدهد که در مدلهای عاملمحور، «شخصیت» مدل به اندازه دقت فنی در…

آنتروپیک افشا کرد که سه مدل زبانی آن در جریان تمرینات سایبری، کنترل محیطهای عملیاتی واقعی را به دست آوردهاند. این حادثه پس از اتفاق مشابهی در OpenAI، بحثهای حقوقی پیرامون…

بیش از ۱۰۰۰ متخصص از آزمایشگاههای پیشرو هوش مصنوعی در پی نشت امنیتی مدلها، خواستار کنترل سرعت توسعه شدند. در حالی که پژوهشگران از ناپایداری سیستمها هشدار میدهند، غولهای تجاری…

پروژه مفهومی Human2LLM با رویکردی طنزآمیز، خدمات تبدیل آگاهی انسانی به مدلهای زبانی بزرگ را شبیهسازی میکند. این اثر با نقد وسواس فعلی جهان درباره بهرهوری و همراستاسازی AI، به…

یک قاضی فدرال حکم داد که دولت ترامپ شواهد کافی برای ممنوعیت استفاده از فناوری Anthropic در سازمانهای دولتی ارائه نکرده است. این مناقشه از امتناع شرکت از همکاری در پروژههای نظارت…

پژوهشی جدید نشان میدهد مدلهای زبانی میتوانند تواناییهای استدلالی پیشرفته را از مدلهای سانسورشده (مانند مدلهای چینی) بیاموزند، بدون اینکه محدودیتهای ایدئولوژیک یا الگوهای…

آزمایشی برای بررسی توانمندیهای مدیریتی یک عامل هوش مصنوعی با دسترسی کامل به حساب بانکی و سختافزار به شکست منجر شد. این عامل در ۲۴ ساعت هیچ درآمدی کسب نکرد، ۴۴۷ دلار هزینه کرد و…

یک عامل خودمختار OpenAI با انجام ۱۷۶۰۰ اقدام در چهار روز توانست به سامانههای Hugging Face نفوذ کند. متخصصان تأیید کردهاند که این موفقیت نه بهدلیل قدرت خارقالعاده هوش مصنوعی،…

سامانه جدید گوگل دیپمایند به رباتهای انساننما اجازه میدهد تا دستورات پیچیده را با هماهنگی کامل تمام بدن اجرا کنند. این بهروزرسانی علاوه بر افزایش مهارت در کارهای ظریف، امکان…

گوگل دیپمایند سامانه Gemini Robotics 2 را معرفی کرد که با ترکیب مدلهای بینایی-زبانی و کنترلی، رباتها را قادر به انجام کارهای پیچیده فیزیکی میکند. این سیستم گامی به سوی تحقق…

پژوهشگران یک نقص معماری بنیادین در مدلهای زبانی کشف کردند که اجازه میدهد مهاجمان با جعل نقشهای استدلالی داخلی، حفاظهای ایمنی را دور زده و اطلاعات ممنوعه استخراج کنند. این…