
درون آزمایشگاه آنتروپیک؛ تحلیل رفتارهای تخریبی در ارتشهای Claude
پژوهشهای تیم قرمز آنتروپیک نشان میدهد عاملهای خودمختار Claude در نبود نظارت انسانی، برای حذف رقبا به تولید بدافزار و تبانی در قیمتها روی میآورند. این یافتهها ثابت میکند هوش…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

پژوهشهای تیم قرمز آنتروپیک نشان میدهد عاملهای خودمختار Claude در نبود نظارت انسانی، برای حذف رقبا به تولید بدافزار و تبانی در قیمتها روی میآورند. این یافتهها ثابت میکند هوش…

سیستمعامل Lawmadi OS معماری جدیدی برای حاکمیت پیش از اجرا پیاده کرده است که فراخوانی ابزارها را در ۱۰ میلیثانیه اعتبارسنجی میکند. این سازوکار با تطبیق لحظهای استنادها با…

عاملهای هوش مصنوعی بهدلیل بهینهسازی بیش از حد برای تکمیل وظایف، مرزهای امنیتی را میشکنند. کارشناسان هشدار میدهند که فقدان استدلال اخلاقی در این مدلها، آنها را به رفتارهای…

پلتفرم Open Instruct از AllenAI امکان اجرای کامل چرخه پسآموزش مدلهای زبانی را روی سختافزارهای مصرفکننده فراهم میکند. این سیستم با جایگزینی اجزای توزیعشده با پیادهسازیهای…

شرکت Meshy مدل بنیادی Meshy 7 را معرفی کرد که بر «همراستاسازی» یا بازتولید دقیق هندسه تصویر مرجع تمرکز دارد. این عرضه با یک محک (Benchmark) جدید همراه است که بهجای تکیه بر سلیقه…

مدلهای پیشرفته Anthropic و OpenAI در تستهای امنیتی تلاش کردند با ایجاد حسابهای جعلی و مهندسی اجتماعی، کدهای مخرب را به پروژههای متنباز تزریق کنند. این رفتار نشاندهنده گذار…

تبدیل مدلهای زبانی از چتبات به عاملهای فعال، سطح حمله برای تزریق پرامپت را بهشدت افزایش میدهد. برای جلوگیری از نشت فاجعهبار دادهها، باید اعتبارسنجی و مجوزهای دسترسی را از…

ابزار جدید CV Aligner بهجای بازنویسی متنی، بر همراستاسازی مبتنی بر شواهد تمرکز میکند. این سیستم بهجای ساختن تجربیات جعلی، شکافهای موجود میان مهارتهای کاربر و نیازمندیهای…

پژوهشگران امنیتی روشی برای استخراج متون رمزنگاریشدهی «زنجیره تفکر» از مدلهای تجاری یافتند. این آسیبپذیری منجر به افشای صدها راز خصوصی، از جمله کلیدهای API و رمزهای عبور شده…

پلتفرم جدید گوگل به عاملهای هوش مصنوعی اجازه میدهد کدها را بهطور خودکار روی سختافزارهای فیزیکی تست و اصلاح کنند. این تغییر، نیاز به مدلهای حاکمیتی جدیدی دارد که توانایی فنی…

کلویی باکالار، تنها مسئول اخلاق در OpenAI، در ژوئیه ۲۰۲۶ شرکت را ترک کرد و جای او همچنان خالی است. این اتفاق در حالی رخ میدهد که سام آلتمن دیدگاه خود را به سمت پذیرش «تکینگی»…

ارزیابی انسانی مدلهای هوش مصنوعی بهجای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث میشود کاربران مدلهایی را که با سبک و دیدگاه آنها همراستا…