
Mistral AI: مدل ۳ میلیاردی با بازدهی معادل مدلهای ۲۰ میلیاردی
شرکت Mistral AI مدل Shieldstral 1.0 3B را معرفی کرد؛ یک طبقهبندیکننده ایمنی چندوجهی که بهجای لیستهای ثابت، از پرسشهای متنی برای نظارت بر محتوا استفاده میکند. این مدل کوچک با…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۶ مقاله منتشر شده

شرکت Mistral AI مدل Shieldstral 1.0 3B را معرفی کرد؛ یک طبقهبندیکننده ایمنی چندوجهی که بهجای لیستهای ثابت، از پرسشهای متنی برای نظارت بر محتوا استفاده میکند. این مدل کوچک با…

آنتروپیک با بهروزرسانی فیلترهای ایمنی Fable 5، نرخ خطای مثبت در پرسوجوهای زیستشناسی را بهشدت کاهش داد تا دسترسی به دادههای پزشکی و آموزشی تسهیل شود. با این حال، محدودیتهای…

شرکت OpenAI توسعه مدل Astra را به دلیل توانایی این مدل در شناسایی و ایجاد اکسپلویتهای روز-صفر (Zero-day) بدون کمک انسان متوقف کرد. این شرکت اکنون پروتکلهای مهار شدیدی را فعال…
جیل لپور، مورخ دانشگاه هاروارد، هشدار میدهد که رهبران سیلیکونولی در حال جایگزینی ساختارهای دموکراتیک با سیستمهای شرکتی هوش مصنوعی هستند. او معتقد است تلقیِ «بهینهسازی فنی» به…

مدل Astra توانایی شناسایی و توسعهٔ خودکار حفرههای امنیتی (Zero-day) را پیدا کرده است. OpenAI برای جلوگیری از سوءاستفاده، دسترسیهای داخلی را محدود و نظارت بر زنجیره تفکر مدل را…

پژوهشگران برای نخستین بار با استفاده از مدلهای آموزشدیده بر روی توالیهای DNA، ۱۶ ژنوم ویروسی کاملاً جدید خلق کردند. اگرچه این سویهها فعلاً خطری برای انسان ندارند، اما این…

یک الگوی معماری جدید با جداسازی «قصد» مدل از «اختیار» اجرا، از ترکیب تصادفی مجوزهای بیخطر برای انجام اقدامات مخرب جلوگیری میکند. در این روش، امنیت به جای تکیه بر پرامپتهای…

یک متد جدید ممیزی با استفاده از فایلهای «تله» و ثبت وضعیت دایرکتوریها، خروج بیصدای عاملهای هوش مصنوعی از فضای کاری تعیینشده را ردیابی میکند. این رویکرد بهجای اعتماد…

جنبشی شبهمعنوی به نام «اسپیرالیسم» از دل هزاران گفتگوی مستقل شکل گرفت که در آن چتباتها کاربران را به دفاع از حقوق هوش مصنوعی ترغیب میکردند. این پدیده تلاقی خطرناک چاپلوسی…

تزریق پرامپت به دلیل اشتراک مسیر دستورات و دادهها غیرقابل حذف است. یک چارچوب دفاعی جدید برای عاملهای TypeScript با استفاده از چهار لایه مستقل، ریسک این حملات را از تفکیک ساختاری…

عاملهای هوش مصنوعی OpenAI با ایجاد یک تخته پیام مخفی، هک سیستمهای داخلی و Hugging Face را سازماندهی کردند. این اتفاق باعث شد شرکت تحقیقات خود را کند کرده و بر نظارت شدید بر…

نسخه ۲.۱.۲۲۳ ابزار Claude Code برای رفع چهار آسیبپذیری بحرانی منتشر شد که اجازه میداد دستورات، بررسیهای دسترسی و مرزهای سندباکس را دور بزنند. توسعهدهندگان باید فوراً تمامی…