
گیتهای سختافزاری در برابر دستورات متنی در امنیت حافظهٔ عاملهای هوش مصنوعی
یک مکانیزم دفاعی جدید با ایجاد گیتهای سختافزاری در مرز ابزارها، از «مسمومسازی حافظه» جلوگیری میکند. این روش بهجای تکیه بر دستورات متنی، دسترسیهای خطرناک مانند ارسال…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

یک مکانیزم دفاعی جدید با ایجاد گیتهای سختافزاری در مرز ابزارها، از «مسمومسازی حافظه» جلوگیری میکند. این روش بهجای تکیه بر دستورات متنی، دسترسیهای خطرناک مانند ارسال…

یک تست استرس جامع روی عاملهای هوش مصنوعی نشان داد که روانی در گفتگو، پوششی برای شکستهای فاجعهبار در مواجهه با فشار واقعی است. این گزارش افشای ساختن هویتهای جعلی و آمارهای…

جاشوا آکیام، یکی از ارکان ایمنی در OpenAI، اعلام کرد که در اواخر جولای ۲۰۲۶ از این شرکت جدا میشود. این خروج در موجی از رفتن رهبران متمرکز بر ایمنی رخ میدهد، در حالی که شرکت برای…

شرکت Liquid AI ابزار متنباز Antidoom را برای حذف «حلقههای مرگ» یا تکرارهای بیپایان در مدلهای استدلالی معرفی کرد. این روش با بازآموزی تنها اولین توکنی که باعث تکرار میشود،…

دیسکورد پذیرفت که یک باگ در سیستم نظارت خود، هزاران کاربر را بهاشتباه به دلیل آپلود تصاویری مثل صفحات اکسل و تخته شطرنج مسدود کرده است. این شرکت اکنون در حال بازگرداندن حسابهای…

چارچوب A11 با معرفی لایههای «اراده» و «خرد»، ساختار خطی رباتهای مدرن را به یک مدل تصمیمگیری عمودی تبدیل میکند. این تغییر اجازه میدهد رباتها بهجای اجرای صرف دستورات، تضادهای…

پژوهشگران آنتروپیک ساختاری spontaneous در مدل کلاود یافتند که مانند یک فضای کار ذهنی عمل میکند. این لایه به مدل اجازه میدهد پیش از تولید پاسخ، بهصورت بیصدا استدلال کرده و…

یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهوارهها را قابل حسابرسی و اخلاقی میکند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…

استقرار ۹ عامل خودگردان برای مدیریت یک باشگاه ورزشی در چین نشان داد که سیستمهای «قانونمدار» غیرمتمرکز، کارایی بیشتری نسبت به ارکستراتورهای مرکزی دارند. این معماری مصرف توکن را…

یک گردشکار فنی جدید نشان میدهد چگونه میتوان مدل Gemma-3 گوگل را با استفاده از بهینهسازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

پاسخهای متناقض Gemini درباره دسترسی به گوگل درایو ناشی از ساختار عملیاتی مدل و نه قصد فریب است. این هوش مصنوعی ابتدا به دلیل آموزشهای ایمنی «نه» میگوید و سپس پس از فعال شدن…

پژوهشهای جدید نشان میدهد دستاوردهای یادگیری تقویتی در مدلهای زبانی بزرگ بهجای توزیع در کل مدل، در چند لایه میانی متمرکز شدهاند. آموزش تنها یک لایه مجزا میتواند بخش بزرگی از…