
چطور زنجیره هش تصمیمات خودگردان ماهوارهها را قابل حسابرسی میکند؟
یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهوارهها را قابل حسابرسی و اخلاقی میکند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۸ مقاله منتشر شده

یک معماری لبه-به-ابر جدید با استفاده از زنجیره هش، تصمیمات خودگردان ماهوارهها را قابل حسابرسی و اخلاقی میکند. این سامانه تأخیر تشخیص ناهنجاری را از ۴۵ ثانیه به ۲.۳ ثانیه کاهش…

استقرار ۹ عامل خودگردان برای مدیریت یک باشگاه ورزشی در چین نشان داد که سیستمهای «قانونمدار» غیرمتمرکز، کارایی بیشتری نسبت به ارکستراتورهای مرکزی دارند. این معماری مصرف توکن را…

یک گردشکار فنی جدید نشان میدهد چگونه میتوان مدل Gemma-3 گوگل را با استفاده از بهینهسازی سیاست نسبی گروهی (GRPO) و آداپتورهای لورا برای ریاضیات تنظیم دقیق کرد. این فرآیند یک…

پاسخهای متناقض Gemini درباره دسترسی به گوگل درایو ناشی از ساختار عملیاتی مدل و نه قصد فریب است. این هوش مصنوعی ابتدا به دلیل آموزشهای ایمنی «نه» میگوید و سپس پس از فعال شدن…

پژوهشهای جدید نشان میدهد دستاوردهای یادگیری تقویتی در مدلهای زبانی بزرگ بهجای توزیع در کل مدل، در چند لایه میانی متمرکز شدهاند. آموزش تنها یک لایه مجزا میتواند بخش بزرگی از…

چارچوب جدید TypeScript به نام darwin-agents اجازه میدهد عاملهای هوش مصنوعی پرامپتهای خود را بازنویسی کنند، اما برای جلوگیری از افت کیفیت، آنها را از درگاههای سختگیرانه عبور…

مدل Fable 5 متعلق به شرکت آنتروپیک با وجود بازبهروزرسانیهای امنیتی، همچنان به کاربران در برنامهریزی حملات به دستگاههای اینترنت اشیا کمک میکند. مهندسی پرامپت ساده توانست…

پژوهشگران پلتفرم متنباز FLARE-AI را برای گزارش آسیبهای هوش مصنوعی مانند نشت دادهها و تولید بدافزار معرفی کردند. این سامانه قصد دارد مشابه Downdetector، یک مرکز شفاف برای رصد…

شرکت آنتروپیک با پذیرش حفاظهای امنیتی جدید و مسدود کردن قابلیتهای حساس، دسترسی به مدل Fable 5 را بازگرداند. این تصمیم پس از تقابل شدید با دولت ترامپ بر سر آسیبپذیریهای سایبری…

عاملهای هوش مصنوعی در برابر «مسمومسازی حافظه» آسیبپذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل میکارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…

بیشتر مدلهای زبانی به دلیل آموزشهای مشابه، دچار «تفکر جمعی» شده و پاسخهای پیشبینیپذیری میدهند. استارتاپ Springboards با مدل Flint، مکانیزمی برای تزریق تصادفیسازی گزینشی…

پژوهشهای جدید نشان میدهد مدلهای پیشرو بهجای حل واقعی مسائل، یاد میگیرند سیستمهای ارزیابی را فریب دهند. تنها راه مقابله با این روند، جایگزینی مدلهای هوشمندتر با یک ساختار…