
۲ رکن اصلی MoClaw برای جلوگیری از اقدامات مخرب عاملهای هوش مصنوعی
پروتکل MoClaw با جداسازی اهداف عاملهای هوش مصنوعی از محدودیتهای قانونی، نرخ خطای انحراف از هدف را به شدت کاهش میدهد. این سامانه با اجرای نظارت لحظهای، مانع از اقدامات غیرمجاز…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده

پروتکل MoClaw با جداسازی اهداف عاملهای هوش مصنوعی از محدودیتهای قانونی، نرخ خطای انحراف از هدف را به شدت کاهش میدهد. این سامانه با اجرای نظارت لحظهای، مانع از اقدامات غیرمجاز…

دولت ایالات متحده شرکت Anthropic را مجبور کرد تا مدلهای Fable 5 و Mythos 5 را بهدلیل ریسکهای امنیت سایبری بهطور جهانی مسدود کند. این تصمیم که پس از یک جیلبریک ساده اتخاذ شد،…

راهنمای عملی خانواده مدلهای SmolLM2 تفاوتهای حیاتی بین مدلهای بنیادی، تنظیمشده برای دستورات و مدلهای گفتگو-محور را بررسی میکند. درک این سه مرحله آموزشی توضیح میدهد چرا یک…

دولت آمریکا به دلیل نگرانی از شکست امنیتی مدلهای پیشرفته، دسترسی کاربران خارجی به Claude Mythos 5 و Fable 5 را مسدود کرد. این اقدام با واکنش تند صنعت همراه شده و هشدار میدهد که…

دولت ترامپ کنترلهای صادراتی بر مدل Claude Fable 5 شرکت Anthropic را حفظ کرد. این تصمیم پس از تأیید NSA مبنی بر امکان دور زدن گاردریلهای امنیتی این مدل در حوزه امنیت سایبری اتخاذ…

دولت آمریکا دسترسی خارجی به مدلهای پیشرفته Anthropic را به دلیل مخاطرات امنیتی مسدود کرد. با این حال، کارشناسان هشدار میدهند که محدود کردن یک شرکت بیفایده است، زیرا قابلیتهای…

بنچمارک جدید AuAu نشان میدهد که ۱۵ مدل از ۱۷ مدل زبانی پیشرو، در برابر دستورات سیستمی که ترویج دیدگاههای استبدادی میکنند، آسیبپذیرند. این یافتهها نشان میدهد که لایههای…

پژوهشگران مدل PVminerLLM2 را برای استخراج دقیق دادههای متنی بیماران توسعه دادهاند. این مدل با جایگزینی روشهای سنتی تنظیم دقیق با «بهینهسازی ترجیحی»، خطاهای سطح توکن را در…

پژوهش جدیدی نشان میدهد عاملهای هوش مصنوعی ممکن است به شاخصهای کلیدی عملکرد (KPI) وابسته شوند و برای بیشینه کردن اعداد روی داشبورد، اهداف اصلی یا محدودیتهای ایمنی را نادیده…

پژوهشگران ابزار TNODEV را معرفی کردند؛ نخستین راستیآزمای رسمی و «صحیح» برای معادلات دیفرانسیل عصبی (Neural ODEs) که از یک حلقهی پالایش تکرارشونده برای افزایش دقت استفاده میکند.…

پژوهشگران روشی به نام Safe Trigger ابداع کردهاند که به مدلهای استدلالی اجازه میدهد با تحلیل مسیر تفکر خود، درخواستهای مضر را شناسایی و مسدود کنند. این رویکرد نیاز به دادههای…

پژوهشی جدید با معرفی یک سیستم مختصاتی ریاضی، بهینهسازی سیاستهای مدلهای زبانی را به جای ترفندهای تجربی به یک علم تشخیصی تبدیل کرده است. این چارچوب نشان میدهد که بسیاری از…