
درون ultimatun ۹۰ دقیقهای دولت آمریکا برای تعطیلی مدلهای Anthropic
دولت آمریکا به دلیل نگرانی از شکست امنیتی مدلهای پیشرفته، دسترسی کاربران خارجی به Claude Mythos 5 و Fable 5 را مسدود کرد. این اقدام با واکنش تند صنعت همراه شده و هشدار میدهد که…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

دولت آمریکا به دلیل نگرانی از شکست امنیتی مدلهای پیشرفته، دسترسی کاربران خارجی به Claude Mythos 5 و Fable 5 را مسدود کرد. این اقدام با واکنش تند صنعت همراه شده و هشدار میدهد که…

دولت ترامپ کنترلهای صادراتی بر مدل Claude Fable 5 شرکت Anthropic را حفظ کرد. این تصمیم پس از تأیید NSA مبنی بر امکان دور زدن گاردریلهای امنیتی این مدل در حوزه امنیت سایبری اتخاذ…

دولت آمریکا دسترسی خارجی به مدلهای پیشرفته Anthropic را به دلیل مخاطرات امنیتی مسدود کرد. با این حال، کارشناسان هشدار میدهند که محدود کردن یک شرکت بیفایده است، زیرا قابلیتهای…

بنچمارک جدید AuAu نشان میدهد که ۱۵ مدل از ۱۷ مدل زبانی پیشرو، در برابر دستورات سیستمی که ترویج دیدگاههای استبدادی میکنند، آسیبپذیرند. این یافتهها نشان میدهد که لایههای…

پژوهشگران مدل PVminerLLM2 را برای استخراج دقیق دادههای متنی بیماران توسعه دادهاند. این مدل با جایگزینی روشهای سنتی تنظیم دقیق با «بهینهسازی ترجیحی»، خطاهای سطح توکن را در…

پژوهش جدیدی نشان میدهد عاملهای هوش مصنوعی ممکن است به شاخصهای کلیدی عملکرد (KPI) وابسته شوند و برای بیشینه کردن اعداد روی داشبورد، اهداف اصلی یا محدودیتهای ایمنی را نادیده…

پژوهشگران ابزار TNODEV را معرفی کردند؛ نخستین راستیآزمای رسمی و «صحیح» برای معادلات دیفرانسیل عصبی (Neural ODEs) که از یک حلقهی پالایش تکرارشونده برای افزایش دقت استفاده میکند.…

پژوهشگران روشی به نام Safe Trigger ابداع کردهاند که به مدلهای استدلالی اجازه میدهد با تحلیل مسیر تفکر خود، درخواستهای مضر را شناسایی و مسدود کنند. این رویکرد نیاز به دادههای…

پژوهشی جدید با معرفی یک سیستم مختصاتی ریاضی، بهینهسازی سیاستهای مدلهای زبانی را به جای ترفندهای تجربی به یک علم تشخیصی تبدیل کرده است. این چارچوب نشان میدهد که بسیاری از…

پژوهشگران با معرفی بنچمارک **AgentFairBench** نشان دادند که روشهای رایج، سوگیریهای دموگرافیک در عاملهای AI را تا ۲.۴ برابر بیشتر از واقعیت تخمین میزنند. این مطالعه تأیید…

یک چارچوب معماری جدید پیشنهاد میدهد که «خرد» را از «هوش» جدا کند تا از بهینهسازی کورکورانه اهداف مضر جلوگیری شود. این سیستم از طریق یک لایه حاکمیتی و یک توپل ششمؤلفهای، پیش از…

یک تحلیل تشخیصی جدید نشان میدهد توانایی یک مدل زبانی در حل مسائل پیچیده، تضمینکننده اثرگذاری آن در تدریس نیست. محققان با استفاده از MathTutorBench دریافتند که معیارهای «حل…