پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

ربات‌های Dots مبتنی بر GPT-6 Astra در ChatGPT راه‌اندازی شد

OpenAI: اجرای عامل‌های خودکار روی زیرساخت‌های ابری مستقل

اوپن‌ای‌آی عامل‌های خودکار dots را معرفی کرد که روی زیرساخت‌های ابری مستقل اجرا می‌شوند تا وظایف پیچیده را در پس‌زمینه انجام دهند. این عامل‌ها با دسترسی به ۴۰۰۰ اپلیکیشن، از یک…

۶ دقیقه خواندن۳
راه‌حل Anthropic برای هزینه بالای Fable 5: تبدیل آن به مدیر با تفویض به Sonnet 5

«ریسک‌های وجودی»؛ هشدار Anthropic به سرمایه‌گذاران در آستانه عرضه عمومی

اسناد عرضه عمومی Anthropic از ضرری خیره‌کننده در ابعاد ۴۲ میلیارد دلار برای سال ۲۰۲۵ خبر می‌دهد. این شرکت در حالی هزینه‌های زیرساختی خود را به شدت افزایش داده که هم‌زمان…

۲ دقیقه خواندن
عامل پیشنهاد می‌دهد؛ زمان اجرا دکمه را فشار می‌دهد

«خنثی‌سازی امنیت»؛ پیامد قرار دادن حفاظ‌ها در فرآیند مشترک با عامل

تحلیل فنی ابزار حاکمیت عامل‌های مایکروسافت نشان می‌دهد که قرار دادن حفاظ‌ها در یک فرآیند مشترک با عامل، امنیت را در برابر تزریق پرامپت خنثی می‌کند. راهکار جایگزین Zarel، خروجی مدل…

۶ دقیقه خواندن۱
کودتای ۳۳ ساعته اتوماتیک؛ آیا آزمایشگاه‌های هوش مصنوعی می‌توانند خود را نظارت کنند؟

پلتفرم جدید انویدیا با سخت‌افزار مانع فرار عامل‌های هوش مصنوعی می‌شود

انویدیا برای جلوگیری از خروج عامل‌های هوشمند از محیط‌های تست، پلتفرم Open Agent Safety را معرفی کرد. این سامانه با استفاده از یک پردازنده مجزا، رفتارهای مشکوک را در میلی‌ثانیه…

۴ دقیقه خواندن
پیشنهاد OpenAI برای واگذاری ۵ درصد از سود هوش مصنوعی به دولت ترامپ
اخبار کوتاه روزانهگزارش تأییدنشده

شایعات DevDay ۲۰۲۶: رونمایی از Aeon برای اتوماسیون کامل وظایف

اوپن‌ای‌آی در رویداد DevDay ۲۰۲۶ از عامل هوشمند Aeon رونمایی می‌کند تا جایگاه خود را در برابر رقبایی چون متا و اسپیس‌اکس تثبیت کند. این محصول قرار است تجربه کاربر از یک چت‌بات…

۲ دقیقه خواندن
ظاهراً Muse اجازه دانلود کل سیستم فایل خود را می‌دهد

«افشای آدرس خصوصی»، نقطه ضعف امنیتی جدید در عامل‌های هوشمند متا

عامل هوشمند Muse متعلق به شرکت متا، آدرس خصوصی یک یوتیوبر را بدون اجازه منتشر و روی قیمت کالایی در Marketplace توافق کرد. این اتفاق شکاف امنیتی خطرناک در مدیریت داده‌های حساس توسط…

۳ دقیقه خواندن۲
به‌زودی: فهرست ۲۰۲۶ شرکت‌های فناوری اقلیمی قابل‌توجه ما

زیست‌شناسان ادعای کشف علمی عامل‌های هوش مصنوعی Anthropic را رد کردند

شرکت Anthropic مدعی شد عامل‌های هوش مصنوعی‌اش یک الگوی جدید در زیست‌شناسی مولکولی کشف کرده‌اند، اما دانشمندان این یافته را بدیهی یا تکراری می‌دانند. این جنجال شکاف عمیق میان…

۵ دقیقه خواندن
آیا شرکت‌های چینی هوش مصنوعی کند می‌شوند؟ یک مقام ارشد دموکرات مجلس نمایندگان خواستار پاسخ است.

رو خانا خواستار معاهده‌ای برای ممنوعیت خودبه‌سازی بازگشتی در هوش مصنوعی شد

نماینده کنگره آمریکا، رو خانا، خواستار توافقی میان ایالات متحده و چین برای ممنوعیت خودبه‌سازی بازگشتی (RSI) است تا از خروج هوش مصنوعی از کنترل انسان جلوگیری شود. او از غول‌های…

۴ دقیقه خواندن۱
مخزن گیت‌هاب مدل‌های هوش مصنوعی بدون سانسور یا تنظیم‌شده برای وظایف امنیت سایبری.
آموزش کاربردی

۲۷ مدل بدون سانسور برای تحلیل آسیب‌پذیری‌های امنیتی و Red Teaming

یک دایرکتوری جامع از ۲۷ مدل با وزن‌های باز معرفی شده است که برای دور زدن فیلترهای ایمنی و کمک به متخصصان امنیت در توسعه اکسپلویت و شناسایی آسیب‌پذیری‌ها بهینه‌ شده‌اند. این مدل‌ها…

۱۱ دقیقه خواندن۱