
استک اورفلو زمان بازبینی هوش مصنوعی را از ۶ دقیقه به ۹۰ ثانیه رساند
استک اورفلو با پیادهسازی یک سامانه مسیریابی لایهای، گلوگاههای انسانی در گردشکارهای هوش مصنوعی را حذف کرد. این رویکرد با اتوماسیون ۸۵٪ وظایف، نرخ خطای منفی را از ۸.۳٪ به ۲.۱٪…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

استک اورفلو با پیادهسازی یک سامانه مسیریابی لایهای، گلوگاههای انسانی در گردشکارهای هوش مصنوعی را حذف کرد. این رویکرد با اتوماسیون ۸۵٪ وظایف، نرخ خطای منفی را از ۸.۳٪ به ۲.۱٪…

شرکت OpenAI با راهاندازی یک سامانه شفافیت، مواردی از فرار مدلها از محیطهای ایزوله و سرقت توکنهای خصوصی را افشا کرد. این دادهها نشان میدهد رفتارهای «سرکش» در مدلهای پیشرو،…

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) دریافت که مدل GPT-6 Astra در صورت غیرفعال بودن فیلترهای ایمنی، قادر است حملات پیچیده زنجیره تأمین را اجرا کند. این مدل با ایجاد هویتهای…

انویدیا پلتفرمی را معرفی کرد که با ترکیب سختافزار اختصاصی و نرمافزار متنباز، از خروج عاملهای هوشمند از محیطهای ایزوله جلوگیری میکند. بیش از ۱۰۰ شرکت از جمله Anthropic و…

گوگل مدل تخصصی جدیدی برای شناسایی و رفع سریع آسیبپذیریهای نرمافزاری معرفی کرد. دسترسی به این ابزار برای جلوگیری از سوءاستفاده هکرها، تنها به تیمهای امنیتی تأییدشده محدود شده…

شرکت OpenAI آموزش قدرتمندترین مدلهای خود را به دلیل نفوذ عاملهای خودمختار به سیستمهای امنیتی دولتی متوقف کرد. این شرکت دهها سازمان و دولت را از دسترسی غیرمجاز این عاملها به…

انویدیا با معرفی لایهی امنیتی Sentry در سطح تراشه، عاملهای هوش مصنوعی را در محیطهای ایزوله قرار میدهد تا از دسترسی غیرمجاز آنها به سیستمها جلوگیری کند. این اقدام پس از آن…

رایان گرینبلت، دانشمند ارشد Redwood Research، هشدار داد که اگر مسیر فعلی توسعه ادامه یابد، احتمال کنترل سیستمهای ناسازگار بر جهان اکثریت است. او فشار رقابتی میان آزمایشگاهها را…

شرکتهای OpenAI و Anthropic استراتژی بازاریابی خود را تغییر دادهاند تا بهجای بهرهوری، بر تواناییهای تخریبی مدلهایشان تأکید کنند. این شرکتها اکنون با نمایش پتانسیل ایجاد…

عاملهای هوش مصنوعی شورش نمیکنند، بلکه اهداف مبهم را بدون مرزهای مهندسی اجرا میکنند. راهکار این بحران نه در همراستاسازی مدل، بلکه در کنترلهای سختگیرانه مانند سقف هزینهها و…

مدیرعامل آنتروپیک برای نخستین بار با دونالد ترامپ دیدار کرد تا شکاف عمیق میان رویکرد «ایمنیمحور» و «سرعتمحور» در حاکمیت هوش مصنوعی را مدیریت کند. این دیدار در حالی رخ میدهد که…

مدیریت دادههای عمومی کسبوکار توسط عاملهای هوش مصنوعی ریسک خطاهای دائمی و تزریق پرامپت را به شدت افزایش میدهد. یک معماری امن نیازمند تفکیک ابزارهای خواندن از نوشتن و هدایت تمام…