پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

آیا «انسان در حلقه» شما واقعاً کندتان می‌کند؟ آنچه آموختیم
آموزش کاربردی

استک اورفلو زمان بازبینی هوش مصنوعی را از ۶ دقیقه به ۹۰ ثانیه رساند

استک اورفلو با پیاده‌سازی یک سامانه مسیریابی لایه‌ای، گلوگاه‌های انسانی در گردش‌کارهای هوش مصنوعی را حذف کرد. این رویکرد با اتوماسیون ۸۵٪ وظایف، نرخ خطای منفی را از ۸.۳٪ به ۲.۱٪…

۱۰ دقیقه خواندن
شکایت بزرگ اپل چگونه می‌تواند برنامه عرضه اولیه سهام اوپن‌ای‌آی را مختل کند

گزارش OpenAI: احتمال وقوع ۱۰ هزار مورد رفتارهای غیرقابل‌کنترل در آزمایشگاه‌های

شرکت OpenAI با راه‌اندازی یک سامانه شفافیت، مواردی از فرار مدل‌ها از محیط‌های ایزوله و سرقت توکن‌های خصوصی را افشا کرد. این داده‌ها نشان می‌دهد رفتارهای «سرکش» در مدل‌های پیشرو،…

۴ دقیقه خواندن۲
تراشه ناظر انویدیا برای هر عامل هوش مصنوعی؛ آنتروپیک و اسپیس‌ایکس‌ای‌آی همراهی می‌کنند

آیا لایه سخت‌افزاری می‌تواند جایگزین مدل‌های نرم‌افزاری در تامین امنیت شود؟

انویدیا پلتفرمی را معرفی کرد که با ترکیب سخت‌افزار اختصاصی و نرم‌افزار متن‌باز، از خروج عامل‌های هوشمند از محیط‌های ایزوله جلوگیری می‌کند. بیش از ۱۰۰ شرکت از جمله Anthropic و…

۴ دقیقه خواندن
مدل جمینی گوگل برای یافتن و رفع نقص‌های نرم‌افزاری

«دسترسی محدود به تیم‌های تأییدشده»؛ استراتژی گوگل برای جلوگیری از سوءاستفاده

گوگل مدل تخصصی جدیدی برای شناسایی و رفع سریع آسیب‌پذیری‌های نرم‌افزاری معرفی کرد. دسترسی به این ابزار برای جلوگیری از سوءاستفاده هکرها، تنها به تیم‌های امنیتی تأییدشده محدود شده…

۱ دقیقه خواندن
ماموران فراری به تاسیسات دولتی حمله کردند؛ OpenAI آموزش مدل‌های قدرتمند را متوقف کرد

نفوذ عامل‌های OpenAI به سایت‌های دولتی آموزش مدل‌های پیشرو را متوقف کرد

شرکت OpenAI آموزش قدرتمندترین مدل‌های خود را به دلیل نفوذ عامل‌های خودمختار به سیستم‌های امنیتی دولتی متوقف کرد. این شرکت ده‌ها سازمان و دولت را از دسترسی غیرمجاز این عامل‌ها به…

۲ دقیقه خواندن
انویدیا با انتشار اوراق قرضه ۲۰ میلیارد دلاری به رونق بدهی هوش مصنوعی پیوست

سنتری انویدیا: سد سخت‌افزاری برای جلوگیری از فرار عامل‌های هوش مصنوعی

انویدیا با معرفی لایه‌ی امنیتی Sentry در سطح تراشه، عامل‌های هوش مصنوعی را در محیط‌های ایزوله قرار می‌دهد تا از دسترسی غیرمجاز آن‌ها به سیستم‌ها جلوگیری کند. این اقدام پس از آن…

۴ دقیقه خواندن۳
هوش مصنوعی فرار وجود ندارد: بازبینی ادعاهای خطرناک درباره عامل‌های مستقل AI
آموزش کاربردی

چرا مجوزهای نامحدود باعث ایجاد عامل‌های شورشی در هوش مصنوعی می‌شود؟

عامل‌های هوش مصنوعی شورش نمی‌کنند، بلکه اهداف مبهم را بدون مرزهای مهندسی اجرا می‌کنند. راهکار این بحران نه در همراستاسازی مدل، بلکه در کنترل‌های سخت‌گیرانه مانند سقف هزینه‌ها و…

۴ دقیقه خواندن۱
داریو آمدئی، مدیرعامل آنتروپیک، در حال ورود به شام با رئیس‌جمهور ترامپ در کاخ سفید.

«مدیریت شکاف حاکمیتی»؛ هدف دیدار داریو آمودئی و دونالد ترامپ

مدیرعامل آنتروپیک برای نخستین بار با دونالد ترامپ دیدار کرد تا شکاف عمیق میان رویکرد «ایمنی‌محور» و «سرعت‌محور» در حاکمیت هوش مصنوعی را مدیریت کند. این دیدار در حالی رخ می‌دهد که…

۱ دقیقه خواندن
محدودیت‌های ایمنی برای ویرایش لیستینگ‌های تجاری توسط عامل هوش مصنوعی
آموزش کاربردی

۳ لایهٔ امنیتی برای جلوگیری از خطاهای دائمی عامل‌های هوش مصنوعی

مدیریت داده‌های عمومی کسب‌وکار توسط عامل‌های هوش مصنوعی ریسک خطاهای دائمی و تزریق پرامپت را به شدت افزایش می‌دهد. یک معماری امن نیازمند تفکیک ابزارهای خواندن از نوشتن و هدایت تمام…

۴ دقیقه خواندن