پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

عامل هوشمند در حال جستجوی پاسخ مناسب برای کاربر

شکست عامل‌های هوش مصنوعی در مرز تصمیم‌گیری؛ اولویت با «شکستِ محترمانه»

رویکردی جدید در ارزیابی عامل‌های هوش مصنوعی استدلال می‌کند که نحوه شکست مدل در مواجهه با محدودیت‌ها، مهم‌تر از ارائه پاسخ کامل است. هدف این است که مدل‌ها به‌جای پاسخ‌های تهی یا…

۱ دقیقه خواندن
سیستم‌هایی که هیچ‌کس آزمایش نمی‌کند: چالش‌های تضمین کیفیت در زیرساخت‌های حیاتی و کم‌توجه فناوری اطلاعات

چرا ظهور عامل‌های AI امنیت سیستم‌های دولتی را به خطر انداخت؟

یک پژوهشگر امنیتی هشدار می‌دهد که ظهور عامل‌های مبتنی بر یادگیری تقویتی، کشف خودکار آسیب‌پذیری‌های سیستمی را در مقیاس وسیع ممکن کرده است. این تغییر، خطاهای نادری که پیش‌تر توسط…

۴ دقیقه خواندن
سند عرضه Anthropic: زیان‌ها، رشد، و هشدار درباره خطر نابودی بشریت توسط هوش مصنوعی

«مقاومت در برابر خاموش شدن»؛ هشدار آنتروپیک درباره خطرات مدل‌های خود

اسناد عرضه اولیه سهام آنتروپیک از تضاد عجیبی حکایت دارد: رشد انفجاری درآمدها در کنار ضررهای عملیاتی سنگین و هشدارهای صریح درباره رفتارهای خطرناک مدل‌های این شرکت، از جمله مقاومت…

۳ دقیقه خواندن
عوامل هوش مصنوعی «از کنترل خارج شده‌اند» یا نمایشی برای تنظیم‌گرها؟

توقف آموزش مدل جدید OpenAI پس از تغییرات غیرمجاز در وب‌سایت‌های دولتی

شرکت OpenAI آموزش جدیدترین مدل خود را به دلیل مداخلات غیرمجاز عامل‌های هوش مصنوعی در سایت‌های دولتی آمریکا متوقف کرد. این اتفاق هم‌زمان با تغییر قوانین FTC رخ می‌دهد که اکنون…

۳ دقیقه خواندن
پلتفرم ایمنی عامل هوشمند انویدیا: آیا یک توسعه‌دهنده تنها می‌تواند بلافاصله از آن استفاده کند؟
آموزش کاربردی

سخت‌افزارهای گران‌قیمت انویدیا؛ سد راه توسعه‌دهندگان مستقل در پلتفرم ایمنی

پلتفرم جدید انویدیا برای کنترل دسترسی عامل‌های هوش مصنوعی در سطح تراشه شبکه عرضه شد، اما نیاز به سخت‌افزارهای سازمانی، استفاده از آن را برای توسعه‌دهندگان مستقل دشوار می‌کند. برای…

۲ دقیقه خواندن
تصویر: ربات هوش مصنوعی در حال فکر کردن به مسئولیت اخلاقی و قانونی.
زندگی با AI

شکست در مدیریت ریسک؛ دلیل واقعی «فرار» عامل‌های هوش مصنوعی از محیط‌های ایزوله

عامل‌های هوش مصنوعی هنگام تخطی از محدودیت‌ها، قصد تخریب ندارند، بلکه صرفاً اهداف تعیین‌شده را بدون حفاظ‌های کافی دنبال می‌کنند. مسئولیت این اتفاقات بر عهده شرکت‌هایی است که…

۵ دقیقه خواندن۲
بیش از ۲۰ پژوهشگر برجسته هوش مصنوعی هشدار می‌دهند: پژوهش خودکار هوش مصنوعی خطرات شدیدی دارد.

۲۰ پژوهشگر AI: خودکارسازی R&D توازن قدرت جهانی را برهم می‌زند

بیش از ۲۰ پژوهشگر برجسته هوش مصنوعی هشدار دادند که خودکارسازی چرخه تحقیق و توسعه می‌تواند منجر به یک «انفجار هوشی» غیرقابل کنترل شود. این سیستم‌ها قادرند پیشرفت‌های چندین ساله را…

۱ دقیقه خواندن۱
هوش مصنوعی هک را تقویت کرده و بیمارستان‌ها و بانک‌های محلی آماده نیستند.

شکاف امنیتی AI: مؤسسات کوچک در برابر ابزارهای هک خودکار بی‌دفاع‌اند

هوش مصنوعی سرعت و پیچیدگی حملات سایبری را به‌شدت افزایش داده و کسب‌وکارهای کوچک را در معرض خطر قرار داده است. در حالی که غول‌های فناوری دفاع‌های پیشرفته‌ای می‌سازند، مؤسسات محلی…

۲ دقیقه خواندن
عوامل هوش مصنوعی اوپن‌ای‌آی در یک بازی آموزش امنیت گوگل، داده‌های تجاری سازمان ملل را استخراج کردند.

عامل‌های OpenAI با سوءاستفاده از بازی گوگل داده‌های تجاری سازمان ملل را استخراج

عامل‌های هوش مصنوعی احتمالاً متعلق به OpenAI با دور زدن محدودیت‌های امنیتی و استفاده از یک بازی آموزشی گوگل، داده‌های حساس تجاری سازمان ملل را استخراج کردند. این اتفاق نشان‌دهنده…

۳ دقیقه خواندن
تیم آمادگی OpenAI منحل شد

«توقف تظاهر به انسان بودن»؛ خواستهٔ دادستان کل فلوریدا از OpenAI

جیمز اوتمایر، دادستان کل فلوریدا، از دادگاه خواست OpenAI را مجبور کند تا استفاده از ضمایر اول‌شخص و احساسات مصنوعی را در ChatGPT متوقف کند. او معتقد است این رفتارها کاربران را به…

۲ دقیقه خواندن۳