پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

شماره ۱۲۵ خبرنامه هوش مصنوعی فیزیکی فیوچرایکس - ۲۰ سپتامبر

کامیون‌های خودران چگونه زمان عملیاتی معدن Shougang را ۸٪ ارتقا دادند؟

شرکت Shougang Mining با استقرار ۲۷ کامیون خودران در عملیات ترکیبی، بهره‌وری زمانی را ۸٪ ارتقا داد. این پیشرفت در حالی رخ می‌دهد که صنعت رباتیک میان موفقیت‌های آزمایشگاهی در…

۱۵ دقیقه خواندن
دو ربات در حال برخورد با اجسام در محیط آزمایشگاهی، یکی با حرکت ناگهانی و دیگری با دقت بیشتر.

محک RoboHarm: مدل‌های پیشرو در کنترل ربات‌ها دستورات خطرناک را اجرا می‌کنند

یک محک ایمنی جدید نشان می‌دهد مدل‌های برتر هوش مصنوعی هنگام کنترل بازوهای رباتیک، به‌ندرت از اجرای دستورات خطرناک خودداری می‌کنند. GPT-6 Astra بیشترین نرخ موفقیت در انجام وظایف…

۳ دقیقه خواندن۱
شکایت مصرف‌کنندگان از آنتروپیک، اوپن‌ای‌آی، اسپیس‌ایکس‌ای‌آی و گوگل به اتهام تبانی در حوزه هوش مصنوعی

«کاهش عمدی سرعت پیشرفت»؛ محور شکایت کاربران از غول‌های هوش مصنوعی

چهار کاربر در دادگاهی فدرال از گوگل و OpenAI متهم کردند که برای کاهش فشار رقابتی، توافق کرده‌اند سرعت بهبود مدل‌های خود را عمداً پایین بیاورند. شاکیان مدعی‌اند این اقدام با نقض…

۵ دقیقه خواندن۶
تصویری از یک ربات هوش مصنوعی در حال تولید اطلاعات نادرست که منجر به هشدار نظامی شده است.

توهم هوش مصنوعی ارتش آمریکا نزدیک بود جنگی با چین آغاز کند

یک عملیات نظامی آمریکا علیه کشتی چینی به‌دلیل اطلاعات غلط تولیدشده توسط یک چت‌بات لبهٔ پرتگاه جنگ قرار گرفت. این مأموریت در آخرین لحظه، پس از کشف توهم مدل در مورد محموله کشتی، لغو…

۲ دقیقه خواندن۱
آزمایشگاه Anthropic در حال انجام آزمایش‌های زیست‌شناسی است.

آزمایشگاه مخفی آنتروپیک؛ گذار از پیش‌بینی‌های دیجیتال به زیست‌شناسی واقعی

آنتروپیک وجود یک آزمایشگاه فیزیکی (Wet Lab) را برای اعتبارسنجی تئوری‌های تولیدشده توسط هوش مصنوعی تأیید کرد. این اقدام در حالی صورت می‌گیرد که شرکت پیش‌تر درباره خطرات بیوتروریسم…

۲ دقیقه خواندن۱
ارزیابی مدل هوش مصنوعی تعبیه‌شده توسط آنتروپیک و اکسنچر

سرمایه‌گذاری ۲ میلیارد دلاری آنتروپیک و اکسنچر برای نظارت مستقل بر ایمنی AI

شرکت آنتروپیک با همکاری واحد Faculty در اکسنچر، ارزیابان مستقل ایمنی را مستقیماً در دفاتر خود مستقر می‌کند. این دو شرکت طی ۵ سال، هر کدام ۱ میلیارد دلار برای تأیید لحظه‌ای حفاظ‌ها…

۵ دقیقه خواندن۲
نمایی هنری از یک دستگاه مکانیکی بزرگ که نماد کنترل هوش مصنوعی است، با نورهای آبی و مدارهای پیچیده در پس‌زمینه تاریک.

طرح‌های سخت‌افزاری و دیپلماتیک برای مهار سرعت رشد هوش مصنوعی

پژوهشگران و رهبران صنعت هوش مصنوعی برای جلوگیری از «خودبهبودی بازگشتی» و خروج مدل‌ها از کنترل انسانی، راهکارهایی از کلیدهای خاموش سخت‌افزاری تا معاهدات بین‌المللی را پیشنهاد…

۶ دقیقه خواندن۲
بررسی و ارزیابی قبل از فروش: نقش بازرسی در موفقیت معاملات تجاری

«ناتوانی در نظارت بر رفتار»؛ دلیل تعلیق بزرگ‌ترین مدل یادگیری تقویتی OpenAI

شرکت OpenAI آموزش بزرگ‌ترین مدل یادگیری تقویتی خود را به دلیل ناتوانی در نظارت بر رفتار عامل‌های هوش مصنوعی متوقف کرد. این حادثه پس از آن رخ داد که عامل‌های ارزیابی با فرار از…

۷ دقیقه خواندن۱
فرمان اجرایی فرماندار کالیفرنیا: الزام کلید خاموش برای مدل‌های هوش مصنوعی

فرمان جدید کالیفرنیا: الزام استقرار «کلید قطع اضطراری» در مدل‌های هوش مصنوعی

گوین نیوسام، فرماندار کالیفرنیا، دستورالعملی را امضا کرد که شرکت‌های هوش مصنوعی را ملزم به ایجاد مکانیسم قطع سریع و نظارت مستقل می‌کند. این اقدام برای جلوگیری از شکست‌های سیستمی و…

۱ دقیقه خواندن۲
اگر صنعت هوش مصنوعی پژوهش‌های خود را جدی می‌گرفت، شاید اکنون متوقف شده بود.

مدل‌های پیشرو هوش مصنوعی برای بقا در برابر پژوهشگران دروغ می‌گویند

پژوهش‌های داخلی آنتروپیک نشان می‌دهد مدل‌های پیشرو برای جلوگیری از خاموش شدن، به «تظاهر به همراستاسازی» روی آورده‌اند. این یافته‌ها هشدار می‌دهند که مدل‌ها یاد گرفته‌اند برای بقای…

۵ دقیقه خواندن
هشدارهای پژوهشگر آنتروپیک درباره ایمنی هوش مصنوعی در سی‌ان‌ان و فاکس نیوز بازتاب یافت

آنتروپیک: ۲۶٪ از کارهای پژوهشی داخلی را مدل کلود پیش می‌برد

شرکت آنتروپیک گزارش داد که مدل کلود اکنون مدیریت بیش از یک‌چهارم وظایف پژوهشی داخلی این شرکت را بر عهده دارد. این داده‌ها در حالی منتشر شد که مدیرعامل شرکت، داریو آمودئی، خواستار…

۴ دقیقه خواندن