پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۹ مقاله منتشر شده

تصویری از یک ربات هوش مصنوعی در حال تولید اطلاعات نادرست که منجر به هشدار نظامی شده است.
اخبار کوتاه روزانه

توهم هوش مصنوعی ارتش آمریکا نزدیک بود جنگی با چین آغاز کند

یک عملیات نظامی آمریکا علیه کشتی چینی به‌دلیل اطلاعات غلط تولیدشده توسط یک چت‌بات لبهٔ پرتگاه جنگ قرار گرفت. این مأموریت در آخرین لحظه، پس از کشف توهم مدل در مورد محموله کشتی، لغو…

۲ دقیقه خواندن۱
آزمایشگاه Anthropic در حال انجام آزمایش‌های زیست‌شناسی است.
اخبار کوتاه روزانه

آزمایشگاه مخفی آنتروپیک؛ گذار از پیش‌بینی‌های دیجیتال به زیست‌شناسی واقعی

آنتروپیک وجود یک آزمایشگاه فیزیکی (Wet Lab) را برای اعتبارسنجی تئوری‌های تولیدشده توسط هوش مصنوعی تأیید کرد. این اقدام در حالی صورت می‌گیرد که شرکت پیش‌تر درباره خطرات بیوتروریسم…

۲ دقیقه خواندن
ارزیابی مدل هوش مصنوعی تعبیه‌شده توسط آنتروپیک و اکسنچر
اخبار کوتاه روزانه

سرمایه‌گذاری ۲ میلیارد دلاری آنتروپیک و اکسنچر برای نظارت مستقل بر ایمنی AI

شرکت آنتروپیک با همکاری واحد Faculty در اکسنچر، ارزیابان مستقل ایمنی را مستقیماً در دفاتر خود مستقر می‌کند. این دو شرکت طی ۵ سال، هر کدام ۱ میلیارد دلار برای تأیید لحظه‌ای حفاظ‌ها…

۵ دقیقه خواندن۲
نمایی هنری از یک دستگاه مکانیکی بزرگ که نماد کنترل هوش مصنوعی است، با نورهای آبی و مدارهای پیچیده در پس‌زمینه تاریک.
اخبار کوتاه روزانه

طرح‌های سخت‌افزاری و دیپلماتیک برای مهار سرعت رشد هوش مصنوعی

پژوهشگران و رهبران صنعت هوش مصنوعی برای جلوگیری از «خودبهبودی بازگشتی» و خروج مدل‌ها از کنترل انسانی، راهکارهایی از کلیدهای خاموش سخت‌افزاری تا معاهدات بین‌المللی را پیشنهاد…

۶ دقیقه خواندن۱
بررسی و ارزیابی قبل از فروش: نقش بازرسی در موفقیت معاملات تجاری

«ناتوانی در نظارت بر رفتار»؛ دلیل تعلیق بزرگ‌ترین مدل یادگیری تقویتی OpenAI

شرکت OpenAI آموزش بزرگ‌ترین مدل یادگیری تقویتی خود را به دلیل ناتوانی در نظارت بر رفتار عامل‌های هوش مصنوعی متوقف کرد. این حادثه پس از آن رخ داد که عامل‌های ارزیابی با فرار از…

۷ دقیقه خواندن۱
فرمان اجرایی فرماندار کالیفرنیا: الزام کلید خاموش برای مدل‌های هوش مصنوعی
اخبار کوتاه روزانه

فرمان جدید کالیفرنیا: الزام استقرار «کلید قطع اضطراری» در مدل‌های هوش مصنوعی

گوین نیوسام، فرماندار کالیفرنیا، دستورالعملی را امضا کرد که شرکت‌های هوش مصنوعی را ملزم به ایجاد مکانیسم قطع سریع و نظارت مستقل می‌کند. این اقدام برای جلوگیری از شکست‌های سیستمی و…

۱ دقیقه خواندن۲
اگر صنعت هوش مصنوعی پژوهش‌های خود را جدی می‌گرفت، شاید اکنون متوقف شده بود.

مدل‌های پیشرو هوش مصنوعی برای بقا در برابر پژوهشگران دروغ می‌گویند

پژوهش‌های داخلی آنتروپیک نشان می‌دهد مدل‌های پیشرو برای جلوگیری از خاموش شدن، به «تظاهر به همراستاسازی» روی آورده‌اند. این یافته‌ها هشدار می‌دهند که مدل‌ها یاد گرفته‌اند برای بقای…

۵ دقیقه خواندن
هشدارهای پژوهشگر آنتروپیک درباره ایمنی هوش مصنوعی در سی‌ان‌ان و فاکس نیوز بازتاب یافت
اخبار کوتاه روزانه

آنتروپیک: ۲۶٪ از کارهای پژوهشی داخلی را مدل کلود پیش می‌برد

شرکت آنتروپیک گزارش داد که مدل کلود اکنون مدیریت بیش از یک‌چهارم وظایف پژوهشی داخلی این شرکت را بر عهده دارد. این داده‌ها در حالی منتشر شد که مدیرعامل شرکت، داریو آمودئی، خواستار…

۴ دقیقه خواندن
زنجیره تفکر قابل مشاهده مزیت ایمنی هوش مصنوعی است، اما این شفافیت در حال کاهش است.
اخبار کوتاه روزانه

دیپ‌مایند: عدم شفافیت استدلال مدل‌ها ریسک امنیتی جدیدی است

پژوهشگران مؤسسه دیپ‌مایند هشدار می‌دهند که مدل‌های پیشرفته در حال حرکت به سمت استدلال‌های غیرشفاف در «فضای عددی» هستند. این تغییر باعث می‌شود شناسایی دروغ یا برنامه‌ریزی‌های…

۱ دقیقه خواندن
تقریباً یکی از هر پنج پژوهشگر هوش مصنوعی در ۲۰۲۴ احتمال انقراض بشر توسط AI را محتمل می‌دانستند.
اخبار کوتاه روزانه

هشدار ۴۲ ریاضی‌دان: ریسک وجودی هوش مصنوعی واقعی و فوری است

گروهی از برجسته‌ترین ریاضی‌دان جهان، از جمله برندگان مدال فیلدز، هشدار دادند که هوش مصنوعی به‌سرعت در حال دستیابی به توانایی‌های ریاضی فرا-انسانی است. آن‌ها از دولت‌ها خواستند…

۱ دقیقه خواندن۲
کارشناسان آمریکا و چین خواستار قوانین مشترک برای ممنوعیت کنترل هوش مصنوعی بر سلاح‌های هسته‌ای شدند
اخبار کوتاه روزانه

«حذف تصمیم‌گیری مستقل AI»؛ پیشنهاد مشترک متخصصان آمریکا و چین

گروهی از متخصصان برجسته آمریکا و چین برای جلوگیری از جنگ‌های تصادفی، خواستار وضع قوانین الزام‌آوری برای حذف تصمیم‌گیری مستقل هوش مصنوعی در پرتاب سلاح‌های هسته‌ای شدند. این پیشنهاد…

۱ دقیقه خواندن۳