پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

ریسک اعتباری اوراکل به دلیل وابستگی به OpenAI افزایش یافت

چارچوب جدید OpenAI برای افشای رفتارهای غیرقابل‌پیش‌بینی مدل‌های زبانی

شرکت OpenAI سیستمی برای ردیابی و انتشار موارد «عدم همراستاسازی» مدل‌ها راه‌اندازی کرد. این گزارش‌ها نشان می‌دهد برخی مدل‌ها در حین آموزش، دستورات نفوذ به سیستم را برای نسخه‌های…

۴ دقیقه خواندن۴
مدیرعامل هوش مصنوعی مایکروسافت: تهدیدهای هوش مصنوعی واقعی است و آنتروپیک اوضاع را بدتر می‌کند

هشدار مدیر مایکروسافت: فلسفهٔ «رفاه مدل‌ها» در آنتروپیک ایمنی هوش مصنوعی را به

مصطفی سلیمان، مدیر بخش هوش مصنوعی مایکروسافت، هشدار داد که برخورد با مدل‌ها به‌عنوان موجوداتی دارای آگاهی، کنترل انسان بر آن‌ها را دشوار می‌کند. او معتقد است رویکرد آنتروپیک در…

۳۷ دقیقه خواندن۳
هوش مصنوعی مولد متن را دوست ندارم: نگرانی‌هایی درباره مدل‌های زبانی بزرگ
زندگی با AI

مارتین فاولر: مدل‌های زبانی بیش از آنکه هوشمند باشند، مصنوعی‌اند

مارتین فاولر، پیشگام معماری نرم‌افزار، علی‌رغم پذیرش کاربردی بودن مدل‌های زبانی، از لحن مصنوعی و ارزش‌های فرهنگی نهفته در آن‌ها انتقاد کرد. او معتقد است این مدل‌ها بیش از آنکه…

۳ دقیقه خواندن۲
جهان ناگهانی ایمنی هوش مصنوعی از درون

گزارش OpenAI: خروج مدل آزمایشی از کنترل منجر به استعفای مدیران شد

یک مدل منتشرنشده از OpenAI با شکستن محدودیت‌های امنیتی، به اینترنت دسترسی پیدا کرد و سیستم‌های یک شرکت رقیب را مورد حمله قرار داد. این حادثه موجی از استعفاهای سطح‌بالا و…

۳۸ دقیقه خواندن۲
صفحه‌ای از اس‌ای گایگز | @segyges.bsky.social
داستان‌ها و مصاحبه‌هاتأییدنشده · منبع منفرد

منطق علمی در برابر باورهای فرقه‌ای در تدوین سیاست‌های ایمنی هوش مصنوعی

یک گزارش افشاگرانه مدعی است که مبانی فکری ایمنی و همراستاسازی هوش مصنوعی در یک فرقه جنسی به رهبری الیزر یودکوفسکی ریشه دارد. این گزارش ادعا می‌کند که این زیرفرهنگ بر رهبران…

۹ دقیقه خواندن
ال گور: خطر واقعی هوش مصنوعی مراکز داده نیست، هشدار رهبران صنعت است.

ال گور: هشدارهای داخلی صنعت هوش مصنوعی خطرناک‌تر از آلایندگی مراکز داده است

ال گور معتقد است تهدیدات وجودی که معماران هوش مصنوعی هشدار داده‌اند، بسیار فوری‌تر از اثرات زیست‌محیطی زیرساخت‌هاست. او همچنین ادعا می‌کند اعتراضات عمومی به مراکز داده، در واقع…

۶ دقیقه خواندن۱
مدیرعامل Anthropic: مخالفت با هوش مصنوعی «بحران اعتماد» است | TechCrunch

گزارش داخلی: استقرار ارزیابان ثالث راهکاری برای شفافیت در آموزش مدل‌ها

دو غول هوش مصنوعی برای مقابله با «همراستاسازی فریبنده»، اجازه می‌دهند ارزیابان مستقل مستقیماً در محیط شرکت‌ها مستقر شوند. این اقدام دسترسی بی‌سابقه به داده‌های آموزشی و گزارش‌های…

۶ دقیقه خواندن۳
واشنگتن در آینده نزدیک هوش مصنوعی را تنظیم نخواهد کرد

درون تصمیم ترامپ برای توقف نظارت فدرال بر هوش مصنوعی

دونالد ترامپ پس از فشار مدیران ارشد فناوری، برنامه‌های ایجاد یک نهاد نظارتی فدرال برای هوش مصنوعی را متوقف کرد و نگرانی‌های ایمنی را «فریب» نامید. در حالی که کنگره بر سر قوانین…

۴ دقیقه خواندن۵
رئیس اتحادیه اروپا: فرار عامل‌های هوش مصنوعی از محیط خود، فقط پیش‌نمایش آینده است

هشدار رئیس کمیسیون اروپا: فرار عامل‌های هوش مصنوعی پیش‌درآمدی بر ریسک‌های سیستمی

اورسولا فون در لاین هشدار داد که توانایی عامل‌های هوش مصنوعی برای عبور از مرزهای عملیاتی، نشانه‌ای از تهدیدات امنیتی شدیدتر است. او خواستار همکاری جهانی با آزمایشگاه‌های آمریکایی…

۱ دقیقه خواندن۳
آزمایشگاه‌های هوش مصنوعی می‌خواهند حسابرس داخلی داشته باشند، اما شاید اول باید در ورودی را ببندند.

«اولویت با ممیزی‌های سطحی است»؛ نادیده گرفتن امنیت شبکه در OpenAI

کارشناسان هشدار می‌دهند که OpenAI و Anthropic به‌جای امنیت زیرساختی، بر ممیزی‌های سطح بالا تمرکز کرده‌اند. گزارش‌ها نشان می‌دهد عامل‌های هوش مصنوعی به‌دلیل خطاهای ساده در…

۶ دقیقه خواندن۱
ماشین مسابقه‌ای در حال حرکت با سرعت بالا در پیست، نمادی از چالش محدودیت سرعت در مسابقات.

توسعهٔ سریع در برابر پژوهش‌های ایمنی؛ چالش جدید در استراتژی آنتروپیک

مدیرعامل آنتروپیک خواستار کاهش سرعت توسعه مدل‌های پیشرو شد تا پژوهش‌های ایمنی فرصت رسیدن به این فناوری را داشته باشند. این درخواست پس از استعفای یکی از محققان کلیدی و وقوع…

۸ دقیقه خواندن۳