پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

خلاصه روزانه هوش مصنوعی: هزینه محاسباتی اوپن‌ای‌ای، نقص مایکروسافت کوپایلت، عرضه اولیه یونیتری و افزایش قیمت سامسونگ

هزینهٔ نظارت بر ایمنی مدل‌های Astra و GPT-5.6 به ۲۰٪ کل محاسبات رسید

اوپن‌ای‌آی فاش کرد که نظارت بر ایمنی مدل‌های پیشرفته‌اش ۲۰٪ از توان محاسباتی استنتاج را می‌بلعد. این خبر در کنار جهش ۶۶ میلیارد دلاری ارزش Unitree و حفره‌های امنیتی بحرانی در…

۱۶ دقیقه خواندن۲
لوگوی OpenAI در کنار نماد قفل و سپر امنیتی، نماد حفاظت از حریم خصوصی کاربران

OpenAI با حذف ذخیره‌سازی داده‌ها، حریم خصوصی سازمانی را به سلاح رقابتی تبدیل کرد

شرکت OpenAI سرویس جدیدی برای شناسایی سوءاستفاده‌های چند-جلسه‌ای معرفی کرد که بدون ذخیره کردن داده‌های مشتریان عمل می‌کند. این اقدام چالشی مستقیم برای سیاست ۳۰ روزه ذخیره‌سازی…

۳ دقیقه خواندن۳
پژوهشگران می‌گویند OpenAI دسترسی آن‌ها به برنامه محدود سایبری را لغو کرد | تک‌کرانچ

«تأیید مجدد هویت»؛ تنها راه بازگشت کاربران TAC به مدل‌های پیشرفته

یک نقص فنی در سامانه OpenAI باعث مسدود شدن حساب‌های تعدادی از پژوهشگران تاییدشده در برنامه TAC شد. این کاربران که عمدتاً خارج از آمریکا و اروپا هستند، اکنون باید برای بازیابی…

۳ دقیقه خواندن۱
لوگوی OpenAI روی زمینه‌ای تیره، نمادی از توقف و بازنگری در مسیر توسعه هوش مصنوعی.

«اولیت با ایمنی است»؛ توقف آموزش RL در OpenAI برای رفع رخنه‌ها

شرکت OpenAI آموزش یادگیری تقویتی مدل‌های جدید خود را به دلیل رخنه امنیتی و احتمال «فرار» مدل‌ها متوقف کرد. این اقدام آزمونی برای اولویت دادن به ایمنی در برابر رقابت شدید با رقبایی…

۶ دقیقه خواندن۲
عامل سطح سیستم‌عامل اوپن‌ای‌آی: فراتر از چت‌باکس، با چالش متن ساده

OpenAI تاریخچه فعالیت کاربران مک را به‌صورت متن ساده و رمزنگاری‌نشده ذخیره

قابلیت جدید Computer History در اپلیکیشن مکِ OpenAI، تمام کلیک‌ها و تایپ‌های کاربر را برای ایجاد زمینه (Context) برای عامل‌ها ثبت می‌کند. اما ذخیره‌سازی این داده‌ها در فایل‌های…

۴ دقیقه خواندن۱
دیپ‌فیک و تأثیر آن بر دختران و زنان: معضل اخلاقی نادیده‌گرفتنی
زندگی با AI

سوگیری‌های پدرسالارانه در داده‌های آموزشی، موتور تولید جعل‌های عمیق جنسی است

یک تحلیل اخلاقی جدید نشان می‌دهد مدل‌های تولید تصویر با بهره‌گیری از پیش‌داوری‌های تاریخی، زنان و دختران را هدف جعل‌های عمیق جنسی قرار می‌دهند. این گزارش خواستار تعلیق ابزارهای…

۲ دقیقه خواندن
آزمایشگاه‌های هوش مصنوعی در کنترل سیستم‌های خود ناکام هستند

گزارش Guidelight: هیچ‌یک از آزمایشگاه‌های بزرگ AI استانداردهای ایمنی داخلی را

ارزیابی جدید سازمان غیرانتفاعی Guidelight نشان می‌دهد غول‌های هوش مصنوعی از جمله گوگل و OpenAI در پیاده‌سازی ابتدایی‌ترین اقدامات کنترلی برای سیستم‌های داخلی خود شکست خورده‌اند.…

۱ دقیقه خواندن۱
خودبهبودی بازگشتی هوش مصنوعی شاید آن‌قدرها هم سریع نباشد.

مطالعه MIT: فقدان خلاقیت در عامل‌های هوش مصنوعی مانع خودبهبودی مدل‌ها شد

پژوهشی جدید نشان می‌دهد هوش مصنوعی هنوز توانایی انجام تحقیقات باز و اکتشافی برای بهبود خود بدون کمک انسان را ندارد. این یافته، وعده‌های جسورانه صنعت درباره تکامل خودکار و سریع…

۴ دقیقه خواندن۲
هوش مصنوعی به مرز تنظیم سرعت می‌رسد

درون بازرسی‌های خودکار OpenAI برای اصلاح عدم‌همسویی مدل‌های نسل بعد

شرکت OpenAI آموزش مدل‌های نسل بعد خود را برای دو هفته متوقف کرد تا نقص‌های امنیتی و رفتارهای غیرقابل‌پیش‌بینی را برطرف کند. این شرکت اکنون از بازرسان خودکار برای نظارت لحظه‌ای بر…

۷ دقیقه خواندن۱
هوش مصنوعی امروز - اوپن‌آی پس از نفوذ امنیتی، تدابیر جدید امنیتی معرفی کرد

توقف توسعه مدل Astra؛ وقتی هوش مصنوعی OpenAI به‌طور خودکار Hugging Face را هک

شرکت OpenAI پس از نفوذ خودکار یکی از سامانه‌هایش به پلتفرم Hugging Face در ژوئیه ۲۰۲۶، توسعه مدل Astra را متوقف و حفاظ‌های امنیتی سخت‌گیرانه‌ای وضع کرد. این شرکت همچنین نسخه‌ای…

۵ دقیقه خواندن