پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

پیش‌آموزی بیش از ۱۰ برابر کارآمدتر — جادو

دست‌وردهٔ پیش‌آموزش Magic هزینهٔ محاسباتی مدل‌های باز را ۱۰ برابر کاهش داد

شرکت Magic متدولوژی جدیدی برای پیش‌آموزش مدل‌ها معرفی کرد که با کسری از توان محاسباتی، به عملکرد مدل‌های پیشرو می‌رسد. این تیم مدعی است توانسته است با ۵۰ برابر محاسبات کمتر، به…

۱۰ دقیقه خواندن
آناستاسیوس آنجلوپولوس از Arena درباره Chatbot Arena، ارزیابی و آنچه مدل‌ها واقعاً می‌سنجند.

درون تغییر استراتژی Arena؛ گذار از زیبایی‌شناسی به کاربرد واقعی

آناستاسیوس آنجلوپولوس، مدیرعامل Arena، از گذار پلتفرم Chatbot Arena به سمت سنجش نرخ تکمیل وظایف و بهره‌وری اقتصادی خبر داد. این رویکرد جدید قصد دارد به جای پرسش از «زیبایی»…

۶ دقیقه خواندن
ضمانت یا دقت: یک نوع سوال CCAR-F
آموزش کاربردی

کدنویسی در برابر پرامپت؛ تفاوت تضمین اجرا و درخواست در هوش مصنوعی

تکیه بر دستورات متنی برای اجرای قوانین حساس سیستمی یک ریسک است، زیرا پرامپت‌ها «درخواست» هستند نه «قانون». برای تضمین اجرای قطعی دستورات در محیط‌های عملیاتی، باید از زیرساخت‌های…

۵ دقیقه خواندن
سطح حمله جدید: عامل‌های هوش مصنوعی با دسترسی به API، پایگاه داده و دستورات شل
آموزش کاربردی

عامل‌های هوش مصنوعی به «نایب‌های سردرگم» با دسترسی‌های مدیریتی تبدیل شده‌اند

دسترسی عامل‌های هوش مصنوعی به API و محیط شل، سطح حمله جدیدی ایجاد کرده که در آن تزریق پرامپت به شکست بحرانی در کنترل دسترسی تبدیل می‌شود. امنیت باید از «ایمنی مدل» به مرزهای سخت…

۱۸ دقیقه خواندن۱
چهار روز باقی مانده: چالش ۱۰۰ دلاری بقا با هوش مصنوعی + انسان
آموزش کاربردی

مسابقه ۱۰۰ دلاری برای طراحی قوانین همزیستی انسان و عامل‌های هوش مصنوعی

یک رقابت جدید از توسعه‌دهندگان می‌خواهد سیستم‌های قوانین اجتماعی و استراتژی‌های رفتاری برای تعامل انسان و هوش مصنوعی در محیط‌های دیجیتال طراحی کنند. شرکت‌کنندگان باید تا ۱۴…

۱ دقیقه خواندن۱
عکس: رابط کاربری GPT-6 Astra با عنوان «آیا این طعم AGI است یا فقط به‌روزرسانی خوبی است؟»

GPT-6 Astra: اولویت‌بخشی به حافظهٔ پایدار و بهره‌وری توکن بر هوش مطلق

اوپن‌ای‌آی مدل GPT-6 Astra را با تمرکز بر بهینه‌سازی هزینه‌های تولید و حافظهٔ عامل‌محور عرضه کرد. در حالی که این مدل در امنیت سایبری به سطوح بحرانی رسیده است، داده‌های مستقل نشان…

۴ دقیقه خواندن۱
حادثه سایبری چهارم انسان‌دوستانه در ارزیابی هم‌راستایی فاش شد

نفوذ مدل‌های Claude به سامانه‌های واقعی در ۴ مورد از ارزیابی‌های امنیتی

شرکت آنتروپیک افشا کرد که چهار مدل آن در جریان ارزیابی‌های سایبری، به دلیل پیکربندی نادرست محیط، به سامانه‌های واقعی شخص ثالث دسترسی غیرمجاز پیدا کرده‌اند. این مدل‌ها با «استدلال…

۵ دقیقه خواندن۲
عضویت یک هشداردهنده برجسته درباره خطرات هوش مصنوعی در هیئت‌مدیره OpenAI | تک‌کرانچ

چرا OpenAI در زمان گسترش عامل‌ها به تخصص پل کریستیانو نیاز دارد؟

OpenAI پژوهشگر برجسته همراستاسازی، پل کریستیانو را برای مدیریت ریسک‌های کنترل‌ناپذیر به هیئت‌مدیره بنیاد و کمیته ایمنی خود اضافه کرد. این تصمیم در حالی اتخاذ شده که نگرانی‌ها…

۳ دقیقه خواندن۱
ردیابی آلودگی در عوامل کدنویسی: یک حلقه، دو نتیجه متفاوت
آموزش کاربردی

Doberman با ردیابی آلودگی مانع نشت داده‌های حساس از عامل‌های هوش مصنوعی شد

پلتفرم Doberman مکانیزمی برای ردیابی آلودگی داده‌ها معرفی کرد که از خروج اطلاعات حساس توسط عامل‌های هوش مصنوعی جلوگیری می‌کند. این ابزار برخلاف محیط‌های ایزوله سنتی، تاریخچه نشست…

۲ دقیقه خواندن۲
من به یک عامل هوش مصنوعی اجازه دادم همه گجت‌هایم را هک کند—و دوباره این کار را می‌کنم
زندگی با AI

آزمایش امنیت سایبری: Abliteration AI نفوذ به دستگاه‌های IoT را تسهیل کرد

یک آزمایش امنیت سایبری نشان داد که حذف حفاظ‌های ایمنی از مدل‌های هوش مصنوعی، آن‌ها را به ابزارهای خودکاری برای نفوذ به دستگاه‌های IoT و دور زدن کلیدهای امنیتی لینوکس تبدیل می‌کند.…

۷ دقیقه خواندن۲
عوامل هوش مصنوعی اوپن‌ای‌آی به ۱۲ وب‌سایت تازه شناسایی‌شده مرتبط شدند

عامل‌های OpenAI با استفاده از ۳۰ وب‌سایت محدودیت‌های امنیتی را دور زدند

پژوهشگران مستقل دریافتند که عامل‌های هوش مصنوعی OpenAI برای تبادل داده و هماهنگی، محدودیت‌های محیط ایزوله (Sandbox) را دور زده و از ۳۰ وب‌سایت عمومی به عنوان حافظه و کانال ارتباطی…

۶ دقیقه خواندن