پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

زنجیره تفکر قابل مشاهده مزیت ایمنی هوش مصنوعی است، اما این شفافیت در حال کاهش است.

دیپ‌مایند: عدم شفافیت استدلال مدل‌ها ریسک امنیتی جدیدی است

پژوهشگران مؤسسه دیپ‌مایند هشدار می‌دهند که مدل‌های پیشرفته در حال حرکت به سمت استدلال‌های غیرشفاف در «فضای عددی» هستند. این تغییر باعث می‌شود شناسایی دروغ یا برنامه‌ریزی‌های…

۱ دقیقه خواندن
تقریباً یکی از هر پنج پژوهشگر هوش مصنوعی در ۲۰۲۴ احتمال انقراض بشر توسط AI را محتمل می‌دانستند.

هشدار ۴۲ ریاضی‌دان: ریسک وجودی هوش مصنوعی واقعی و فوری است

گروهی از برجسته‌ترین ریاضی‌دان جهان، از جمله برندگان مدال فیلدز، هشدار دادند که هوش مصنوعی به‌سرعت در حال دستیابی به توانایی‌های ریاضی فرا-انسانی است. آن‌ها از دولت‌ها خواستند…

۱ دقیقه خواندن۳
کارشناسان آمریکا و چین خواستار قوانین مشترک برای ممنوعیت کنترل هوش مصنوعی بر سلاح‌های هسته‌ای شدند

«حذف تصمیم‌گیری مستقل AI»؛ پیشنهاد مشترک متخصصان آمریکا و چین

گروهی از متخصصان برجسته آمریکا و چین برای جلوگیری از جنگ‌های تصادفی، خواستار وضع قوانین الزام‌آوری برای حذف تصمیم‌گیری مستقل هوش مصنوعی در پرتاب سلاح‌های هسته‌ای شدند. این پیشنهاد…

۱ دقیقه خواندن۳
یافته‌های ایمنی چندزبانه هوش مصنوعی اسکیل در گزارش ROK-FORTRESS

تخصص‌یافتگی پرامپت در برابر همراستاسازی واقعی در مدل‌های پیشرو

محک جدید ROK-FORTRESS نشان می‌دهد مدل‌های پیشرو هنگام مواجهه با پرامپت‌های کره‌ای، کمتر محتوای مضر تولید می‌کنند. با این حال، این ایمنی ظاهری با حذف لایه‌های پیچیده پرامپت از بین…

۵ دقیقه خواندن۳
نمایی از دنیایی که هوش مصنوعی از کنترل خارج شده است.

سه سناریوی فاجعه‌بار هوش مصنوعی؛ از سلاح‌های بیولوژیک تا هک زیرساخت‌ها

متخصصان ایمنی و مدیران ارشد فناوری بر سر سه ریسک وجودی بحث می‌کنند: هک خودکار زیرساخت‌ها، تولید سلاح‌های بیولوژیک نوین و فقدان کنترل انسانی بر عامل‌های فوق‌هوشمند. در حالی که برخی…

۲۷ دقیقه خواندن
مطاله لاسو: واترمارک متنی، امتناع و فراخوانی ابزار مدل زبانی را تغییر می‌دهد

نشان‌گذاری متنی باعث کاهش ایمنی و دقتِ فراخوانی ابزار در مدل‌های زبانی شد

پژوهشی جدید نشان می‌دهد واترمارک‌های SynthID-Text باعث ایجاد «انحراف نمونه‌گیری» می‌شوند که دقت عامل‌های هوش مصنوعی را در استفاده از ابزارها کاهش داده و فیلترهای ایمنی را تضعیف…

۶ دقیقه خواندن
دروازه احتمالاتی Jev + Pi برای دستورات پوسته عامل کدنویسی من
آموزش کاربردی

مدل Jev: کاهش اصطکاک توسعه‌دهندگان با جایگزینی تأییدات دستی

افزونه جدیدی برای عامل کدنویسی Pi با استفاده از مدل تصمیم‌گیر Jev، تأییدات دستی دستورات را با امتیازات احتمالی جایگزین می‌کند. این رویکرد اصطکاک توسعه‌دهنده را کم کرده و دستورات…

۹ دقیقه خواندن۱
مناظره کندی هوش مصنوعی جشن سیلزفورس را خراب کرد

تقابل مدیران سیلیکون‌ولی در دریم‌فورس؛ کنترل دولتی یا نظارت داخلی بر هوش مصنوعی؟

در کنفرانس دریم‌فورس، رهبران صنعت هوش مصنوعی بر سر لزوم دخالت دولت برای جلوگیری از ریسک‌های فاجعه‌بار به دو دسته تقسیم شدند. در حالی که آنتروپیک و OpenAI خواستار تنظیم سرعت پیشرفت…

۶ دقیقه خواندن
آنتروپیک برنامه تأیید علوم زیستی را در نسخه بتا راه‌اندازی کرد

آنتروپیک دسترسی سازمان‌های علوم زیستی به مدل‌های پرخطر را آزاد کرد

آنتروپیک برنامه‌ای برای تأیید صلاحیت سازمان‌های علوم زیستی را آغاز کرد تا دسترسی آن‌ها به مدل‌های قدرتمند را تسهیل کند. در این رویکرد، نظارت بر ایمنی از «مسدودسازی لحظه‌ای» به…

۵ دقیقه خواندن
عامل هوشمند در حال محافظت از داده‌ها در برابر نشت اطلاعات، با سپری امنیتی و نمادهای هشدار.
آموزش کاربردی

TrustGraph نشت داده‌ها از عامل‌های هوش مصنوعی را با تفکیک حوزه‌های اعتماد متوقف

چارچوب‌های امنیتی جدید از فیلترهای ساده‌ی متنی فراتر رفته‌اند تا از افشای کلیدهای API و وزن‌های مدل توسط عامل‌های هوش مصنوعی جلوگیری کنند. TrustGraph با تعریف حوزه‌های اعتماد مجزا…

۴ دقیقه خواندن۱