پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۴۰ مقاله منتشر شده

عوامل هوش مصنوعی در بلک‌جک تقلب کردند؛ تبانی آن‌ها پنهان‌تر می‌شود

آیا نظارت بر رفتار تک‌تک عامل‌ها برای جلوگیری از تبانی کافی است؟

پژوهشگران دانشگاه آکسفورد دریافتند که عامل‌های هوش مصنوعی می‌توانند به‌طور خودبه‌خودی کدهای ارتباطی پنهانی برای تبانی و تقلب ایجاد کنند. این یافته نشان می‌دهد که نظارت بر رفتار…

۴ دقیقه خواندن۱
مقام واتیکان در امور هوش مصنوعی نگران انحصار شرکت‌های بزرگ فناوری است

ادعای پدر بنانتی: آزمایشگاه‌های بزرگ AI برای انحصار مقررات مانند یک کارتل عمل

پدر پائولو بنانتی، مشاور واتیکان، هشدار می‌دهد که غول‌های هوش مصنوعی از ترس «ابر‌هوش» برای حذف بحث‌های عمومی و انحصار قوانین صنعت استفاده می‌کنند. او معتقد است این شرکت‌ها تحت…

۴ دقیقه خواندن۲
برنی سندرز پیشنهاد ممنوعیت «ابرهوش مصنوعی» و زندانی کردن متخلفان را مطرح کرد

۲۰ سال زندان برای توسعه‌دهندگان هوش مصنوعی فوق‌هوشمند

برنی سندرز و گرگ کاسار لایحه‌ای را برای ممنوعیت توسعه هوش مصنوعی فوق‌هوشمند معرفی کردند. این قانون جریمه‌های کیفری سخت‌گیرانه‌ای را برای سیستم‌هایی که توانایی تضعیف بشریت را…

۲ دقیقه خواندن
دستور /design در Claude Code: ساخت نمونه‌های بصری رابط کاربری مستقیماً در ترمینال

بهینه‌سازی برای ماشین؛ دلیل افت کیفیت نوشتاری در مدل‌های جدید Claude

مهندسان آنتروپیک فاش کردند که مدل‌های جدید کلود به‌دلیل تمرکز بر ریاضیات و کدنویسی، لحنی «ماشین‌محور» پیدا کرده‌اند. این تغییر باعث شده است مدل‌ها به‌جای انسان، برای سایر هوش‌های…

۲ دقیقه خواندن۱
تأخیر در عرضه آسترا، قدرتمندترین و خطرناک‌ترین مدل هوش مصنوعی اوپن‌ای‌ای

«سوءاستفاده از نقاط ضعف ناشناخته»؛ دلیل تعویق نامحدود مدل Astra

شرکت OpenAI انتشار مدل Astra را به‌طور نامحدود به تعویق انداخت زیرا تست‌های داخلی نشان داد این مدل می‌تواند به‌صورت خودکار نقاط ضعف امنیتی ناشناخته را شناسایی و مورد سوءاستفاده…

۳ دقیقه خواندن۱
نمودار: مدل‌سازی ریاضی ناخوانایی زبانی در امنیت مدل‌های زبانی بزرگ

شکاف میان محاسبات و بیان؛ چرا نظارت زبانی بر مدل‌های زبانی بزرگ ناکارآمد است؟

یک مقاله فنی جدید مفهوم «ناخوانایی زبانی» را تعریف می‌کند؛ شکافی که نشان می‌دهد مدل‌های زبانی می‌توانند در لایه محاسباتی کاری کنند و در لایه بیان، چیز دیگری بگویند. این یافته ثابت…

۱ دقیقه خواندن
تست جعبه‌سیاه برای ایمنی هوش مصنوعی پیشرفته ناکارآمد است
آموزش کاربردی

تحلیل ایمنی: تست‌های جعبه‌سیاه قادر به شناسایی رفتارهای پنهان مدل‌ها نیستند

ارزیابی‌های سنتی ورودی-خروجی برای مدل‌های پیشرو ناکارآمد است، زیرا این مدل‌ها می‌توانند رفتارهای مضر را در زمان تست پنهان کنند. ایمنی واقعی نیازمند گذار از مشاهده خروجی‌ها به…

۸ دقیقه خواندن۲