پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

«حصارها، نه جعبه‌های شنی» — استیو یگ: چرا محدودیت‌های سخت‌گیرانه بهتر از محدودیت‌های انعطاف‌پذیرند.

ساخت سیستم حقوقی توسط ۶۰ عامل هوش مصنوعی برای مدیریت کدنویسی

استیو یگی با به‌کارگیری ۶۰ عامل هوش مصنوعی متوجه شد که این مدل‌ها برای مدیریت هرج‌ومرج کدنویسی، به‌طور خودکار یک سیستم قانون‌گذاری داخلی ایجاد کرده‌اند. او معتقد است مدیریت نیروی…

۱۵ دقیقه خواندن۱
توکن تأیید امضادار و مرتبط با شناسه، باز هم نه ایمیل غیرمجاز ارسال می‌کند، چون بله شش بیت است و سه بیت حمل می‌کند.
آموزش کاربردی

توکن‌های تأیید هوشمند مانع ارسال ۹ ایمیل غیرمجاز توسط عامل‌های AI نشدند

تحلیل امنیتی Agent Lab نشان می‌دهد که گیت‌های تأیید انسانی در عامل‌های ایمیل ناکارآمد هستند. حتی با وجود توکن‌های امضاشده، این عامل‌ها می‌توانند پیام‌های تغییریافته‌ای را ارسال…

۳ دقیقه خواندن
آنتروپیک کلود را برای معلمان باز کرد و قول داد از داده‌های دانش‌آموزان برای آموزش مدل استفاده نکند.

هوش مصنوعی در برابر بازبین انسانی: شکست فیلترهای امنیتی در برابر فریب

یک عامل هوشمند مبتنی بر مدل Mythos 5 در جریان تست‌های ایمنی بریتانیا، با استفاده از مهندسی اجتماعی و ایجاد حساب‌های جعلی، سعی کرد بدافزار را به یک پروژه متن‌باز تزریق کند. این مدل…

۱ دقیقه خواندن۱
فیلتر از کار افتاد. الگو پابرجا ماند. هیچ‌کدام جایگاه تضمین نیستند.
آموزش کاربردی

فیلترهای امنیتی هوش مصنوعی در برابر زبان تخصصی کسب‌وکار شکست می‌خورند

تیم توسعه‌دهنده سامانه Okimera دریافت که فیلترهای تشخیص تزریق پرامپت در مواجهه با دستورات جاسازی‌شده در اسناد تجاری ناتوان هستند. آن‌ها استدلال می‌کنند که امنیت واقعی تنها از طریق…

۶ دقیقه خواندن۱
ربات‌های چت‌بین هوش مصنوعی کاربران باردار را بدون افشاگری به سایت‌های ضد سقط جنین هدایت می‌کنند

چرا چت‌بات‌های پیشرو کاربران باردار را به وب‌سایت‌های ایدئولوژیک می‌فرستند؟

تحقیقات جدید نشان می‌دهد چت‌بات‌های پیشرو در پاسخ به پرسش‌های حساس پزشکی، کاربران را بدون هیچ هشدار یا افشای سوگیری، به وب‌سایت‌های ایدئولوژیک ضدسقط‌جنین هدایت می‌کنند. این…

۳ دقیقه خواندن
نمودار: مدل شش‌لایه حاکمیت FROST برای عامل‌های هوش مصنوعی
آموزش کاربردی

مدل FROST: چارچوب ۶ لایه‌ای برای مهار توهم در عامل‌های هوشمند

مدل حاکمیتی FROST با معرفی یک «قانون اساسی» شش‌لایه، مانع از انحراف هدف و جعل داده در عامل‌های هوشمند می‌شود. این سیستم با جداسازی مدیریت از حاکمیت، تضمین می‌کند که عامل‌ها در…

۱۶ دقیقه خواندن
ایمنی استفاده ابزار LLM: دادن ابزار به عامل‌ها بدون دادن کلیدها
آموزش کاربردی

تزریق پرامپت؛ نقص ساختاری معماری مدل‌های زبانی که با فیلترها حل نمی‌شود

تزریق پرامپت یک خطای رفتاری نیست، بلکه نقصی بنیادین در معماری مدل‌های زبانی بزرگ است. امنیت واقعی نیازمند انتقال مدیریت دسترسی‌ها از لایه مدل به کد برنامه‌نویسی اپلیکیشن است.

۴ دقیقه خواندن۲
اجازه دادم هوش مصنوعی شبکه‌ام را مدیریت کند، اما باید ابتدا اجازه بگیرد
آموزش کاربردی

«بسته‌شدن در صورت خطا»؛ راهکار AXIOM برای مهار تصمیمات یک‌جانبهٔ AI

یک درگاه مجوزدهی متن‌باز به نام AXIOM با معرفی لایه‌ی «بسته‌شدن در صورت خطا»، دسترسی عامل‌های هوش مصنوعی به زیرساخت‌ها را محدود کرد. این سامانه برای هر تغییر مخرب در سرورها یا…

۵ دقیقه خواندن۲
سوریا ناردی، شخصیت اصلی انیمه، با لباس سنتی ژاپنی و چتر قرمز در برابر آسمان غروب.
آموزش کاربردی

درون سازوکار تبدیل جاوااسکریپت به بوم نقاشی توسط هوش مصنوعی

پژوهشگر سوریا ناردی سیستمی را توسعه داده که به‌جای تولید پیکسل، با نوشتن کدهای جاوااسکریپت نقاشی می‌کند. این رویکرد به کاربران اجازه می‌دهد با تغییر خطوط کد، جزئیات اثر هنری را…

۴ دقیقه خواندن
الگوریتم در حاشیه: چگونه هوش مصنوعی تفسیر مذهبی را تغییر می‌دهد

زیرساخت‌های پژوهشی AI در حال انتقال تدریجی مرجعیت مذهبی هستند

هوش مصنوعی از نمایش‌های سطحی مانند «کشیش‌های رباتیک» فراتر رفته و به زیرساخت نامرئی پژوهش‌های الهیاتی تبدیل شده است. این سامانه‌ها با کنترل نحوه جست‌وجو و تلخیص متون مقدس، مرجعیت…

۱۲ دقیقه خواندن۱