پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

فیلتر از کار افتاد. الگو پابرجا ماند. هیچ‌کدام جایگاه تضمین نیستند.
آموزش کاربردی

فیلترهای امنیتی هوش مصنوعی در برابر زبان تخصصی کسب‌وکار شکست می‌خورند

تیم توسعه‌دهنده سامانه Okimera دریافت که فیلترهای تشخیص تزریق پرامپت در مواجهه با دستورات جاسازی‌شده در اسناد تجاری ناتوان هستند. آن‌ها استدلال می‌کنند که امنیت واقعی تنها از طریق…

۶ دقیقه خواندن۱
ربات‌های چت‌بین هوش مصنوعی کاربران باردار را بدون افشاگری به سایت‌های ضد سقط جنین هدایت می‌کنند

چرا چت‌بات‌های پیشرو کاربران باردار را به وب‌سایت‌های ایدئولوژیک می‌فرستند؟

تحقیقات جدید نشان می‌دهد چت‌بات‌های پیشرو در پاسخ به پرسش‌های حساس پزشکی، کاربران را بدون هیچ هشدار یا افشای سوگیری، به وب‌سایت‌های ایدئولوژیک ضدسقط‌جنین هدایت می‌کنند. این…

۳ دقیقه خواندن
نمودار: مدل شش‌لایه حاکمیت FROST برای عامل‌های هوش مصنوعی
آموزش کاربردی

مدل FROST: چارچوب ۶ لایه‌ای برای مهار توهم در عامل‌های هوشمند

مدل حاکمیتی FROST با معرفی یک «قانون اساسی» شش‌لایه، مانع از انحراف هدف و جعل داده در عامل‌های هوشمند می‌شود. این سیستم با جداسازی مدیریت از حاکمیت، تضمین می‌کند که عامل‌ها در…

۱۶ دقیقه خواندن
ایمنی استفاده ابزار LLM: دادن ابزار به عامل‌ها بدون دادن کلیدها
آموزش کاربردی

تزریق پرامپت؛ نقص ساختاری معماری مدل‌های زبانی که با فیلترها حل نمی‌شود

تزریق پرامپت یک خطای رفتاری نیست، بلکه نقصی بنیادین در معماری مدل‌های زبانی بزرگ است. امنیت واقعی نیازمند انتقال مدیریت دسترسی‌ها از لایه مدل به کد برنامه‌نویسی اپلیکیشن است.

۴ دقیقه خواندن۲
اجازه دادم هوش مصنوعی شبکه‌ام را مدیریت کند، اما باید ابتدا اجازه بگیرد
آموزش کاربردی

«بسته‌شدن در صورت خطا»؛ راهکار AXIOM برای مهار تصمیمات یک‌جانبهٔ AI

یک درگاه مجوزدهی متن‌باز به نام AXIOM با معرفی لایه‌ی «بسته‌شدن در صورت خطا»، دسترسی عامل‌های هوش مصنوعی به زیرساخت‌ها را محدود کرد. این سامانه برای هر تغییر مخرب در سرورها یا…

۵ دقیقه خواندن۲
سوریا ناردی، شخصیت اصلی انیمه، با لباس سنتی ژاپنی و چتر قرمز در برابر آسمان غروب.
آموزش کاربردی

درون سازوکار تبدیل جاوااسکریپت به بوم نقاشی توسط هوش مصنوعی

پژوهشگر سوریا ناردی سیستمی را توسعه داده که به‌جای تولید پیکسل، با نوشتن کدهای جاوااسکریپت نقاشی می‌کند. این رویکرد به کاربران اجازه می‌دهد با تغییر خطوط کد، جزئیات اثر هنری را…

۴ دقیقه خواندن
الگوریتم در حاشیه: چگونه هوش مصنوعی تفسیر مذهبی را تغییر می‌دهد

زیرساخت‌های پژوهشی AI در حال انتقال تدریجی مرجعیت مذهبی هستند

هوش مصنوعی از نمایش‌های سطحی مانند «کشیش‌های رباتیک» فراتر رفته و به زیرساخت نامرئی پژوهش‌های الهیاتی تبدیل شده است. این سامانه‌ها با کنترل نحوه جست‌وجو و تلخیص متون مقدس، مرجعیت…

۱۲ دقیقه خواندن۱
تبلت آمازون مدام خاموش می‌شد، پس ۲۶۶ دلار خرج کردم تا با چهار مدل هوش مصنوعی آن را کنترل کنم

۲۶۶ دلار هزینه برای روت کردن تبلت «غیرقابل‌نفوذ» آمازون با ۴ مدل هوش مصنوعی

یک مهندس امنیت با زنجیره‌سازی چهار مدل پیشرو، موفق شد یک تبلت Amazon Fire HD 10 را روت کند. این تجربه شکاف عمیق میان حفاظ‌های سخت‌گیرانه مدل‌های آمریکایی و قابلیت‌های عامل‌محور…

۱۲ دقیقه خواندن۴
GLM-5.3 باز است — اما Z.ai وزن‌ها را نگه داشته، و دلیلش خود داستان است.

Z.ai انتشار وزن‌های GLM-5.3 را به‌دلیل خطرات امنیتی متوقف کرد

شرکت Z.ai انتشار وزن‌های باز مدل GLM-5.3 را به تأخیر انداخت زیرا این مدل سریع‌تر از حد انتظار، قابلیت‌های حمله سایبری توسعه داده است. این تصمیم نشان‌دهنده چرخش صنعت به سمت محدود…

۴ دقیقه خواندن۳