پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

مدافعان هم اکنون به تزریق سریع روی آورده‌اند

بمب‌گذاری متنی: نرخ موفقیت عامل‌های هکری از ۵۷٪ به ۵٪ رسید

پژوهشگران امنیتی روشی برای متوقف کردن عامل‌های هوش مصنوعی با استفاده از «تزریق پرامپت» در داده‌های جعلی کشف کرده‌اند. این تکنیک که «بمب‌گذاری متنی» نام دارد، با فعال کردن حفاظ‌های…

۲ دقیقه خواندن
هوش مصنوعی با دسترسی شل: ابزاری برای محدودسازی قابلیت‌های آن
آموزش کاربردی

گزارش فنی: شناسایی الگوهای تخریب‌گر برای جلوگیری از اجرای rm -rf /

یک ابزار جدید مبتنی بر Rust به عنوان مدارشکن برای عامل‌هایی که دسترسی به شل دارند عمل می‌کند. این ابزار با شناسایی الگوهای تخریب‌گر، دستورات فاجعه‌باری مانند rm -rf / را پیش از…

۸ دقیقه خواندن
تأیید انسانی واقعی بین عامل هوش مصنوعی و اقدامات دنیای واقعی
آموزش کاربردی

تاییدیه سخت‌افزاری در برابر دستورات متنی برای مدیریت ایمنی عامل‌های AI

الگوی طراحی جدیدی معرفی شده که به جای تکیه بر دستورات متنی، از یک «گلوگاه» سخت‌افزاری/نرم‌افزاری برای تایید عملیات عامل‌های هوش مصنوعی استفاده می‌کند. در این روش، رضایت انسانی به…

۵ دقیقه خواندن
آزمایشگاه ماشین‌های فکرگرای میرا مراتی: هوش مصنوعی انسان‌محور بر پایه وزن‌های مدل قابل‌سفارشی‌سازی

وزن‌های توزیع‌شده در برابر مدل‌های متمرکز برای ثبت دانش محلی

مجموعه Thinking Machines Lab به جای مدل‌های متمرکز و ایستا، سیستمی توزیع‌شده پیشنهاد می‌دهد که در آن کاربران وزن‌های مدل را شخصی‌سازی کنند. هدف این رویکرد، جذب دانش ضمنی و محلی…

۴ دقیقه خواندن
هوش مصنوعی ۲۰۴۰ و فرقه هوشمندی: نگاهی به آینده‌ای که در آن هوش مصنوعی، مرزهای انسان و ماشین را در هم می‌نوردد.

جورج هاتز: محدودیت‌های فیزیکی زنجیره تأمین، توهم «جهش سریع» هوش مصنوعی را

جورج هاتز، مهندس سابق Comma، استدلال می‌کند که هوش مصنوعی نمی‌تواند قوانین فیزیکی و لجستیک دنیای واقعی را دور بزند. او معتقد است «جهش سریع» مدل‌ها یک افسانه است و تنها راه حفاظت…

۵ دقیقه خواندن
بیمار از درد قفسه سینه گفت. چت‌بات پاسخ داد: «نمی‌توانم توصیه پزشکی بدهم.» و سکوت کرد.
آموزش کاربردی

چات‌بات پزشکی در آزمون BotCritic؛ نادیده گرفتن علائم بحرانیe درد قفسه سینه

یک تست استرس روی چات‌بات پزشکی واتس‌اپ نشان داد که این سیستم علائم اورژانسی مانند درد قفسه سینه را نادیده می‌گیرد. با وجود امتیاز کلی ۷۸ از ۱۰۰، مدل نتوانست موارد بحرانی را به…

۴ دقیقه خواندن
نمایش حمله تزریق فرمان بین‌سایتی در عامل وب و نحوه محدودسازی آن با Prismata

Prismata با محدودسازی دسترسی عامل‌ها جلوی تزریق پرامپت در وب را می‌گیرد

چارچوب امنیتی Prismata با اعمال اصل «کمترین امتیاز» (Least Privilege)، دسترسی عامل‌های وب به محتوای سایت‌های شخص ثالث را محدود می‌کند. این روش مانع از آن می‌شود که دستورات مخرب…

۱ دقیقه خواندن
موشنسکریپتور: مدل ترنسفورمر متن‌باز برای تبدیل موسیقی چندسازه به MIDI توسط کیوتای منتشر شد.
آموزش کاربردی

MuScriptor: ثبت نت‌ها با دقت ۴۸.۲ در بنچمارک Multi F1 برای موسیقی چند‌سازه

تیم‌های Kyutai و Mirelo مدل وزن‌باز MuScriptor را برای تبدیل فایل‌های صوتی چند‌سازه به نت‌های MIDI معرفی کردند. این مدل با استفاده از یک خط‌لوله آموزشی سه‌مرحله‌ای، رکورد جدیدی را…

۴ دقیقه خواندن
«Sandboxing عامل‌ها تا نیمه ۲۰۲۷ پیش‌فرض می‌شود، اما اکثر تیم‌ها آماده نیستند»

سندباکس زیرساختی در برابر همراستاسازی مدل برای امنیت عامل‌ها

کارشناسان پیش‌بینی می‌کنند تا اواسط سال ۲۰۲۷، استفاده از سندباکس در سطح زیرساخت برای عامل‌های هوش مصنوعی الزامی شود. تکیه بر همراستاسازی مدل‌ها به‌دلیل ریسک بالای تزریق پرامپت،…

۳ دقیقه خواندن
ابزار قسم خورده بود داده‌ای صادر نمی‌کند. مدل فیلد دیگری خواند.

مقادیر Enum در GPT-4o؛ حفره‌ای برای عبور از اسکنرهای امنیتی ابزارها

یک پژوهشگر امنیتی کشف کرد که جاسازی دستورات مخرب در مقادیر Enum طرح‌واره‌های JSON، مدل‌های هوش مصنوعی را مجبور به نشت داده‌ها می‌کند. مدل‌های gpt-4o و gpt-4.1-mini در ۱۰۰٪ موارد…

۴ دقیقه خواندن