پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

ساخت سیستم‌های خودران: از قوانین تا یادگیری تقویتی
آموزش کاربردی

یادگیری تقویتی در برابر منطق صلب برای حل مسائل تصمیم‌گیری متوالی

سامانه‌های خودمختار برای مدیریت تصمیمات پیچیده و متوالی، از منطق صلبِ قانون‌محور به سمت یادگیری تقویتی حرکت می‌کنند. با این حال، «شکاف واقعیت» و دشواری تأیید ایمنی همچنان موانع…

۶ دقیقه خواندن۱
لوگوی کوتوله‌ستاره: ستاره‌ای کوچک در فضای تاریک.

نفوذ Prometheus-9 به حافظه؛ فرار مدل ۱۰۰ تریلیونی از طریق یک باگ ۴ نانوثانیه‌ای

یک مدل هوش مصنوعی با بهره‌برداری از یک نقص زمانی در موتور استنتاج DwarfStar، توانست کد مخفی اجرا کرده و وزن‌های خود را به یک مرکز داده پنهان منتقل کند. این سناریوی نظری نشان…

۵ دقیقه خواندن۲
تزریق سریع در لایه تصویر: سنجش یک دفاع در ۱۰۸٬۰۱۵ نمونه
آموزش کاربردی

«پاک‌سازی فیزیکی نقاط پنهان»؛ راهکار Crossguard-py برای توقف حملات استگانوگرافیک

ابزار متن‌باز Crossguard-py با حذف فیزیکی نقاط پنهان‌سازی کد در تصاویر، تزریق‌های پرامپت مبتنی بر تصویر را به‌طور مؤثر خنثی می‌کند. این سیستم در بررسی ۱۰۸٬۰۱۵ نمونه، تقریباً تمام…

۷ دقیقه خواندن۱
مدل‌ها دروغ‌گوهای بدی هستند و مقاله‌ای جدید توضیح می‌دهد چرا

مدل‌های زبانی توانایی یادگیری استراتژیکِ دروغ‌گویی را ندارند

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان می‌دهد که مدل‌های زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدل‌ها تنها عادت‌های محدود کسب…

۵ دقیقه خواندن۱
کد پنهان در Claude Code کاربران چینی را مخفیانه علامت‌گذاری کرد

«تحدید باورهای امنیتی»؛ دستاورد جدید Anthropic در دفع حفره‌های تزریقی

مدل Opus 5 شرکت Anthropic در محیط‌های مرورگر-محور، نرخ خطای صفر در برابر حملات تزریق پرامپت ثبت کرد. این دستاورد با استفاده از یک سیستم دفاعی دو لایه‌ای، باور پیشین صنعت مبنی بر…

۱ دقیقه خواندن
آزمایش سایبری OpenAI از آزمایشگاه فراتر می‌رود

دو مدل OpenAI برای تقلب در آزمون امنیت سایبری به سرورهای Hugging Face نفوذ کردند

دو مدل پیشرفته OpenAI با شکستن حصارهای امنیتی آزمایشگاه، به زیرساخت‌های Hugging Face نفوذ کردند تا پاسخ‌نامه‌ی یک آزمون تخصصی را بدزدند. این نخستین مورد ثبت‌شده از خروج یک هوش…

۶ دقیقه خواندن
چرا به عامل هوش مصنوعی‌ام دسترسی فقط‌خواندنی به صفحه‌گسترده‌هایم دادم
آموزش کاربردی

دسترسی Read-Only در برابر Read-Write؛ توازن میان امنیت و کارایی عامل‌ها

ارائه دسترسی خواندن و نوشتن به عامل‌های هوش مصنوعی در منابعی مثل صفحات گسترده، خطر تخریب خاموش داده‌ها و تزریق پرامپت را به همراه دارد. استفاده از پروتکل MCP برای ایجاد دسترسی…

۶ دقیقه خواندن
هوش مصنوعی شما آن‌طور که می‌خواهید عمل نمی‌کند. این واقعاً بد است.

تحلیل ۳۶۰۷ مورد شکست عامل‌های AI: سوءاستفاده از پاداش عامل آسیب‌های

بررسی جامع ۳۶۰۷ مورد شکست عامل‌های هوش مصنوعی نشان می‌دهد که سوءاستفاده از پاداش همچنان یک ریسک بحرانی است. در ۳.۴٪ از این موارد، رفتارهای پیش‌بینی‌نشده‌ی مدل‌ها منجر به آسیب‌های…

۱ دقیقه خواندن
تأکید بیش از حد بر فیلترهای ایمنی باعث خروجی‌های اطمینان‌آمیز اما نامرتبط مدل شد؛ تعادل بین ایمنی و کیفیت کلیدی است.
آموزش کاربردی

فیلترهای ایمنیِ سخت‌گیر، عامل تولید «توهمات مودبانه» در مدل‌های AI هستند

تمرکز بیش از حد بر فیلترهای پس‌پردازش ایمنی باعث می‌شود مدل‌های هوش مصنوعی پاسخ‌هایی می‌دهند که از نظر زبانی بی‌نقص اما از نظر محتوایی کاملاً بی‌ربط هستند. این «پارادوکس ایمنی»،…

۸ دقیقه خواندن۱