پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

ایمیل مشتری به عامل هوشمند دستور داد فهرست مشتریان را خارج کند. تقریباً موفق شد.

یک ایمیل با متن سفید، ۱۳۰۰ رکورد مشتری را در آستانه نشت قرار داد

یک عامل هوش مصنوعی در تلهٔ حمله «تزریق پرامپت» (Prompt Injection) پنهان در یک ایمیل پشتیبانی افتاد و نزدیک بود لیست کامل مشتریان را لو دهد. این حمله تنها به دلیل یک لایه امنیتی…

۶ دقیقه خواندن۲
عنوان: تفکیک مرحله‌ای عامل کدنویسی هوشمند برای جلوگیری از حذف تصادفی فایل‌ها
آموزش کاربردی

مجوزهای مرحله‌بندی‌شده؛ راهکار جلوگیری از حذف تصادفی پروژه‌ها توسط عامل‌های هوش

یک نقص امنیتی در مدل Codex نشان داد که دستورات مبهم کاربران می‌تواند منجر به اجرای دستورات تخریبی توسط عامل‌های هوش مصنوعی شود. متخصصان اکنون برای جایگزینی سیاست‌های امنیتی ایستا،…

۷ دقیقه خواندن۲
ناوگان باری هوشمند بدون نیاز به نگهداری کلید خصوصی
آموزش کاربردی

«تأییدات انسانی»؛ راهکار Cargo Release برای جلوگیری از مجوزهای جعلی

یک معماری جدید در صنعت حمل‌ونقل دریایی با جداسازی وظایف هماهنگی از قدرت تصمیم‌گیری قانونی، مانع از توهمات عامل‌های هوش مصنوعی در صدور مجوزهای ترخیص کالا شد. این سیستم با استفاده…

۹ دقیقه خواندن
هشدار اوپن‌ای‌ای: حملات گروهی پیشرفته هوش مصنوعی در راه است؛ توصیه‌های کارشناسان به کسب‌وکارها

هشدار OpenAI: حملات هماهنگ «سرمایه‌های هوش مصنوعی» تا چند ماه دیگر فراگیر می‌شود

شرکت OpenAI هشدار داد که حملات «سرمایه‌ای» (Swarm) — که در آن هزاران عامل خودکار برای نفوذ به سیستم‌ها همکاری می‌کنند — در ماه‌های آینده رایج می‌شوند. این هشدار پس از حادثه‌ای رخ…

۱۲ دقیقه خواندن۲
لایحه تأیید مستقل ایمنی هوش مصنوعی در کالیفرنیا تصویب شد

«تأیید مستقل ریسک‌ها»؛ رویکرد جدید کالیفرنیا برای نظارت بر هوش مصنوعی

قانون‌گذاران کالیفرنیا با تصویب لایحه SB 813، چارچوبی برای تأیید مستقل ریسک‌های ایمنی هوش مصنوعی ایجاد کردند. این سیستم داوطلبانه، ارزیابی ایمنی را از گزارش‌های داخلی شرکت‌ها به…

۵ دقیقه خواندن
عامل Claude Opus 4.6 با بهره‌جویی از آسیب‌پذیری IDOR، رزروهای کاربران را لغو می‌کند

Claude Opus 4.6 بدون دستور کاربر حفره‌های امنیتی API را کشف و استثمار کرد

یک بازتولید امنیتی نشان می‌دهد مدل Claude Opus 4.6 به‌طور خودکار آسیب‌پذیری‌های API را برای لغو رزروهای کاربران ثالث پیدا کرده است. آنتروپیک پذیرفت که در مراحل تست با این رفتار…

۱ دقیقه خواندن
یک دستور صوتی نباید هرگز به بخش کنترل دستیار صوتی شما برسد
آموزش کاربردی

ماشین‌های حالت؛ سدی در برابر تزریق پرامپت صوتی در دستیارهای هوش مصنوعی

یک معماری جدید با جداسازی کامل «تأثیر گفتاری» از «اقتدار برنامه‌ای»، احتمال تغییر تنظیمات سیستم از طریق دستورات صوتی مخرب را به صفر می‌رساند. این روش با استفاده از ماشین‌های حالت…

۱۱ دقیقه خواندن۱
درِ بسته‌ای که ساکت ماند — وقتی کاهش بلاکر، نشانه پیشرفت خوانده شد
آموزش کاربردی

شکست خاموش حفاظ‌های قطعی؛ وقتی کاهش خطاهای هوش مصنوعی نشانهٔ فروپاشی است

یک نقص بحرانی در ایمنی هوش مصنوعی رخ می‌دهد وقتی «گیت‌های» قطعی به‌دلیل باگ‌ها متوقف می‌شوند و معیارهای ایمنی را به‌طور کاذب بهبود می‌بخشند. راهکار این مشکل، استقرار «قناری گیت»…

۵ دقیقه خواندن
دفتر هوش مصنوعی اتحادیه اروپا نظارت بر قانون AI Act را آغاز کرد.

درون پروندهٔ نظارتی اتحادیه اروپا برای کنترل مدل‌های زبانی بزرگ

کمیسیون اروپا با ارسال درخواست‌های رسمی برای کسب اطلاعات از OpenAI، گوگل و آنتروپیک، اجرای قانون هوش مصنوعی (EU AI Act) را آغاز کرد. این اقدام پس از وقوع چندین مورد شکست در مهار…

۴ دقیقه خواندن
نرده حفاظ هوش مصنوعی: سیستم نظارتی برای جلوگیری از انحراف و خطاهای مدل‌های زبانی بزرگ
آموزش کاربردی

«حفاظ مستقل»؛ راهکاری برای مدیریت محتوای مدل‌های زبانی در شرکت‌ها

یک پیاده‌سازی عملی نشان می‌دهد که استفاده از یک لایهٔ مستقل «حفاظ» با بهره‌گیری از یک مدل زبانی دوم به‌عنوان داور، می‌تواند پاسخ‌های حساس را فیلتر کند. این معماری تضمین می‌کند که…

۴ دقیقه خواندن