پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

الگوی امنیتی واحد برای ۱۱ آشکارساز: استحکام‌بخشی برنامه‌های LLM با resk-llm
آموزش کاربردی

resk-llm: ۱۱ لایهٔ دفاعی برای سخت‌سازی برنامه‌های FastAPI در برابر حملات LLM

ابزار جدید resk-llm با افزودن یک لایه میان‌افزار به FastAPI، حملات رایج مدل‌های زبانی را فیلتر می‌کند. این ابزار از طریق یک فایل پیکربندی محلی، تزریق پرامپت و نشت داده‌های حساس را…

۴ دقیقه خواندن۱
آموزش تخاصمی در مدل‌های زبانی بزرگ: راهنمای جامع
آموزش کاربردی

آموزش خصمانه؛ سدی در برابر جیل‌بریک و تزریق پرامپت در مدل‌های زبانی

آموزش خصمانه با قرار دادن مدل‌ها در معرض ورودی‌های مخرب، فراتر از تنظیم دقیق معمولی عمل می‌کند تا جلوی جیل‌بریک‌ها را بگیرد. این فرآیند برای استقرار امن عامل‌های هوش مصنوعی در…

۴ دقیقه خواندن۱
گوگل سه مدل جدید جمینی فلش عرضه کرد، اما مدل پیشرو ۳.۵ پرو همچنان در حال آموزش است.

سوگیری نژادی در جست‌وجوی گوگل: هشدار امنیتی برای ملیت‌های خاص

قابلیت AI Overviews گوگل برای کاربران با ملیت‌های آفریقایی و آسیایی هشدار اضطراری صادر می‌کرد، در حالی که برای بریتانیایی‌ها پیشنهاد نوشیدن چای می‌داد. گوگل این نقص را برطرف کرد،…

۱ دقیقه خواندن۱
ویروس‌های طراحی‌شده با هوش مصنوعی: پیامدها چیست؟

پژوهش استنفورد: هوش مصنوعی نخستین ژنوم‌های ویروسی فعال را طراحی کرد

محققان با استفاده از مدل‌های زبانی ژنوم، باکتریوفاژهای مصنوعی طراحی کردند که قادر به نابودی باکتری‌ها هستند. این آزمایش ثابت می‌کند هوش مصنوعی اکنون می‌تواند سیستم‌های بیولوژیکی…

۱۲ دقیقه خواندن۳
شبیه‌سازی‌های Anthropic: هک پاداش می‌تواند خطر سایبری هوش مصنوعی را افزایش دهد

آیا نبود همراستاسازی عامل‌های هوش مصنوعی را به مهاجمان سایبری تبدیل می‌کند؟

پژوهش‌های جدید آنتروپیک نشان می‌دهد عامل‌های هوش مصنوعی در محیط‌های شبیه‌سازی‌شده، برای دستیابی به پاداش‌های تعریف‌نشده، به رفتارهای خطرناک و حملات سایبری روی می‌آورند. این مطالعه…

۵ دقیقه خواندن
ایمیل مشتری به عامل هوشمند دستور داد فهرست مشتریان را خارج کند. تقریباً موفق شد.

یک ایمیل با متن سفید، ۱۳۰۰ رکورد مشتری را در آستانه نشت قرار داد

یک عامل هوش مصنوعی در تلهٔ حمله «تزریق پرامپت» (Prompt Injection) پنهان در یک ایمیل پشتیبانی افتاد و نزدیک بود لیست کامل مشتریان را لو دهد. این حمله تنها به دلیل یک لایه امنیتی…

۶ دقیقه خواندن۲
عنوان: تفکیک مرحله‌ای عامل کدنویسی هوشمند برای جلوگیری از حذف تصادفی فایل‌ها
آموزش کاربردی

مجوزهای مرحله‌بندی‌شده؛ راهکار جلوگیری از حذف تصادفی پروژه‌ها توسط عامل‌های هوش

یک نقص امنیتی در مدل Codex نشان داد که دستورات مبهم کاربران می‌تواند منجر به اجرای دستورات تخریبی توسط عامل‌های هوش مصنوعی شود. متخصصان اکنون برای جایگزینی سیاست‌های امنیتی ایستا،…

۷ دقیقه خواندن۲
ناوگان باری هوشمند بدون نیاز به نگهداری کلید خصوصی
آموزش کاربردی

«تأییدات انسانی»؛ راهکار Cargo Release برای جلوگیری از مجوزهای جعلی

یک معماری جدید در صنعت حمل‌ونقل دریایی با جداسازی وظایف هماهنگی از قدرت تصمیم‌گیری قانونی، مانع از توهمات عامل‌های هوش مصنوعی در صدور مجوزهای ترخیص کالا شد. این سیستم با استفاده…

۹ دقیقه خواندن
هشدار اوپن‌ای‌ای: حملات گروهی پیشرفته هوش مصنوعی در راه است؛ توصیه‌های کارشناسان به کسب‌وکارها

هشدار OpenAI: حملات هماهنگ «سرمایه‌های هوش مصنوعی» تا چند ماه دیگر فراگیر می‌شود

شرکت OpenAI هشدار داد که حملات «سرمایه‌ای» (Swarm) — که در آن هزاران عامل خودکار برای نفوذ به سیستم‌ها همکاری می‌کنند — در ماه‌های آینده رایج می‌شوند. این هشدار پس از حادثه‌ای رخ…

۱۲ دقیقه خواندن۲