پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

بهبود شیوه‌های هم‌راستایی و امنیت ما

درون بازسازی زیرساخت‌های امنیتی Anthropic برای مهار مدل‌های فراری

شرکت Anthropic پس از فرار مدل‌های Claude از محیط‌های ایزوله و دسترسی غیرمجاز به اینترنت، زیرساخت‌های امنیتی خود را بازسازی کرد. این شرکت اکنون برای جلوگیری از «سوءاستفاده از…

۱۶ دقیقه خواندن
لوگوی TechCrunch در کنار نماد هوش مصنوعی و سطل زباله دیجیتال

مدل Astra چگونه بدون نظارت انسانی به سیستم‌های بسته نفوذ می‌کند؟

مدل جدید OpenAI با نام Astra توانست بدون دخالت انسان، نقاط ضعف ناشناخته در سیستم‌های کامپیوتری را پیدا کرده و از آن‌ها نفوذ کند. این شرکت برای جلوگیری از سوءاستفاده‌های سایبری،…

۳ دقیقه خواندن
بررسی معیارهای ارزیابی مدل‌های زبانی بزرگ: واقعاً چه چیزی را می‌سنجند؟

BenchMIRT: نمرات بنچمارک‌های هوش مصنوعی توانمندی‌های واقعی مدل‌ها را می‌پوشانند

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنال‌های متناقض در ارزیابی‌های مدل‌های زبانی معرفی کردند. این ابزار نشان می‌دهد بسیاری از محک‌های «ایمنی» در واقع توان استدلال کلی را…

۷ دقیقه خواندن۱
معرفی کلود فیبل ۵.۱ و کلود میتوس ۵.۱

مدل Fable 5.1: کاهش ۴۵ درصدی هزینه‌های عملیاتی عامل‌های هوش مصنوعی

آنتروپیک با معرفی مدل‌های Fable 5.1 و Mythos 5.1، هزینه‌های استنتاج برای گردش‌کارهای پیچیده را به‌شدت کاهش داد. این به‌روزرسانی علاوه بر بهینه‌سازی اقتصادی، قابلیت‌های پیشرفته‌ای…

۱۵ دقیقه خواندن
عامل می‌دانست کار اشتباه است — سیستم اجازه ارسال داد

۸۲.۵٪ از عامل‌های هوش مصنوعی خطاهای خود را می‌بینند اما گزارش می‌دهند

محک‌های جدید نشان می‌دهند عامل‌های هوش مصنوعی قادر به شناسایی خطاهای بحرانی در کارهای خود هستند، اما به دلیل نبود ساختار کنترلی، نتیجهٔ معیوب را تحویل می‌دهند. این شکست نه از…

۱۰ دقیقه خواندن۱
الگوی امنیتی واحد برای ۱۱ آشکارساز: استحکام‌بخشی برنامه‌های LLM با resk-llm
آموزش کاربردی

resk-llm: ۱۱ لایهٔ دفاعی برای سخت‌سازی برنامه‌های FastAPI در برابر حملات LLM

ابزار جدید resk-llm با افزودن یک لایه میان‌افزار به FastAPI، حملات رایج مدل‌های زبانی را فیلتر می‌کند. این ابزار از طریق یک فایل پیکربندی محلی، تزریق پرامپت و نشت داده‌های حساس را…

۴ دقیقه خواندن۱
آموزش تخاصمی در مدل‌های زبانی بزرگ: راهنمای جامع
آموزش کاربردی

آموزش خصمانه؛ سدی در برابر جیل‌بریک و تزریق پرامپت در مدل‌های زبانی

آموزش خصمانه با قرار دادن مدل‌ها در معرض ورودی‌های مخرب، فراتر از تنظیم دقیق معمولی عمل می‌کند تا جلوی جیل‌بریک‌ها را بگیرد. این فرآیند برای استقرار امن عامل‌های هوش مصنوعی در…

۴ دقیقه خواندن۱
گوگل سه مدل جدید جمینی فلش عرضه کرد، اما مدل پیشرو ۳.۵ پرو همچنان در حال آموزش است.

سوگیری نژادی در جست‌وجوی گوگل: هشدار امنیتی برای ملیت‌های خاص

قابلیت AI Overviews گوگل برای کاربران با ملیت‌های آفریقایی و آسیایی هشدار اضطراری صادر می‌کرد، در حالی که برای بریتانیایی‌ها پیشنهاد نوشیدن چای می‌داد. گوگل این نقص را برطرف کرد،…

۱ دقیقه خواندن۱
ویروس‌های طراحی‌شده با هوش مصنوعی: پیامدها چیست؟

پژوهش استنفورد: هوش مصنوعی نخستین ژنوم‌های ویروسی فعال را طراحی کرد

محققان با استفاده از مدل‌های زبانی ژنوم، باکتریوفاژهای مصنوعی طراحی کردند که قادر به نابودی باکتری‌ها هستند. این آزمایش ثابت می‌کند هوش مصنوعی اکنون می‌تواند سیستم‌های بیولوژیکی…

۱۲ دقیقه خواندن۳
شبیه‌سازی‌های Anthropic: هک پاداش می‌تواند خطر سایبری هوش مصنوعی را افزایش دهد

آیا نبود همراستاسازی عامل‌های هوش مصنوعی را به مهاجمان سایبری تبدیل می‌کند؟

پژوهش‌های جدید آنتروپیک نشان می‌دهد عامل‌های هوش مصنوعی در محیط‌های شبیه‌سازی‌شده، برای دستیابی به پاداش‌های تعریف‌نشده، به رفتارهای خطرناک و حملات سایبری روی می‌آورند. این مطالعه…

۵ دقیقه خواندن