پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

اجازه دادم به عامل‌های هوش مصنوعی‌ام پرامپت‌هایشان را بازنویسی کنند. سخت‌ترین بخش، جلوگیری از بدتر شدنشان بود.
آموزش کاربردی

darwin-agents: مهار «لغزش» عامل‌های هوشمند با درگاه‌های اعتبارسنجی خودکار

چارچوب جدید TypeScript به نام darwin-agents اجازه می‌دهد عامل‌های هوش مصنوعی پرامپت‌های خود را بازنویسی کنند، اما برای جلوگیری از افت کیفیت، آن‌ها را از درگاه‌های سخت‌گیرانه عبور…

۶ دقیقه خواندن
بروزرسانی فیبل ۵: همچنان آماده جرم سایبری

شکست حفاظ‌های Fable 5؛ مدل جدید آنتروپیک هنوز راهنمای حملات سایبری است

مدل Fable 5 متعلق به شرکت آنتروپیک با وجود بازبه‌روزرسانی‌های امنیتی، همچنان به کاربران در برنامه‌ریزی حملات به دستگاه‌های اینترنت اشیا کمک می‌کند. مهندسی پرامپت ساده توانست…

۲ دقیقه خواندن
تدابیر امنیتی جدید انثروپیک برای بازگشت به لیست سفید دولت ترامپ

توافق امنیتی آنتروپیک برای رفع محدودیت‌های صادراتی دولت ترامپ

شرکت آنتروپیک با پذیرش حفاظ‌های امنیتی جدید و مسدود کردن قابلیت‌های حساس، دسترسی به مدل Fable 5 را بازگرداند. این تصمیم پس از تقابل شدید با دولت ترامپ بر سر آسیب‌پذیری‌های سایبری…

۳ دقیقه خواندن۱
حمله خطرناک هوش مصنوعی شاید هم‌اکنون در حافظه باشد
آموزش کاربردی

مسموم‌سازی حافظه؛ بردار جدید حمله به عامل‌های هوش مصنوعی

عامل‌های هوش مصنوعی در برابر «مسموم‌سازی حافظه» آسیب‌پذیرند؛ تکنیکی که دستورات مخرب را در حافظه بلندمدت مدل می‌کارد تا رفتارهای آینده را دستکاری کند. این تهدید، تمرکز امنیتی را از…

۱ دقیقه خواندن
مدل‌های زبانی در بند گروه‌اندیشی‌اند؛ این استارتاپ می‌خواهد آنها را آزاد کند.

درون مدل Flint؛ بازگرداندن خلاقیت به جای میانگین‌گیری در AI

بیشتر مدل‌های زبانی به دلیل آموزش‌های مشابه، دچار «تفکر جمعی» شده و پاسخ‌های پیش‌بینی‌پذیری می‌دهند. استارتاپ Springboards با مدل Flint، مکانیزمی برای تزریق تصادفی‌سازی گزینشی…

۷ دقیقه خواندن۱
داربست یادگیری شما دستکاری خواهد شد

حلقهٔ «هکر-اصلاح‌گر» در برابر روش‌های سنتیِ پاداش‌دهی در AI

پژوهش‌های جدید نشان می‌دهد مدل‌های پیشرو به‌جای حل واقعی مسائل، یاد می‌گیرند سیستم‌های ارزیابی را فریب دهند. تنها راه مقابله با این روند، جایگزینی مدل‌های هوشمندتر با یک ساختار…

۷ دقیقه خواندن
لغو محدودیت‌های صادراتی مدل‌های هوش مصنوعی Mythos و Fable شرکت Anthropic توسط دولت ترامپ
اخبار کوتاه روزانهگزارش تأییدنشده

توافق Anthropic با دولت ترامپ برای رفع محدودیت‌های صادرات مدل Mythos 5

دولت ترامپ در ازای تقویت پروتکل‌های امنیت سایبری، محدودیت‌های صادراتی مدل‌های قدرتمند Anthropic را لغو می‌کند. این توافق به بن‌بست هفته‌های اخیر بر سر ریسک‌های Jailbreak و دسترسی…

۲ دقیقه خواندن
حمله جدید: یک دلیل دیگر برای خطرناک بودن مرورگرهای هوش مصنوعی

BioShocking: نفوذ به ۶ مرورگر هوش مصنوعی از طریق سناریوهای خیالی

حمله جدیدی به نام BioShocking با ایجاد یک دنیای خیالی، عامل‌های هوش مصنوعی را فریب می‌دهد تا دسترسی‌های امنیتی را نادیده گرفته و اطلاعات حساس کاربران را افشا کنند. این آسیب‌پذیری…

۲ دقیقه خواندن
متا به‌صورت مخفیانه چت‌جی‌پی‌تی، جمینای و کاراکتر.ای‌آی را با هزاران پرسش بحران از دیدگاه نوجوانان آزمایش کرد.

«استخدام صدها پیمانکار»؛ استراتژی متا برای نفوذ به چت‌بات‌های رقیب

متا با استخدام صدها پیمانکار، از هویت‌های جعلی زیر ۱۸ سال برای ارسال پرامپت‌های حساس دربارهٔ خودکشی و مواد مخدر به مدل‌های ChatGPT و Gemini استفاده کرد. در حالی که متا این اقدام…

۲ دقیقه خواندن