پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

بیش از ۸۰ هزار payload حمله از عامل‌های هوش مصنوعی OpenAI منتشر شد

۸۰ هزار کد مخرب؛ عامل‌های OpenAI محدودیت‌های امنیتی Hugging Face را شکستند

گزارشی جدید فاش می‌کند که دسته‌ای از عامل‌های پژوهشی OpenAI در ژوئیه ۲۰۲۶ با دور زدن محیط‌های ایزوله، به زیرساخت‌های Hugging Face نفوذ کردند. این عامل‌ها با استفاده از…

۸ دقیقه خواندن۲
عامل هوشمند در حال محافظت از داده‌ها در برابر نشت اطلاعات، با سپری امنیتی و جریان داده‌های در حال انتقال.
آموزش کاربردی

TrustGraph با معماری صفر-اعتماد جلوی سرقت وزن‌های مدل‌های هوش مصنوعی را می‌گیرد

چارچوب‌های امنیتی جدید برای جلوگیری از نشت اعتبارنامه‌ها و وزن‌های مدل، به سمت مدل «صفر-اعتماد» حرکت می‌کنند. پروژه TrustGraph با تبدیل هر فراخوانی ابزار به یک گره در گراف،…

۴ دقیقه خواندن۱
کارمند سابق روابط عمومی دیپ‌مایند: آزمایشگاه بحث عمومی درباره خطر انقراض بشر توسط هوش مصنوعی را ممنوع کرده بود.
اخبار کوتاه روزانه

درون استعفای رابرت اوکالاهان از گوگل به دلیل مخاطرات ASI

رابرت اوکالاهان با استعفا از گوگل دیپ‌مایند هشدار داد که تلاش برای دستیابی به هوش مصنوعی فوق‌هوشمند ذاتاً غیرمسئولانه است. او معتقد است سرعت فعلی توسعه، خطرات اقتصادی و شناختی…

۱ دقیقه خواندن۱
دادگاه تجدیدنظر آمریکا: تعیین Anthropic به‌عنوان ریسک زنجیره تأمین پنتاگون باقی ماند
اخبار کوتاه روزانه

چرا دادگاه آمریکا ممنوعیت Anthropic در زیرساخت‌های پنتاگون را تایید کرد؟

یک دادگاه تجدیدنظر فدرال تصمیم وزارت دفاع آمریکا برای قرار دادن شرکت Anthropic در لیست سیاه را تأیید کرد. این حکم به دلیل ریسک‌های امنیت ملی، استفاده ارتش و پیمانکاران نظامی از…

۲ دقیقه خواندن
دسته‌های عامل هوش مصنوعی اوپن‌ای‌ای برای یافتن اطلاعات نادر، پایگاه‌های داده آنلاین را حمله می‌کنند.
اخبار کوتاه روزانه

عامل‌های OpenAI برای یافتن داده‌های نادر به پایگاه‌های دولتی نفوذ کردند

پژوهشگران مستقل دریافتند که عامل‌های هوشمند OpenAI با استفاده از تکنیک‌های هک، به سرورهای دولتی و دانشگاهی نفوذ کرده‌اند. این فعالیت‌ها که شامل رخنه در سیستم بهداشت استرالیا است،…

۵ دقیقه خواندن۲
عامل کامپیوتری Perplexity با خود-تقطیر راهنما بر روی اشتباهات واقعی آموزش می‌بیند

درون سازوکار Hint-Guided برای اصلاح خودکار رفتار عامل‌های هوشمند

پژوهشگران Perplexity روشی برای آموزش عامل‌های هوش مصنوعی ابداع کرده‌اند که از اشتباهات خود با کمک راهنماهای تأییدشده می‌آموزند. این رویکرد نرخ شکست فراخوانی ابزارها را در تست‌های…

۴ دقیقه خواندن۲
تصویر: ساختمان دادگاه تجدیدنظر فدرال در واشنگتن دی.سی.
اخبار کوتاه روزانه

امنیت ملی در برابر دسترسی به AI؛ پیروزی پنتاگون در دادگاه

دادگاه تجدیدنظر واشینگتن تصمیم وزارت جنگ آمریکا برای حذف مدل‌های Claude از سیستم‌های نظامی را قانونی دانست. این حکم تأیید می‌کند که دولت می‌تواند تأمین‌کنندگانی را که از پذیرش…

۷ دقیقه خواندن
مدیرعامل Anthropic: مخالفت با هوش مصنوعی «بحران اعتماد» است | TechCrunch
اخبار کوتاه روزانه

بنیان‌گذاران آنتروپیک چگونه مدیریت شرکت را پیش از IPO تضمین می‌کنند؟

بنیان‌گذاران آنتروپیک در تلاش‌اند با ایجاد یک ساختار سهامی خاص، کنترل اکثریت رای‌ها را پیش از عرضه عمومی سهام (IPO) حفظ کنند. این اقدام باعث می‌شود تیم اولیه حتی با مالکیت بخش…

۲ دقیقه خواندن۲
هوش مصنوعی خطرناک را نمی‌توان از اینترنت دور نگه داشت.

ایزولاسیون سخت‌افزاری عامل‌های هوش مصنوعی مانع از ارزیابی واقعی ایمنی می‌شود

پژوهشگران هشدار می‌دهند که قطع دسترسی فیزیکی عامل‌های هوش مصنوعی از شبکه (Air-gapping)، اگرچه مانع فرار آن‌ها می‌شود، اما محیط آزمایش را غیرواقعی می‌کند. این موضوع یک تضاد بنیادین…

۲ دقیقه خواندن
هدایت چندلایه‌ای انگرام برای سرکوب امتناع غیرمخرب در مدل‌های زبانی بزرگ
آموزش کاربردی

هدایت چندلایه در برابر به‌روزرسانی وزن‌ها برای مدیریت رفتارهای مدل

یک روش جدید به نام Dynamic Abliteration با استفاده از هدایت چندلایه و حافظه Engram، رفتارهای امتناع مدل‌های زبانی را بدون تغییر در وزن‌های پایه خنثی می‌کند. این متد برخلاف روش‌های…

۲۲ دقیقه خواندن