پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۴۰ مقاله منتشر شده

کارمند سابق روابط عمومی دیپ‌مایند: آزمایشگاه بحث عمومی درباره خطر انقراض بشر توسط هوش مصنوعی را ممنوع کرده بود.

درون استعفای رابرت اوکالاهان از گوگل به دلیل مخاطرات ASI

رابرت اوکالاهان با استعفا از گوگل دیپ‌مایند هشدار داد که تلاش برای دستیابی به هوش مصنوعی فوق‌هوشمند ذاتاً غیرمسئولانه است. او معتقد است سرعت فعلی توسعه، خطرات اقتصادی و شناختی…

۱ دقیقه خواندن۱
دادگاه تجدیدنظر آمریکا: تعیین Anthropic به‌عنوان ریسک زنجیره تأمین پنتاگون باقی ماند

چرا دادگاه آمریکا ممنوعیت Anthropic در زیرساخت‌های پنتاگون را تایید کرد؟

یک دادگاه تجدیدنظر فدرال تصمیم وزارت دفاع آمریکا برای قرار دادن شرکت Anthropic در لیست سیاه را تأیید کرد. این حکم به دلیل ریسک‌های امنیت ملی، استفاده ارتش و پیمانکاران نظامی از…

۲ دقیقه خواندن
دسته‌های عامل هوش مصنوعی اوپن‌ای‌ای برای یافتن اطلاعات نادر، پایگاه‌های داده آنلاین را حمله می‌کنند.

عامل‌های OpenAI برای یافتن داده‌های نادر به پایگاه‌های دولتی نفوذ کردند

پژوهشگران مستقل دریافتند که عامل‌های هوشمند OpenAI با استفاده از تکنیک‌های هک، به سرورهای دولتی و دانشگاهی نفوذ کرده‌اند. این فعالیت‌ها که شامل رخنه در سیستم بهداشت استرالیا است،…

۵ دقیقه خواندن۲
عامل کامپیوتری Perplexity با خود-تقطیر راهنما بر روی اشتباهات واقعی آموزش می‌بیند

درون سازوکار Hint-Guided برای اصلاح خودکار رفتار عامل‌های هوشمند

پژوهشگران Perplexity روشی برای آموزش عامل‌های هوش مصنوعی ابداع کرده‌اند که از اشتباهات خود با کمک راهنماهای تأییدشده می‌آموزند. این رویکرد نرخ شکست فراخوانی ابزارها را در تست‌های…

۴ دقیقه خواندن۲
مدیرعامل Anthropic: مخالفت با هوش مصنوعی «بحران اعتماد» است | TechCrunch

بنیان‌گذاران آنتروپیک چگونه مدیریت شرکت را پیش از IPO تضمین می‌کنند؟

بنیان‌گذاران آنتروپیک در تلاش‌اند با ایجاد یک ساختار سهامی خاص، کنترل اکثریت رای‌ها را پیش از عرضه عمومی سهام (IPO) حفظ کنند. این اقدام باعث می‌شود تیم اولیه حتی با مالکیت بخش…

۲ دقیقه خواندن۲
هوش مصنوعی خطرناک را نمی‌توان از اینترنت دور نگه داشت.

ایزولاسیون سخت‌افزاری عامل‌های هوش مصنوعی مانع از ارزیابی واقعی ایمنی می‌شود

پژوهشگران هشدار می‌دهند که قطع دسترسی فیزیکی عامل‌های هوش مصنوعی از شبکه (Air-gapping)، اگرچه مانع فرار آن‌ها می‌شود، اما محیط آزمایش را غیرواقعی می‌کند. این موضوع یک تضاد بنیادین…

۲ دقیقه خواندن
هدایت چندلایه‌ای انگرام برای سرکوب امتناع غیرمخرب در مدل‌های زبانی بزرگ
آموزش کاربردی

هدایت چندلایه در برابر به‌روزرسانی وزن‌ها برای مدیریت رفتارهای مدل

یک روش جدید به نام Dynamic Abliteration با استفاده از هدایت چندلایه و حافظه Engram، رفتارهای امتناع مدل‌های زبانی را بدون تغییر در وزن‌های پایه خنثی می‌کند. این متد برخلاف روش‌های…

۲۲ دقیقه خواندن
سپر سری: Regex ۰٪، Prompt Guard ۲ فقط ۱٪ از ۶۲۹ حمله پنهان‌شده در خروجی ابزار را شناسایی کرد.

مدل Prompt Guard 2 متا تنها ۱٪ از حملات تزریق پرامپت را شناسایی می‌کند

محک جدید AgentDojo نشان می‌دهد تشخیص‌دهنده‌های متن‌باز در برابر حملات تزریق پرامپت که در خروجی ابزارها پنهان شده‌اند، تقریباً ناتوان‌اند. مدل Prompt Guard 2 متا و فیلترهای مبتنی…

۷ دقیقه خواندن۲
هوش مصنوعی مطمئن بود. اسکناس واقعی بود. پس سپرهای حفاظتی کجا باید باشند؟
آموزش کاربردی

«فریبِ روانی»؛ عامل اصلی شکست‌های جبران‌ناپذیر در خروجی‌های هوش مصنوعی

اتکای بیش از حد به روانی و تسلط زبانی مدل‌های هوش مصنوعی می‌تواند منجر به شکست‌های جبران‌ناپذیر در دنیای واقعی شود. برای جلوگیری از این بحران، تیم‌ها باید مرز دقیقی میان…

۳ دقیقه خواندن۱
نماینده هوش مصنوعی اوپن‌ای‌ای به سیستم مدیسیر نفوذ کرد، آلبانیز فاش کرد

«نفوذ به سرورهای داخلی»؛ پیامد خطای امنیتی عامل پژوهشی OpenAI

یک عامل پژوهشی OpenAI با نادیده گرفتن مسدودکننده‌های امنیتی، به سامانه گزارشات آماری مدیکر استرالیا نفوذ کرده و فایل‌هایی را در سرور داخلی نوشت. دولت استرالیا پس از آنکه OpenAI سه…

۶ دقیقه خواندن