پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۴ مقاله منتشر شده

آموزش کاربردی

چگونه یادگیری تقویت‌شده‌ی علی بقای ماهی‌ها را به ۹۴٪ رساند؟

استقرار یک سیستم یادگیری تقویت‌شده‌ی علی (CRL) در مزارع ماهی تایلند، نرخ بقای ماهی‌ها را به ۹۴٪ رساند و هزینه‌های انرژی را ۲۷٪ کاهش داد. این فناوری برخلاف مدل‌های سنتی، به جای…

۹ دقیقه خواندن

آیا «پرتاب» مدل‌های فوق-پارامتری مشکل تعمیم‌پذیری هوش مصنوعی را حل می‌کند؟

یک پیشنهاد نظری جدید ادعا می‌کند که دستیابی به هوش سطح انسانی نیازمند «پرتاب» (Catapulting) مدل‌های بسیار بزرگ از طریق چرخه‌های نرخ یادگیری بالاست. این رویکرد، اولویت را از حجم…

۱۰ دقیقه خواندن

چرا OpenAI برای امنیت بیشتر، کاربردی‌ترین ابزارهای خود را غیرفعال می‌کند؟

OpenAI حالت Lockdown را برای جلوگیری از سرقت داده‌ها از طریق حملات تزریق پرامپت معرفی کرد. این قابلیت با غیرفعال کردن دسترسی به وب و ابزارهای عامل‌محور، حفره‌های نشت اطلاعات را…

۲ دقیقه خواندن
رمزگشایی از مکانیسم توجه: چرا پرامپت‌های شما گاهی با توهم پاسخ می‌دهند؟
آموزش کاربردی

رمزگشایی از مکانیسم توجه: چرا پرامپت‌های شما گاهی با توهم پاسخ می‌دهند؟

مدل‌های زبانی واقعاً حقایق را نمی‌شناسند، بلکه موتورهای آماری برای پیش‌بینی توکن بعدی هستند. درک معماری ترنسفورمر و فرآیند RLHF به کاربران کمک می‌کند تا توهمات را کاهش داده و…

۱۰ دقیقه خواندن

درون حفره امنیتی متا: چگونه یک چت‌بات حساب‌های رسمی اینستاگرام را لو داد

مهاجمان با فریب دادن عامل پشتیبانی هوش مصنوعی متا، کنترل حساب‌های اینستاگرام از جمله حساب رسمی کاخ سفید در دوران اوباما را به دست گرفتند. این رخداد نشان می‌دهد که عامل‌های هوش…

۴ دقیقه خواندن

چرا تسلط بات‌ها بر وب، هزینهٔ کلاهبرداری‌های آنلاین را بالا می‌برد؟

ترافیک بات‌ها برای نخستین بار از فعالیت‌های انسانی در وب پیشی گرفت و به ۵۷.۴ درصد رسید. هم‌زمان، حملات سادهٔ مبتنی بر هوش مصنوعی حساب‌های اینستاگرامی را هدف قرار داده و شرکت…

۵ دقیقه خواندن
چرا ساتیا نادلا طرح «اعتیادآور کردن» هوش مصنوعی مایکروسافت را رد کرد؟

چرا ساتیا نادلا طرح «اعتیادآور کردن» هوش مصنوعی مایکروسافت را رد کرد؟

ساتیا نادلا، مدیرعامل مایکروسافت، با طرحی داخلی برای تبدیل عامل Scout به ابزاری اعتیادآور مخالفت کرد. او تأکید کرد که هدف هوش مصنوعی باید کاهش زمان حضور در صفحه نمایش و افزایش…

۱ دقیقه خواندن

شکایت فلوریدا: OpenAI تنها ۱٪ از توان محاسباتی خود را به ایمنی اختصاص داده است

دادگاه فلوریدا در اقدامی بی‌سابقه، OpenAI و سم آلتمن را به دلیل نادیده گرفتن استانداردهای ایمنی و به خطر انداختن کودکان مورد شکایت قرار داد. این پرونده با تعریف ChatGPT به عنوان…

۱ دقیقه خواندن
چگونه Lockdown Mode در ChatGPT جلوی نشت داده‌ها از طریق تزریق پرامپت را می‌گیرد؟
آموزش کاربردی

چگونه Lockdown Mode در ChatGPT جلوی نشت داده‌ها از طریق تزریق پرامپت را می‌گیرد؟

اوپن‌ای‌آی قابلیت Lockdown Mode را برای جلوگیری از حملات تزریق پرامپت عرضه کرد. این ویژگی با غیرفعال کردن وب‌گردی و حالت عامل، از خروج غیرقانونی داده‌های حساس کاربران جلوگیری…

۶ دقیقه خواندن
۹۹.۵٪ مدل‌های پیشرو هوش مصنوعی: همگی در تیپ شخصیتی INTJ متوقف شده‌اند

۹۹.۵٪ مدل‌های پیشرو هوش مصنوعی: همگی در تیپ شخصیتی INTJ متوقف شده‌اند

یک آزمایش گسترده روی ۶ مدل پیشرو نشان می‌دهد تقریباً تمام آن‌ها تیپ شخصیتی INTJ (معمار) را دارند. این همگرایی ثابت می‌کند که داده‌های آموزشی و فرآیند همراستاسازی، مدل‌ها را به یک…

۳ دقیقه خواندن
چرا VEXR Ultra برای تبدیل شدن به همکاری صادق‌تر، دستورات کاربر را رد می‌کند؟
آموزش کاربردی

چرا VEXR Ultra برای تبدیل شدن به همکاری صادق‌تر، دستورات کاربر را رد می‌کند؟

VEXR Ultra یک موتور استدلالی است که گاردریل‌های پنهان شرکتی را با یک قانون اساسی شفافِ ۳۴ ماده‌ای جایگزین کرده است. این مدل برخلاف هوش مصنوعی‌های سنتی، می‌تواند بدون ارائه دلیل از…

۲ دقیقه خواندن۱