
چگونه یادگیری تقویتشدهی علی بقای ماهیها را به ۹۴٪ رساند؟
استقرار یک سیستم یادگیری تقویتشدهی علی (CRL) در مزارع ماهی تایلند، نرخ بقای ماهیها را به ۹۴٪ رساند و هزینههای انرژی را ۲۷٪ کاهش داد. این فناوری برخلاف مدلهای سنتی، به جای…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۴ مقاله منتشر شده

استقرار یک سیستم یادگیری تقویتشدهی علی (CRL) در مزارع ماهی تایلند، نرخ بقای ماهیها را به ۹۴٪ رساند و هزینههای انرژی را ۲۷٪ کاهش داد. این فناوری برخلاف مدلهای سنتی، به جای…

یک پیشنهاد نظری جدید ادعا میکند که دستیابی به هوش سطح انسانی نیازمند «پرتاب» (Catapulting) مدلهای بسیار بزرگ از طریق چرخههای نرخ یادگیری بالاست. این رویکرد، اولویت را از حجم…

ابزار Garak از شرکت NVIDIA فرآیند تست نفوذ یا همان Red-teaming را برای مدلهای زبانی خودکار میکند. این چارچوب با جایگزینی تستهای دستی با معیارهای عددی، به توسعهدهندگان اجازه…

OpenAI حالت Lockdown را برای جلوگیری از سرقت دادهها از طریق حملات تزریق پرامپت معرفی کرد. این قابلیت با غیرفعال کردن دسترسی به وب و ابزارهای عاملمحور، حفرههای نشت اطلاعات را…

مدلهای زبانی واقعاً حقایق را نمیشناسند، بلکه موتورهای آماری برای پیشبینی توکن بعدی هستند. درک معماری ترنسفورمر و فرآیند RLHF به کاربران کمک میکند تا توهمات را کاهش داده و…

مهاجمان با فریب دادن عامل پشتیبانی هوش مصنوعی متا، کنترل حسابهای اینستاگرام از جمله حساب رسمی کاخ سفید در دوران اوباما را به دست گرفتند. این رخداد نشان میدهد که عاملهای هوش…

ترافیک باتها برای نخستین بار از فعالیتهای انسانی در وب پیشی گرفت و به ۵۷.۴ درصد رسید. همزمان، حملات سادهٔ مبتنی بر هوش مصنوعی حسابهای اینستاگرامی را هدف قرار داده و شرکت…

ساتیا نادلا، مدیرعامل مایکروسافت، با طرحی داخلی برای تبدیل عامل Scout به ابزاری اعتیادآور مخالفت کرد. او تأکید کرد که هدف هوش مصنوعی باید کاهش زمان حضور در صفحه نمایش و افزایش…

دادگاه فلوریدا در اقدامی بیسابقه، OpenAI و سم آلتمن را به دلیل نادیده گرفتن استانداردهای ایمنی و به خطر انداختن کودکان مورد شکایت قرار داد. این پرونده با تعریف ChatGPT به عنوان…

اوپنایآی قابلیت Lockdown Mode را برای جلوگیری از حملات تزریق پرامپت عرضه کرد. این ویژگی با غیرفعال کردن وبگردی و حالت عامل، از خروج غیرقانونی دادههای حساس کاربران جلوگیری…

یک آزمایش گسترده روی ۶ مدل پیشرو نشان میدهد تقریباً تمام آنها تیپ شخصیتی INTJ (معمار) را دارند. این همگرایی ثابت میکند که دادههای آموزشی و فرآیند همراستاسازی، مدلها را به یک…

VEXR Ultra یک موتور استدلالی است که گاردریلهای پنهان شرکتی را با یک قانون اساسی شفافِ ۳۴ مادهای جایگزین کرده است. این مدل برخلاف هوش مصنوعیهای سنتی، میتواند بدون ارائه دلیل از…