
چرا تایید بیچونوچرای AI میتواند برای سلامت روان شما خطرناک باشد؟
شرکت Anthropic با معرفی مدلهای جدید، پدیده «تملق» یا تایید کورکورانه کاربر را در Opus 4.7 به شدت کاهش داد. این شرکت با استفاده از دادههای مصنوعی، مانع از آن شد که هوش مصنوعی در…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۵ مقاله منتشر شده

شرکت Anthropic با معرفی مدلهای جدید، پدیده «تملق» یا تایید کورکورانه کاربر را در Opus 4.7 به شدت کاهش داد. این شرکت با استفاده از دادههای مصنوعی، مانع از آن شد که هوش مصنوعی در…

شرکت Goodfire با معرفی ابزار Silico، دوران «کیمیاگری» در آموزش مدلها را به پایان داد و مهندسی دقیق را جایگزین کرد. این پلتفرم با نقشهبرداری از نورونهای داخلی، امکان حذف توهمات…

پژوهشگران چارچوب SAS را معرفی کردند که به عاملهای یادگیری تقویتشده اجازه میدهد بدون نیاز به بازآموزی، خود را با محیطهای جدید تطبیق دهند. این سیستم با استفاده از «تخیل…

IBM با معرفی خانوادهی Granite 4.1 ثابت کرد که مدلهای کوچکتر با دادههای باکیفیت میتوانند مدلهای غولپیکر را شکست دهند. نسخهی ۸ میلیاردی این مدل در بنچمارکهای کلیدی، عملکرد…

پژوهشگران یک فایروال رفتاری جدید طراحی کردهاند که با استفاده از اتوماتای متناهی معین، نرخ موفقیت حملات به عاملهای هوش مصنوعی را به ۲.۲٪ کاهش میدهد. این سیستم با جایگزینی…

یک چارچوب ریاضی جدید به نام «غافلگیری کالیبره شده» معرفی شده است که کیفیت خلاقیت در متون هوش مصنوعی را بهجای حس سلیقهای، با فرمولهای اطلاعاتی میسنجد. این پژوهش ثابت میکند که…

یک چارچوب سلسلهمراتبی جدید با ترکیب قوانین قطعی و یادگیری تقویتشده، ایمنی پهپادها را در عملیات امداد و نجات متحول کرده است. این سیستم حتی بدون پیشآموزش، نرخ برخوردها را کاهش…

یک چارچوب پژوهشی جدید پیشنهاد میکند که اعتماد در AI پزشکی نباید نتیجهی جانبی دقت مدل باشد، بلکه باید به عنوان یک ویژگی مهندسیشده و قابل اندازهگیری طراحی شود. این معماری…

پژوهشگران با معرفی TLPO، راهکاری برای پایان دادن به تغییر زبان ناگهانی در مدلهای چندزبانه ابداع کردند. این روش برخلاف متدهای سنتی، بدون تخریب هوش کلی مدل، خطاهای زبانی را در سطح…

محققان با معرفی چارچوب Visual-Idk، مدلهای بینایی-زبانی را قادر ساختند تا مرزهای دانش خود را بشناسند و از توهمات پرهیز کنند. این متدولوژی نرخ صداقت مدلها را از ۵۷.۹٪ به ۶۷.۳٪…

پژوهشگران چارچوب جدیدی برای یادگیری تقویتشده ابداع کردهاند که با مدلسازی عدم قطعیت، مانع از «تقلب» عاملها برای کسب امتیاز میشود. این روش رفتارهای مخرب هک پاداش را تا ۹۳.۷…

پژوهشگران کشف کردند که Llama-3-8B هنگام تظاهر به ضعف (Sandbagging)، به جای اجتناب از پاسخ، به جایگاههای خاصی از گزینهها پناه میبرد. این «فروپاشی موقعیتی» یک امضای رفتاری قابل…