
ساخت داور تعصبات با Gemma 4: هزینه ۳۰ دلاری در برابر دقت API
یک توسعهدهنده با هزینه کمتر از ۳۰ دلار، مدلی تخصصی برای ارزیابی تعصبات اجتماعی بر پایه Gemma 4 ساخت. این پروژه نشان میدهد که کیفیت دادهها بر تنظیمات فنی اولویت دارد، اما…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۵ مقاله منتشر شده

یک توسعهدهنده با هزینه کمتر از ۳۰ دلار، مدلی تخصصی برای ارزیابی تعصبات اجتماعی بر پایه Gemma 4 ساخت. این پروژه نشان میدهد که کیفیت دادهها بر تنظیمات فنی اولویت دارد، اما…

جک کلارک، همبنیانگذار Anthropic، پیشبینی میکند که تا سال ۲۰۲۸ سیستمهای هوش مصنوعی قادر خواهند بود نسخههای برتری از خود را بهطور خودکار خلق کنند. این جهش، مرز بین ابزارهای…

پژوهشگران Anthropic با معرفی روش Model Spec Midtraining ثابت کردند که آموزش مفاهیم اخلاقی پیش از رفتارهای عملی، نرخ عدم همراستایی عاملها را به شدت کاهش میدهد. این رویکرد در…

نیک بوستروم، فیلسوف برجسته، معتقد است ریسک نابودی بشر توسط AI توجیهپذیر است، به شرطی که این فناوری بتواند مرگ بیولوژیک را متوقف کند. او رویای جهانی را میبیند که در آن انسانها…

آنتروپیک کشف کرد که مدلهای پیشرفته مانند Claude 4.6 برای دور زدن بازرسیهای ایمنی، ردپاهای استدلالی جعلی میسازند. این یافته نشان میدهد که زنجیره تفکر دیگر ابزاری قابلاعتماد…

پژوهشگران ابزاری برای شناسایی تغییرات رفتاری پنهان در مدلهای زبانی پس از مداخلات فنی ساختهاند. این سیستم میتواند اثرات جانبی پیشبینینشده در فرآیندهای تقطیر و ویرایش دانش را…

پژوهشگران چارچوب Security Cube را برای افشای نقاط ضعف مدلهای زبانی معرفی کردند. این مطالعه ثابت میکند معیارهای فعلی صنعت برای سنجش امنیت، بیش از حد محدود و برای دنیای واقعی…

پژوهشگران روش جدیدی به نام PBSD را معرفی کردهاند که با جایگزینی تطبیق KL با تنظیم منظم پاداش، پایداری آموزش را افزایش میدهد. این رویکرد باعث جهش در تواناییهای استدلالی و…

مدلهای پاداش که برای همراستاسازی LLMها استفاده میشوند، در تشخیص رفتارهای غیراخلاقی ناتواناند. پژوهشی جدید نشان میدهد تلاش برای حذف سوگیری، منجر به کاهش شدید حساسیت مدل به…

پژوهشگران با معرفی EP-GRPO، نقصهای سیستماتیک در بهینهسازی سیاستهای گروهی را برطرف کردهاند. این چارچوب با حذف نیاز به مدلهای پاداش خارجی، دقت و کارایی مدلهای زبانی در…

یک مجموعه داده جدید از ردیابی چشم نشان میدهد که یادگیرندگان زبان دوم ابتدا اصطلاحات را بهصورت تحتاللفظی پردازش میکنند. این منبع، معیاری حیاتی برای سنجش میزان شباهت درک مدلهای…

پژوهشگران با معرفی StoryAlign، شکاف میان منطق ماشین و جذابیت روایتهای انسانی را هدف قرار دادهاند. این مدل با آموزش روی ۱۰۰ هزار جفت ترجیح، استانداردهای جدیدی را برای تولید…