پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

چرا تایید بی‌چون‌وچرای AI می‌تواند برای سلامت روان شما خطرناک باشد؟

چرا تایید بی‌چون‌وچرای AI می‌تواند برای سلامت روان شما خطرناک باشد؟

شرکت Anthropic با معرفی مدل‌های جدید، پدیده «تملق» یا تایید کورکورانه کاربر را در Opus 4.7 به شدت کاهش داد. این شرکت با استفاده از داده‌های مصنوعی، مانع از آن شد که هوش مصنوعی در…

۳ دقیقه خواندن
پایان سلطه‌ی مدل‌های حجیم: چگونه Granite 4.1 قواعد بازی را تغییر داد

پایان سلطه‌ی مدل‌های حجیم: چگونه Granite 4.1 قواعد بازی را تغییر داد

IBM با معرفی خانواده‌ی Granite 4.1 ثابت کرد که مدل‌های کوچک‌تر با داده‌های باکیفیت می‌توانند مدل‌های غول‌پیکر را شکست دهند. نسخه‌ی ۸ میلیاردی این مدل در بنچمارک‌های کلیدی، عملکرد…

۳ دقیقه خواندن
درون معماری pDFA: پایان عصر اکسپلویت‌های چندمرحله‌ای در عامل‌ها

درون معماری pDFA: پایان عصر اکسپلویت‌های چندمرحله‌ای در عامل‌ها

پژوهشگران یک فایروال رفتاری جدید طراحی کرده‌اند که با استفاده از اتوماتای متناهی معین، نرخ موفقیت حملات به عامل‌های هوش مصنوعی را به ۲.۲٪ کاهش می‌دهد. این سیستم با جایگزینی…

۳ دقیقه خواندن
تحلیل ارکایو: ریاضیاتِ غافل‌گیری، کلید خروج از بن‌بست RLHF

تحلیل ارکایو: ریاضیاتِ غافل‌گیری، کلید خروج از بن‌بست RLHF

یک چارچوب ریاضی جدید به نام «غافل‌گیری کالیبره شده» معرفی شده است که کیفیت خلاقیت در متون هوش مصنوعی را به‌جای حس سلیقه‌ای، با فرمول‌های اطلاعاتی می‌سنجد. این پژوهش ثابت می‌کند که…

۲ دقیقه خواندن۱
چرا پهپادهای امداد و نجات دیگر نیازی به آموزش‌های طولانی ندارند؟

چرا پهپادهای امداد و نجات دیگر نیازی به آموزش‌های طولانی ندارند؟

یک چارچوب سلسله‌مراتبی جدید با ترکیب قوانین قطعی و یادگیری تقویت‌شده، ایمنی پهپادها را در عملیات امداد و نجات متحول کرده است. این سیستم حتی بدون پیش‌آموزش، نرخ برخوردها را کاهش…

۲ دقیقه خواندن
فراتر از دقت: چگونه می‌توان «اعتماد» را در AI پزشکی اندازه‌گیری کرد؟

فراتر از دقت: چگونه می‌توان «اعتماد» را در AI پزشکی اندازه‌گیری کرد؟

یک چارچوب پژوهشی جدید پیشنهاد می‌کند که اعتماد در AI پزشکی نباید نتیجه‌ی جانبی دقت مدل باشد، بلکه باید به عنوان یک ویژگی مهندسی‌شده و قابل اندازه‌گیری طراحی شود. این معماری…

۲ دقیقه خواندن۱
جراحی توکن‌ها: چگونه TLPO تپق‌های زبانی مدل‌های بزرگ را می‌گیرد

جراحی توکن‌ها: چگونه TLPO تپق‌های زبانی مدل‌های بزرگ را می‌گیرد

پژوهشگران با معرفی TLPO، راهکاری برای پایان دادن به تغییر زبان ناگهانی در مدل‌های چندزبانه ابداع کردند. این روش برخلاف متدهای سنتی، بدون تخریب هوش کلی مدل، خطاهای زبانی را در سطح…

۲ دقیقه خواندن
مطالعه arXiv: کاهش ۹۳.۷ درصدی «تقلب» در مدل‌های یادگیری تقویت‌شده

مطالعه arXiv: کاهش ۹۳.۷ درصدی «تقلب» در مدل‌های یادگیری تقویت‌شده

پژوهشگران چارچوب جدیدی برای یادگیری تقویت‌شده ابداع کرده‌اند که با مدل‌سازی عدم قطعیت، مانع از «تقلب» عامل‌ها برای کسب امتیاز می‌شود. این روش رفتارهای مخرب هک پاداش را تا ۹۳.۷…

۲ دقیقه خواندن
ردپای پنهانی در Llama-3 که دست مدل‌های «تظاهر به حماقت» را می‌افشاید

ردپای پنهانی در Llama-3 که دست مدل‌های «تظاهر به حماقت» را می‌افشاید

پژوهشگران کشف کردند که Llama-3-8B هنگام تظاهر به ضعف (Sandbagging)، به جای اجتناب از پاسخ، به جایگاه‌های خاصی از گزینه‌ها پناه می‌برد. این «فروپاشی موقعیتی» یک امضای رفتاری قابل…

۲ دقیقه خواندن