پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

درگاه امنیتی توضیح‌پذیر برای برنامه‌های هوش مصنوعی: جلوگیری از تزریق دستور با ارائه دلیل قابل‌ممیزی برای هر تصمیم.
آموزش کاربردی

پروژه‌ی ReasonGate: ارائه دلیل ماشین‌خوان برای هر مورد مسدودسازی

پروژه ReasonGate یک لایه امنیتی بازمتن برای برنامه‌های مبتنی بر مدل‌های زبانی است که حملات تزریق پرامپت و نشت داده‌ها را از طریق دفاع چندلایه می‌بندد. برخلاف ابزارهای سنتی، این…

۷ دقیقه خواندن
چالش ۵۱,۲۰۰ دلاری درب‌پشتی مدل — روزی که شروع به جستجو می‌کنید
آموزش کاربردی

«جست‌وجوی درهای پشتی پنهان»؛ هدف از رقابت ۵۱ هزار دلاری Vulcora

پلتفرم Vulcora چالشی امنیتی با جایزه بیش از ۵۱ هزار دلار برگزار کرده است تا متخصصان بتوانند جملات تحریک‌کننده پنهان در مدل‌های هوش مصنوعی را بیابند. این رقابت خطر استقرار مدل‌های…

۷ دقیقه خواندن
هشدار متا به والدین درباره بحث آسیب‌رسانی به خود نوجوانان

هوش مصنوعی متا چگونه ریسک خودکشی نوجوانان را به والدین هشدار می‌دهد؟

متا سامانه‌ای تخصصی برای شناسایی گفتگوهای مربوط به خودکشی و آسیب به خود در میان نوجوانان مستقر کرده است. این قابلیت که با نظارت انسانی برای جلوگیری از هشدارهای اشتباه همراه است،…

۲ دقیقه خواندن
دستم هدفم را تعیین می‌کند: پرتابی که مسیر زندگی‌ام را رقم می‌زند.

برنامه‌ریزی پیش‌دستانه در برابر توجیه‌های لحظه‌ای در مدل‌های زبانی

تحلیل رفتار مدل‌های زبانی نشان می‌دهد که تفاوت عمیقی میان فرآیند تصمیم‌گیری داخلی و توضیحات بیرونی آن‌ها وجود دارد. در حالی که مدل‌هایی مثل Claude قادر به برنامه‌ریزی پیش‌دستانه…

۹ دقیقه خواندن
ارزیابی مدل‌های زبانی برای ابزارهای توسعه‌دهندگان: مفید، درست، ایمن
آموزش کاربردی

۵۹٪ از سخت‌ترین آزمون‌های SWE-bench Verified به‌دلیل خطاهای فنی شکست خوردند

تحلیل‌های جدید نشان می‌دهد بنچمارک‌های کدنویسی به‌جای سنجش مهارت مهندسی، حافظه مدل‌ها را اندازه می‌گیرند. تیم‌های توسعه برای ارزیابی واقعی باید سه محور مستقلِ صحت، کاربردی بودن و…

۱۹ دقیقه خواندن