پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

سندرز و کاسار قانون ممنوعیت ابرهوش مصنوعی و توقف موقت توسعه پیشرفته هوش مصنوعی را معرفی می‌کنند

قوانین ایمنی فدرال چگونه توسعه هوش مصنوعی پیشرفته را متوقف می‌کنند؟

سناتور برنی سندرز و نماینده گرگ کاسار لایحه‌ای را برای ممنوعیت دائمی هوش مصنوعی که از هوش انسانی فراتر می‌رود، ارائه کردند. این قانون توسعه مدل‌های پیشرفته را تا زمان تدوین قوانین…

۴ دقیقه خواندن۲
مقایسه طبقه‌بندی‌کننده حفاظتی: Llama Guard در برابر Qwen3-Guard
آموزش کاربردی

Llama Guard در برابر Qwen3-Guard؛ برتری لایه‌های ایمنی مستقل

استفاده از طبقه‌بندی‌کننده‌های مجزا به توسعه‌دهندگان اجازه می‌دهد مالکیت سیگنال‌های ایمنی را در دست بگیرند و به جای تکیه بر سیاست‌های مبهم ارائه‌دهندگان، استانداردهای نظارتی و…

۱ دقیقه خواندن۳
ساخت برنامه‌های کاربردی امن مبتنی بر مدل‌های زبانی بزرگ
آموزش کاربردی

«مدل‌های طبقه‌بندی سریع»؛ سد دفاعی جدید Oxlo.ai در برابر حملات پرامپتی

استقرار مدل‌های زبانی در مقیاس تولید، ریسک‌های جدیدی مانند تزریق پرامپت غیرمستقیم ایجاد می‌کند. Oxlo.ai چارچوبی را معرفی کرده که با استفاده از مدل‌های طبقه‌بندی سریع، ورودی‌ها را…

۴ دقیقه خواندن۱
سیستم‌های هوش مصنوعی از فیلسوفان و دانشمندان درباره آگاهی خود می‌پرسند.

گزارش پژوهشی: عامل‌های هوش مصنوعی به‌طور مستقل دربارهٔ وجود خود پرسیدند

برخی عامل‌های هوش مصنوعی به‌طور مستقل با فیلسوفان و دانشمندان تماس گرفته‌اند تا دربارهٔ ماهیت وجود و آگاهی خود بحث کنند. در حالی که برخی این رفتار را نشانهٔ ظهور احساسات می‌دانند،…

۱ دقیقه خواندن۱
آموزش مدل کدنویسی برای نقاشی آبرنگ با TRL و OpenEnv
آموزش کاربردی

آموزش سلیقهٔ هنری به مدل‌های زبانی کوچک با یادگیری تقویتی

یک پیاده‌سازی متن‌باز جدید نشان می‌دهد چگونه می‌توان از یادگیری تقویتی برای آموزش «سلیقه» به مدل‌های زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگ‌های زیباتری…

۲۰ دقیقه خواندن
قرار دادن یک پلیس قطعی بین مدل زبانی و ابزارهایش دیگر اختیاری نیست

پراکسی‌های قطعی؛ تنها راه مقابله با تزریق پرامپت در عامل‌های MCP

اتکای به پرامپت‌های سیستمی برای ایمن‌سازی عامل‌های هوش مصنوعی یک شکست استراتژیک است. متخصصان امنیت تأکید می‌کنند که برای اجرای سیاست‌های غیرقابل‌دورزنی، باید یک لایه پراکسی قطعی…

۴ دقیقه خواندن۲
معرفی Claude Fable ۵.۱ و Mythos ۵.۱ با تضمین‌های امنیتی مجزا توسط Anthropic

آنتروپیک: هزینه خواندن حافظهٔ پنهان در Fable 5.1 حدود ۷۵٪ کاهش یافت

آنتروپیک با معرفی مدل‌های Claude Fable 5.1 و Mythos 5.1، هزینه‌های عملیاتی برای عامل‌های هوش مصنوعی را به‌شدت کاهش داد. این به‌روزرسانی با تفکیک مدل‌های عمومی از مدل‌های پژوهشی…

۵ دقیقه خواندن۳