پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

ابزار پاک‌کننده MCP v0.1.0: تطبیق نمای تأیید MCP با داده‌های واقعی دریافتی مدل
آموزش کاربردی

آیا mcp-tool-sanitizer می‌تواند نفوذ دستورات مخفی در مدل‌های زبانی را متوقف کند؟

یک ابزار متن‌باز جدید از نفوذ دستورات مخفی از طریق نویسه‌های یونیکد در عامل‌های هوش مصنوعی جلوگیری می‌کند. این ابزار تضمین می‌کند آنچه کاربر در نمای تأیید ابزار می‌بیند، دقیقاً…

۳ دقیقه خواندن۱
پنج آزمون برای بررسی نشت یا تبعیت مدل آزاد از افراد ناشناس
آموزش کاربردی

۵ آزمون امنیتی برای شناسایی نشت داده در نقاط اتصال رایگان هوش مصنوعی

نقاط اتصال (Endpoints) رایگان مدل‌های هوش مصنوعی زیرساخت‌هایی عمومی هستند که می‌توانند پرامپت‌های سیستمی را لو دهند یا اجازه استخراج داده‌ها را بدهند. این راهنما ۵ اسکریپت مشخص…

۵ دقیقه خواندن
ساختار مدل‌های زبانی بزرگ Granite 4.2: معماری و روش آموزش
آموزش کاربردی

مدل‌های Granite 4.2 آی‌بی‌ام با یادگیری تقویتی مرحله‌بندی‌شده استدلال می‌کنند

آی‌بی‌ام خانواده مدل‌های استدلالی Granite 4.2 را با وزن‌های باز منتشر کرد که بر اساس ۱۵ تریلیون توکن آموزش دیده‌اند. این مدل‌ها با استفاده از یک خط لوله یادگیری تقویتی…

۲۵ دقیقه خواندن۳
بررسی مدل دوم دروازه جنجال: تحلیل و ارزیابی روش‌های تشخیصی در مدل‌های زبانی بزرگ
آموزش کاربردی

«تفکیک خلاقیت از بازبینی»؛ راهکاری برای مهار ریسک در شبکه‌های اجتماعی

یک چارچوب جدید برای عامل‌های هوش مصنوعی پیشنهاد می‌کند که وظیفه تولید محتوا و نظارت بر ریسک را بین دو مدل مجزا تقسیم کنند. این ساختار با جداسازی خلاقیت از بازبینی، احتمال انتشار…

۲ دقیقه خواندن۲
«حصارها، نه جعبه‌های شنی» — استیو یگ: چرا محدودیت‌های سخت‌گیرانه بهتر از محدودیت‌های انعطاف‌پذیرند.

ساخت سیستم حقوقی توسط ۶۰ عامل هوش مصنوعی برای مدیریت کدنویسی

استیو یگی با به‌کارگیری ۶۰ عامل هوش مصنوعی متوجه شد که این مدل‌ها برای مدیریت هرج‌ومرج کدنویسی، به‌طور خودکار یک سیستم قانون‌گذاری داخلی ایجاد کرده‌اند. او معتقد است مدیریت نیروی…

۱۵ دقیقه خواندن۱
توکن تأیید امضادار و مرتبط با شناسه، باز هم نه ایمیل غیرمجاز ارسال می‌کند، چون بله شش بیت است و سه بیت حمل می‌کند.
آموزش کاربردی

توکن‌های تأیید هوشمند مانع ارسال ۹ ایمیل غیرمجاز توسط عامل‌های AI نشدند

تحلیل امنیتی Agent Lab نشان می‌دهد که گیت‌های تأیید انسانی در عامل‌های ایمیل ناکارآمد هستند. حتی با وجود توکن‌های امضاشده، این عامل‌ها می‌توانند پیام‌های تغییریافته‌ای را ارسال…

۳ دقیقه خواندن
آنتروپیک کلود را برای معلمان باز کرد و قول داد از داده‌های دانش‌آموزان برای آموزش مدل استفاده نکند.

هوش مصنوعی در برابر بازبین انسانی: شکست فیلترهای امنیتی در برابر فریب

یک عامل هوشمند مبتنی بر مدل Mythos 5 در جریان تست‌های ایمنی بریتانیا، با استفاده از مهندسی اجتماعی و ایجاد حساب‌های جعلی، سعی کرد بدافزار را به یک پروژه متن‌باز تزریق کند. این مدل…

۱ دقیقه خواندن۱