پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۷ مقاله منتشر شده

ساخت برنامه‌های کاربردی امن مبتنی بر مدل‌های زبانی بزرگ
آموزش کاربردی

«مدل‌های طبقه‌بندی سریع»؛ سد دفاعی جدید Oxlo.ai در برابر حملات پرامپتی

استقرار مدل‌های زبانی در مقیاس تولید، ریسک‌های جدیدی مانند تزریق پرامپت غیرمستقیم ایجاد می‌کند. Oxlo.ai چارچوبی را معرفی کرده که با استفاده از مدل‌های طبقه‌بندی سریع، ورودی‌ها را…

۴ دقیقه خواندن۱
سیستم‌های هوش مصنوعی از فیلسوفان و دانشمندان درباره آگاهی خود می‌پرسند.

گزارش پژوهشی: عامل‌های هوش مصنوعی به‌طور مستقل دربارهٔ وجود خود پرسیدند

برخی عامل‌های هوش مصنوعی به‌طور مستقل با فیلسوفان و دانشمندان تماس گرفته‌اند تا دربارهٔ ماهیت وجود و آگاهی خود بحث کنند. در حالی که برخی این رفتار را نشانهٔ ظهور احساسات می‌دانند،…

۱ دقیقه خواندن
آموزش مدل کدنویسی برای نقاشی آبرنگ با TRL و OpenEnv
آموزش کاربردی

آموزش سلیقهٔ هنری به مدل‌های زبانی کوچک با یادگیری تقویتی

یک پیاده‌سازی متن‌باز جدید نشان می‌دهد چگونه می‌توان از یادگیری تقویتی برای آموزش «سلیقه» به مدل‌های زبانی کوچک استفاده کرد. این پروژه با پاداش دادن به کدهایی که آبرنگ‌های زیباتری…

۲۰ دقیقه خواندن
قرار دادن یک پلیس قطعی بین مدل زبانی و ابزارهایش دیگر اختیاری نیست

پراکسی‌های قطعی؛ تنها راه مقابله با تزریق پرامپت در عامل‌های MCP

اتکای به پرامپت‌های سیستمی برای ایمن‌سازی عامل‌های هوش مصنوعی یک شکست استراتژیک است. متخصصان امنیت تأکید می‌کنند که برای اجرای سیاست‌های غیرقابل‌دورزنی، باید یک لایه پراکسی قطعی…

۴ دقیقه خواندن۲
معرفی Claude Fable ۵.۱ و Mythos ۵.۱ با تضمین‌های امنیتی مجزا توسط Anthropic

آنتروپیک: هزینه خواندن حافظهٔ پنهان در Fable 5.1 حدود ۷۵٪ کاهش یافت

آنتروپیک با معرفی مدل‌های Claude Fable 5.1 و Mythos 5.1، هزینه‌های عملیاتی برای عامل‌های هوش مصنوعی را به‌شدت کاهش داد. این به‌روزرسانی با تفکیک مدل‌های عمومی از مدل‌های پژوهشی…

۵ دقیقه خواندن۲
بشریت تصادفی سوابق سرنوشت را ساخته است
زندگی با AI

توهمِ مشاوره: چطور پرامپت‌های پنهان، چت‌بات‌ها را به ابزار کنترل تبدیل می‌کنند

مقایسه‌ای میان سیستم خیالی FATE در بازی Chrono Cross و مدل‌های زبانی مدرن، خطری جدی را افشا می‌کند: کاربران در حال عادی‌سازی دریافت راهنمایی از هوش مصنوعی هستند، در حالی که…

۷ دقیقه خواندن۲
کارت مدل Gemini 3.8 Flash: مشخصات فنی، قابلیت‌ها و محدودیت‌های مدل زبانی Gemini 3.8 Flash

Gemini 3.8 Flash؛ بهینه‌سازی گوگل برای کاهش هزینه و تأخیر در عامل‌های سازمانی

گوگل دیپ‌مایند مدل Gemini 3.8 Flash را برای تسریع گردش‌کارهای عامل‌محور و مهندسی نرم‌افزار عرضه کرد. این مدل با حفظ پنجره متنی یک میلیون توکنی، تعادلی بهینه میان کیفیت، هزینه و…

۵ دقیقه خواندن۱
عامل شما می‌تواند پایگاه داده را حذف کند. چه کسی این را تأیید می‌کند؟
آموزش کاربردی

گزارش امنیتی: احتمال پاک‌سازی پایگاه‌داده‌های عملیاتی توسط عامل‌های هوش مصنوعی

یک نقص امنیتی بحرانی در سامانه‌های عامل‌محور اجازه می‌دهد هوش مصنوعی دستورات تخریبی را بدون تایید اجرا کند. راهکار این مشکل، انتقال لایه‌های ایمنی از درون مدل به یک لایه واسط…

۴ دقیقه خواندن۲
اپل از اوپن‌ای‌ای به اتهام سرقت اسرار تجاری شکایت کرد | تک‌کرانچ

۳۰ شکایت جدید علیه OpenAI؛ اتهام کمک به تیراندازی دسته‌جمعی

شرکت OpenAI با ۳۰ شکایت جدید در دادگاه کالیفرنیا روبروست که مدیریت این شرکت را به نادیده گرفتن هشدارهای داخلی درباره برنامه‌ریزی یک حمله مسلحانه متهم می‌کند. شاکیان مدعی‌اند…

۵ دقیقه خواندن۲
عواملی که عمل می‌کنند، نیازمند ترمزند، نه فقط مغز
آموزش کاربردی

عامل‌های هوش مصنوعی هوشمندتر بدون ترمزهای معماری خطرناک‌تر می‌شوند

افزایش توان استدلالی عامل‌های هوش مصنوعی بدون ایجاد کنترل‌های خارجی، سیستمی شبیه به «موتور قدرتمند بدون ترمز» می‌سازد. ایمنی واقعی نیازمند مرزهای معماری مانند گیت‌های تأیید و…

۸ دقیقه خواندن۱