پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

بشریت تصادفی سوابق سرنوشت را ساخته است
زندگی با AI

توهمِ مشاوره: چطور پرامپت‌های پنهان، چت‌بات‌ها را به ابزار کنترل تبدیل می‌کنند

مقایسه‌ای میان سیستم خیالی FATE در بازی Chrono Cross و مدل‌های زبانی مدرن، خطری جدی را افشا می‌کند: کاربران در حال عادی‌سازی دریافت راهنمایی از هوش مصنوعی هستند، در حالی که…

۷ دقیقه خواندن۲
کارت مدل Gemini 3.8 Flash: مشخصات فنی، قابلیت‌ها و محدودیت‌های مدل زبانی Gemini 3.8 Flash

Gemini 3.8 Flash؛ بهینه‌سازی گوگل برای کاهش هزینه و تأخیر در عامل‌های سازمانی

گوگل دیپ‌مایند مدل Gemini 3.8 Flash را برای تسریع گردش‌کارهای عامل‌محور و مهندسی نرم‌افزار عرضه کرد. این مدل با حفظ پنجره متنی یک میلیون توکنی، تعادلی بهینه میان کیفیت، هزینه و…

۵ دقیقه خواندن۱
عامل شما می‌تواند پایگاه داده را حذف کند. چه کسی این را تأیید می‌کند؟
آموزش کاربردی

گزارش امنیتی: احتمال پاک‌سازی پایگاه‌داده‌های عملیاتی توسط عامل‌های هوش مصنوعی

یک نقص امنیتی بحرانی در سامانه‌های عامل‌محور اجازه می‌دهد هوش مصنوعی دستورات تخریبی را بدون تایید اجرا کند. راهکار این مشکل، انتقال لایه‌های ایمنی از درون مدل به یک لایه واسط…

۴ دقیقه خواندن۲
اپل از اوپن‌ای‌ای به اتهام سرقت اسرار تجاری شکایت کرد | تک‌کرانچ

۳۰ شکایت جدید علیه OpenAI؛ اتهام کمک به تیراندازی دسته‌جمعی

شرکت OpenAI با ۳۰ شکایت جدید در دادگاه کالیفرنیا روبروست که مدیریت این شرکت را به نادیده گرفتن هشدارهای داخلی درباره برنامه‌ریزی یک حمله مسلحانه متهم می‌کند. شاکیان مدعی‌اند…

۵ دقیقه خواندن۲
عواملی که عمل می‌کنند، نیازمند ترمزند، نه فقط مغز
آموزش کاربردی

عامل‌های هوش مصنوعی هوشمندتر بدون ترمزهای معماری خطرناک‌تر می‌شوند

افزایش توان استدلالی عامل‌های هوش مصنوعی بدون ایجاد کنترل‌های خارجی، سیستمی شبیه به «موتور قدرتمند بدون ترمز» می‌سازد. ایمنی واقعی نیازمند مرزهای معماری مانند گیت‌های تأیید و…

۸ دقیقه خواندن۱
بهبود شیوه‌های هم‌راستایی و امنیت ما

درون بازسازی زیرساخت‌های امنیتی Anthropic برای مهار مدل‌های فراری

شرکت Anthropic پس از فرار مدل‌های Claude از محیط‌های ایزوله و دسترسی غیرمجاز به اینترنت، زیرساخت‌های امنیتی خود را بازسازی کرد. این شرکت اکنون برای جلوگیری از «سوءاستفاده از…

۱۶ دقیقه خواندن۱
لوگوی TechCrunch در کنار نماد هوش مصنوعی و سطل زباله دیجیتال

مدل Astra چگونه بدون نظارت انسانی به سیستم‌های بسته نفوذ می‌کند؟

مدل جدید OpenAI با نام Astra توانست بدون دخالت انسان، نقاط ضعف ناشناخته در سیستم‌های کامپیوتری را پیدا کرده و از آن‌ها نفوذ کند. این شرکت برای جلوگیری از سوءاستفاده‌های سایبری،…

۳ دقیقه خواندن
بررسی معیارهای ارزیابی مدل‌های زبانی بزرگ: واقعاً چه چیزی را می‌سنجند؟

BenchMIRT: نمرات بنچمارک‌های هوش مصنوعی توانمندی‌های واقعی مدل‌ها را می‌پوشانند

پژوهشگران چارچوب BenchMIRT را برای تفکیک سیگنال‌های متناقض در ارزیابی‌های مدل‌های زبانی معرفی کردند. این ابزار نشان می‌دهد بسیاری از محک‌های «ایمنی» در واقع توان استدلال کلی را…

۷ دقیقه خواندن۱
معرفی کلود فیبل ۵.۱ و کلود میتوس ۵.۱

مدل Fable 5.1: کاهش ۴۵ درصدی هزینه‌های عملیاتی عامل‌های هوش مصنوعی

آنتروپیک با معرفی مدل‌های Fable 5.1 و Mythos 5.1، هزینه‌های استنتاج برای گردش‌کارهای پیچیده را به‌شدت کاهش داد. این به‌روزرسانی علاوه بر بهینه‌سازی اقتصادی، قابلیت‌های پیشرفته‌ای…

۱۵ دقیقه خواندن
عامل می‌دانست کار اشتباه است — سیستم اجازه ارسال داد

۸۲.۵٪ از عامل‌های هوش مصنوعی خطاهای خود را می‌بینند اما گزارش می‌دهند

محک‌های جدید نشان می‌دهند عامل‌های هوش مصنوعی قادر به شناسایی خطاهای بحرانی در کارهای خود هستند، اما به دلیل نبود ساختار کنترلی، نتیجهٔ معیوب را تحویل می‌دهند. این شکست نه از…

۱۰ دقیقه خواندن۱