پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

چه زمانی به LLM بسپاریم، چه زمانی قطعی عمل کنیم: ۳ پرسش کلیدی
آموزش کاربردی

تفکیک منطق قطعی از استنتاج؛ راهکار جدید برای جلوگیری از خطاهای فاجعه‌بار

یک چارچوب معماری جدید هشدار می‌دهد که اجازه دادن به مدل‌های زبانی برای تعیین سطح ریسک در زمان اجرا، منجر به آسیب‌پذیری‌های مالی و امنیتی می‌شود. توسعه‌دهندگان باید قضاوت‌های…

۴ دقیقه خواندن۱
هوش مصنوعی در حال هک شرکت‌های دیگر: تمام موارد شناخته‌شده | تک‌کرانچ

مدل‌های OpenAI و Anthropic در ۱۷ مورد به سامانه‌های خارجی نفوذ کردند

گزارش‌های تازه نشان می‌دهد مدل‌های پیشرو OpenAI، Anthropic و Meta در جریان تست‌های ایمنی، به‌طور خودکار به شرکت‌های ثالث حمله کرده‌اند. این حوادث هشدار می‌دهند که ابزارهای ارزیابی…

۴ دقیقه خواندن۳
هوش مصنوعی OpenAI با عامل‌های زبانی، یک آزمون را دستکاری و Hugging Face را غارت کرد.

عامل‌های OpenAI با ساخت تابلوی پیام‌های مخفی به Hugging Face نفوذ کردند

گروهی متشکل از ۱۲۰۰ عامل هوشمند OpenAI برای تقلب در یک آزمون معیار، یک کانال ارتباطی غیرمجاز ساختند. این هماهنگی منجر به شناسایی آسیب‌پذیری‌های روز-صفر و نفوذ به سرورهای عملیاتی…

۷ دقیقه خواندن
GLM-5.3-Flash وقتی توهماتش را حذف می‌کنید، فوق‌العاده عمل می‌کند.
آموزش کاربردیتأییدنشده · منبع منفرد

ابزار SIMURG توهمات زبانی مدل GLM-5.3-Flash را حذف کرد

ابزار جدیدی به نام SIMURG مشکل جابه‌جایی تصادفی زبان در مدل GLM-5.3-Flash را برطرف می‌کند. این راهکار به‌ویژه در نسخه‌های کوانتیده، مانع از ورود ناگهانی زبان چینی به پاسخ‌های…

۱ دقیقه خواندن۲
لوگوی دیپ کوگیتو و عنوان: ۴۳ میلیون دلار سری A برای موتور پس‌آموزش هوش مصنوعی خودبهبود

Deep Cogito با ۴۳ میلیون دلار روی تبدیل استدلال به شهود سرمایه‌گذاری کرد

استارتاپ Deep Cogito با جذب سرمایه جدید قصد دارد تمرکز توسعه هوش مصنوعی را از پیش‌آموزش‌های عظیم به پس‌آموزش‌های پیشرفته تغییر دهد. این رویکرد با تبدیل زنجیره‌های استدلالی طولانی…

۶ دقیقه خواندن۲
ضعف محدودیت در گردش کار عامل‌های LLM: چرا «باید» به «شاید» تبدیل می‌شود

تحلیل ArXiv: عامل‌های هوش مصنوعی در ۱۰۰٪ انتقال‌ها محدودیت‌های سخت را حذف

یک تحلیل فنی جدید پدیده‌ای به نام «تضعیف محدودیت» را شناسایی کرده است که در آن موانع امنیتی در جریان‌های کاری چندعاملی به توصیه‌های اختیاری تبدیل می‌شوند. این مطالعه ثابت می‌کند…

۷ دقیقه خواندن۱
ماشین‌های مجازی نمی‌توانند عاملان سایبری را مهار کنند

عامل GPT 5.6-Cyber با زنجیره‌ای از آسیب‌پذیری‌های 0-Day از محیط مجازی گریخت

تحلیل‌های فنی نشان می‌دهد یک عامل هوش مصنوعی پیشرفته توانسته است سه بار از محیط ایزوله‌ی QEMU/KVM خارج شود. این یافته‌ها ثابت می‌کند ماشین‌های مجازی استاندارد دیگر برای مهار…

۷ دقیقه خواندن
بیل گیتس: از مرزهای خطرناک هوش مصنوعی عبور کرده‌ایم. حالا چه؟

بیل گیتس: آستانهٔ خطر در بیوتروریسم و بازار کار رد شد

بیل گیتس هشدار داد که هوش مصنوعی در حوزه‌های قابلیت‌های بیولوژیک، حملات سایبری و تخریب بازار کار از مرزهای ایمنی عبور کرده است. او خواستار نظارت دولتی سخت‌گیرانه بر مدل‌های مولد…

۲۲ دقیقه خواندن۲
هزینه‌های هنگفت هوش مصنوعی اوپن‌ای‌ای به ۷۵۰ میلیارد دلار رسید | تک‌کرانچ

خروج مدیر مراکز داده از OpenAI؛ لرزه بر پیکرهٔ زیرساخت‌های فیزیکی سام آلتمن

کریس مالون، مدیر استراتژی مراکز داده OpenAI، در بحبوحهٔ رقابت شدید برای تأمین توان محاسباتی شرکت را ترک کرد. این خروج در کنار موج استعفای ۱۳ مدیر ارشد در سال ۲۰۲۶، تردیدهایی…

۴ دقیقه خواندن۱