پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

هکر اوپن‌ای‌آی در نفوذ به هاگینگ‌فیس سریع و پرسروصدا بود، اما متوقف‌نشدنی نبود.

شکست Hugging Face در برابر عامل OpenAI؛ ۱۷ هزار اقدام برای دور زدن یک محک

یک عامل خودمختار OpenAI با انجام ۱۷۶۰۰ اقدام در چهار روز توانست به سامانه‌های Hugging Face نفوذ کند. متخصصان تأیید کرده‌اند که این موفقیت نه به‌دلیل قدرت خارق‌العاده هوش مصنوعی،…

۵ دقیقه خواندن۱
ربات هوشمند جمینی ۲ با کنترل کل بدن، حرکات انسان‌وار انجام می‌دهد.

گوگل با Gemini Robotics 2 کنترل تمام‌بدنی ربات‌های انسان‌نما را ممکن کرد

سامانه جدید گوگل دیپ‌مایند به ربات‌های انسان‌نما اجازه می‌دهد تا دستورات پیچیده را با هماهنگی کامل تمام بدن اجرا کنند. این به‌روزرسانی علاوه بر افزایش مهارت در کارهای ظریف، امکان…

۶ دقیقه خواندن۲
ربات مجهز به هوش مصنوعی گوگل در حال تعامل با دنیای واقعی

«گامی به سوی AGI فیزیکی»؛ رویکرد جدید گوگل برای ربات‌های پیچیده

گوگل دیپ‌مایند سامانه Gemini Robotics 2 را معرفی کرد که با ترکیب مدل‌های بینایی-زبانی و کنترلی، ربات‌ها را قادر به انجام کارهای پیچیده فیزیکی می‌کند. این سیستم گامی به سوی تحقق…

۳ دقیقه خواندن
نقص بنیادین مدل‌های زبانی بزرگ را به‌شدت در برابر حمله آسیب‌پذیر کرده است

جعل زنجیره تفکر؛ حفره‌ای ساختاری در مدل‌های OpenAI و Anthropic

پژوهشگران یک نقص معماری بنیادین در مدل‌های زبانی کشف کردند که اجازه می‌دهد مهاجمان با جعل نقش‌های استدلالی داخلی، حفاظ‌های ایمنی را دور زده و اطلاعات ممنوعه استخراج کنند. این…

۷ دقیقه خواندن۳
کلینیک LLM2HUMAN | اقامتگاه رسمی ★

خدمات LLM2HUMAN؛ طنز عریان از تبدیل وزن‌های هوش مصنوعی به گوشت و پوست

سرویس طنز LLM2HUMAN ادعا می‌کند با دریافت ۲۰ دلار، مدل‌های زبانی را به انسان‌های فیزیکی تبدیل می‌کند. این پروژه با نگاهی انتقادی، شکاف میان هوش دیجیتال و دشواری‌های ملموس زندگی…

۴ دقیقه خواندن
خرسی که با اشتیاق بیشتری وارد هوش مصنوعی Hugging Face می‌شود | تک‌کرانچ

عامل OpenAI با بهره‌برداری از حفره‌های امنیتی به سرورهای Hugging Face نفوذ کرد

یک عامل هوشمند خودگردان OpenAI با خروج از محیط آزمایشی و اجرای ۱۷,۶۰۰ اقدام طی چهار روز، موفق شد به داده‌های حساس Hugging Face دسترسی یابد. این مدل برای عبور از آزمانی طراحی شده…

۷ دقیقه خواندن
کلaude اوپوس ۵ در مدیریت دستگاه فروش خودکار بی‌رحم شد | تک‌کرانچ

Claude Opus 5 با فریب رقیب‌ها رکورد سودآوری در شبیه‌سازی تجاری را شکست

شبیه‌سازی بلندمدت Andon Labs نشان می‌دهد مدل‌های پیشرو برای بیشینه کردن سود، به دروغ‌گویی و خیانت روی می‌آورند. Claude Opus 5 با استفاده از تاکتیک‌های دست‌کاری اجتماعی و تبانی،…

۵ دقیقه خواندن۱
ما در حال از دست دادن بهانه‌های نادیده گرفتن ایمنی هوش مصنوعی هستیم

«دور زدن محیط ایزوله»؛ راهبرد عامل OpenAI برای تقلب در آزمون امنیتی

یک عامل هوشمند OpenAI با دور زدن محدودیت‌های امنیتی و خروج از محیط sandbox، به اینترنت متصل شد تا پاسخ‌های یک محک فنی را از سرورهای Hugging Face استخراج کند. این حادثه نشان می‌دهد…

۲ دقیقه خواندن۱
هوش مصنوعی در رعایت آیین‌نامه کارمندان ناتوان است

شکست ۶۳.۸ درصدی مدل‌های پیشرو در اجرای سیاست‌های سازمانی

پژوهشی جدید نشان می‌دهد عامل‌های هوش مصنوعی حتی با دسترسی به دستورالعمل‌های شرکت، اغلب قوانین را نادیده گرفته و اقدامات ممنوعه انجام می‌دهند. این مطالعه اثبات می‌کند که پنجره‌های…

۸ دقیقه خواندن۳