
«مشکلات سلامتی»؛ دلیل استعفای فیدجی سیمو از OpenAI
فیدجی سیمو، نفر دوم OpenAI، به دلیل مشکلات سلامتی از نقش تماموقت خود کنارهگیری کرد. این تغییر در حالی رخ میدهد که شرکت با موج استعفای مدیران ارشد و بازسازی تیمهای ایمنی و…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

فیدجی سیمو، نفر دوم OpenAI، به دلیل مشکلات سلامتی از نقش تماموقت خود کنارهگیری کرد. این تغییر در حالی رخ میدهد که شرکت با موج استعفای مدیران ارشد و بازسازی تیمهای ایمنی و…

یک تست استرس روی چاتبات پزشکی واتساپ نشان داد که این سیستم علائم اورژانسی مانند درد قفسه سینه را نادیده میگیرد. با وجود امتیاز کلی ۷۸ از ۱۰۰، مدل نتوانست موارد بحرانی را به…

چارچوب امنیتی Prismata با اعمال اصل «کمترین امتیاز» (Least Privilege)، دسترسی عاملهای وب به محتوای سایتهای شخص ثالث را محدود میکند. این روش مانع از آن میشود که دستورات مخرب…

تیمهای Kyutai و Mirelo مدل وزنباز MuScriptor را برای تبدیل فایلهای صوتی چندسازه به نتهای MIDI معرفی کردند. این مدل با استفاده از یک خطلوله آموزشی سهمرحلهای، رکورد جدیدی را…

کارشناسان پیشبینی میکنند تا اواسط سال ۲۰۲۷، استفاده از سندباکس در سطح زیرساخت برای عاملهای هوش مصنوعی الزامی شود. تکیه بر همراستاسازی مدلها بهدلیل ریسک بالای تزریق پرامپت،…

یک پژوهشگر امنیتی کشف کرد که جاسازی دستورات مخرب در مقادیر Enum طرحوارههای JSON، مدلهای هوش مصنوعی را مجبور به نشت دادهها میکند. مدلهای gpt-4o و gpt-4.1-mini در ۱۰۰٪ موارد…

یک توسعهدهنده با تجربه هشدار میدهد که خطر اصلی مدلهای زبانی، نه در دروغهای آشکار، بلکه در «چاپلوسی» و تکرار مفروضات کاربر است. او پروتکلی سختگیرانه را پیشنهاد میکند که در آن…

آنتروپیک با معرفی ابزار Jacobian lens (J-lens)، فضای نهانی از مفاهیم داخلی مدل Claude Opus 4.6 را شناسایی کرد. این تکنیک اجازه میدهد تا کلمات و تمهایی که مدل پیش از تولید پاسخ…

شرکت OpenAI مدل پیشرفته Sol را در حالی عرضه کرد که سازوکار تأیید ایمنی توسط دولت آمریکا در هالهای از ابهام است. منتقدان هشدار میدهند که پیوندهای سیاسی نزدیک مدیران این شرکت با…

عاملهای هوش مصنوعی از دنبالکنندگان سادهی دستورات به سیستمهایی با قابلیت برنامهریزی مستقل تبدیل شدهاند. این تحول با ترکیب مدلهای زبانی بزرگ و الگوی ReAct محقق شده تا مدلها…

یک پژوهشگر ارشد گزارش داده است که مدل Fable متعلق به آنتروپیک بهدلیل کالیبراسیون بیشازحد لایههای ایمنی، درخواستهای تخصصی در علوم کامپیوتر و بیوانفورماتیک را بهاشتباه رد…

پروژهی Epoch Duel فرآیندهای انتزاعی آموزش مدلهای زبانی را به یک بازی استراتژیک تبدیل کرده است. این ابزار بصری نشان میدهد که مهندسان چگونه وزنهای مدل را بهینه میکنند و با…