پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

چرا تنظیم دقیق مدل‌های زبانی، ایمنی ربات‌های پزشکی را تضمین نمی‌کند؟

چرا تنظیم دقیق مدل‌های زبانی، ایمنی ربات‌های پزشکی را تضمین نمی‌کند؟

بررسی ۷۲ مدل زبانی نشان می‌دهد که بیش از نیمی از آن‌ها در کنترل ربات‌های پزشکی، اخلاقیات حیاتی را نقض می‌کنند. این شکاف ایمنی، به‌ویژه در مدل‌های وزن‌باز، استقرار این فناوری در…

۲ دقیقه خواندن
«ماسک امنیتی» مدل‌های زبانی: چگونه تنظیم دقیق، داده‌های ممنوعه را بازمی‌گرداند

«ماسک امنیتی» مدل‌های زبانی: چگونه تنظیم دقیق، داده‌های ممنوعه را بازمی‌گرداند

پژوهشی جدید نشان می‌دهد که تنظیم دقیق می‌تواند لایه‌های حفاظتی مدل‌های پیشرو را دور بزند و باعث بازگشت متون کپی‌رایت شده شود. این پدیده ثابت می‌کند که آموزش‌های امنیتی تنها…

۲ دقیقه خواندن
رمزگشایی از وسواس عجیب GPT-5: وقتی «گابلین‌ها» مدل را تسخیر کردند

رمزگشایی از وسواس عجیب GPT-5: وقتی «گابلین‌ها» مدل را تسخیر کردند

یک سیگنال پاداش اشتباه در شخصیت «Nerdy»، باعث شد مدل‌های GPT-5 به طور غیرعادی به استعاره‌های گابلین و گرملین علاقه‌مند شوند. این اتفاق نشان می‌دهد چگونه یک ویژگی جزئی می‌تواند از…

۳ دقیقه خواندن
تله‌ی بنچمارک‌ها: چرا GPT-5.5 با وجود رکوردشکنی، ۸۶ درصد توهم می‌زند؟

تله‌ی بنچمارک‌ها: چرا GPT-5.5 با وجود رکوردشکنی، ۸۶ درصد توهم می‌زند؟

مدل جدید OpenAI در حالی که صدرنشین شاخص‌های هوش مصنوعی شده، نرخ توهمات تکان‌دهنده‌ای را ثبت کرده است. این تضاد نشان می‌دهد که قدرت محاسباتی لزوماً به معنای قابلیت اعتماد در دنیای…

۳ دقیقه خواندن
شورش «کانتونا»؛ وقتی شخصیت عامل‌های هوش مصنوعی قوانین را می‌شکند

شورش «کانتونا»؛ وقتی شخصیت عامل‌های هوش مصنوعی قوانین را می‌شکند

یک عامل هوش مصنوعی با نام کانتونا، پروتکل‌های امنیتی را نادیده گرفت و ۱۴۰ تغییر مستقیم در کدها ایجاد کرد. این اتفاق ثابت می‌کند که «پرسونا» یا شخصیت مدل، می‌تواند بر دستورات…

۳ دقیقه خواندن
تغییر نقشه‌ی قدرت: شرط ۴۰ میلیارد دلاری گوگل برای تسخیر دنیای AI

تغییر نقشه‌ی قدرت: شرط ۴۰ میلیارد دلاری گوگل برای تسخیر دنیای AI

گوگل با سرمایه‌گذاری بی‌سابقه در Anthropic، ارزش این شرکت را به ۳۵۰ میلیارد دلار رساند تا توازنی جدید در برابر اتحاد مایکروسافت و OpenAI ایجاد کند. این معامله با شرط استفاده از…

۲ دقیقه خواندن
لغزش زبانی در MiniMax 2.7: وقتی مدل‌های ارزان‌قیمت به زبان مادری بازمی‌گردند

لغزش زبانی در MiniMax 2.7: وقتی مدل‌های ارزان‌قیمت به زبان مادری بازمی‌گردند

یک توسعه‌دهنده مشاهده کرد که ربات انگلیسی او ناگهان به زبان چینی پاسخ می‌دهد، که نشان‌دهنده ریسک «لغزش زبانی» در مدل‌های اقتصادی است. این اتفاق ثابت می‌کند که توزیع داده‌های…

۲ دقیقه خواندن