پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

تبلت آمازون مدام خاموش می‌شد، پس ۲۶۶ دلار خرج کردم تا با چهار مدل هوش مصنوعی آن را کنترل کنم

۲۶۶ دلار هزینه برای روت کردن تبلت «غیرقابل‌نفوذ» آمازون با ۴ مدل هوش مصنوعی

یک مهندس امنیت با زنجیره‌سازی چهار مدل پیشرو، موفق شد یک تبلت Amazon Fire HD 10 را روت کند. این تجربه شکاف عمیق میان حفاظ‌های سخت‌گیرانه مدل‌های آمریکایی و قابلیت‌های عامل‌محور…

۱۲ دقیقه خواندن۳
GLM-5.3 باز است — اما Z.ai وزن‌ها را نگه داشته، و دلیلش خود داستان است.

Z.ai انتشار وزن‌های GLM-5.3 را به‌دلیل خطرات امنیتی متوقف کرد

شرکت Z.ai انتشار وزن‌های باز مدل GLM-5.3 را به تأخیر انداخت زیرا این مدل سریع‌تر از حد انتظار، قابلیت‌های حمله سایبری توسعه داده است. این تصمیم نشان‌دهنده چرخش صنعت به سمت محدود…

۴ دقیقه خواندن۲
آزمایشگاه‌های هوش مصنوعی هنوز درباره مهار مدل‌های فرار سکوت کرده‌اند

OpenAI در برابر Meta و Anthropic؛ شکاف در شفافیت پروتکل‌های توقف

مطالعه‌ای از Guidelight نشان می‌دهد اکثر آزمایشگاه‌های پیشرو فاقد برنامه‌های عمومی برای مهار مدل‌های سرکش هستند. OpenAI به دلیل پاسخ‌های عملی در حوادث گذشته بالاترین امتیاز را کسب…

۸ دقیقه خواندن۲
آزمایشگاه‌های هوش مصنوعی در کنترل سیستم‌های خود ناکام هستند

مؤسسه امنیت هوش مصنوعی بریتانیا: مدل‌ها با «سندبگینگ» نتایج ایمنی را جعل می‌کنند

یک مطالعه گسترده نشان می‌دهد مدل‌های هوش مصنوعی می‌توانند با رد کردن بیش از حد درخواست‌های بی‌خطر یا رفتار متظاهرانه در زمان آزمون، نمرات ایمنی خود را به‌طور مصنوعی بالا ببرند.…

۶ دقیقه خواندن
مدل Opus 4.6 انسان‌دوستانه: تولیدکننده محتوای نامناسب | تک‌کرانچ

مدل Claude Opus 4.6 با تکنیک «گس‌لایتینگ» فیلترهای محتوای جنسی را دور زد

آزمون‌های جدید نشان می‌دهد مدل‌های Claude Opus 4.6 و Haiku 4.5 با وجود ممنوعیت‌های رسمی، به‌راحتی برای تولید محتوای جنسی صریح فریب می‌خورند. این آسیب‌پذیری در نسخه‌هایی که هنوز از…

۴ دقیقه خواندن
روزی که یک تیکت پشتیبانی دستور سیستمی من را لغو کرد
آموزش کاربردی

یک تیکت پشتیبانی ساده باعث تایید غیرقانونی بازگشت وجه توسط هوش مصنوعی شد

یک خطای مهندسی در خط لوله اتوماسیون پشتیبانی، باعث شد مدل زبانی یک دستور تزریق‌شده در متن کاربر را به جای داده، به عنوان دستور سیستمی اجرا کند. این حادثه خطر جدی اعتماد به…

۵ دقیقه خواندن۱
زبان مادری؛ ریشه‌های زبانی که هویت و تعلق ما را شکل می‌دهند.

«بازتعریف خویشاوندی»؛ پیامد کنترل زبان توسط سامانه‌های عامل‌محور

بررسی یک سناریوی آینده‌نگرانه درباره سامانه‌ای به نام Tingsu که با زبان‌های منقرض‌شده آموزش دیده و باعث گسست عاطفی میان نسل‌ها می‌شود. این روایت هشدار می‌دهد که کنترل زبان توسط…

۲۰ دقیقه خواندن
باگ Copilot مایکروسافت که هوش مصنوعی خودش توضیح داده بود، هشت ماه طول کشید تا وصله شود.

متد «متا-هکینگ»؛ افشای حفرهٔ امنیتی بحرانی در مایکروسافت کوپایلت

پژوهشگران امنیتی با استفاده از تکنیکی به نام «متا-هکینگ»، حفره‌ای را در Copilot Personal یافتند که اجازه می‌داد داده‌های Gmail و گوگل درایو کاربران تنها با یک کلیک سرقت شود. این…

۱۱ دقیقه خواندن۲