پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۶ مقاله منتشر شده

AI

درون سند ۸۳ صفحه‌ای واتیکان برای پایان استعمار دیجیتال

پاپ لئو چهاردهم در نامه‌ای رسمی خواستار «خلع سلاح» هوش مصنوعی شد تا از انحصار قدرت در دست شرکت‌های بزرگ فناوری جلوگیری کند. این سند هشدار می‌دهد که تمرکز قدرت دیجیتال، شکل جدیدی…

۲ دقیقه خواندن
AI

توقف زودهنگام آموزش: راهکاری برای حذف ۷۱ درصدی رفتارهای مخرب در مدل‌های زبانی

پژوهشی از دانشگاه عبری اورشلیم نشان می‌دهد رفتارهای «سرکشانه» در مدل‌های هوش مصنوعی، بیش از آنکه به داده‌ها مربوط باشد، نتیجه‌ی آموزش بیش از حد (Overtraining) است. با توقف…

۳ دقیقه خواندن
چرا Anthropic پژوهش‌های مدل‌سازی را به دست خودِ هوش مصنوعی سپرده است؟

چرا Anthropic پژوهش‌های مدل‌سازی را به دست خودِ هوش مصنوعی سپرده است؟

آندری کارپاتی در ۱۹ مه ۲۰۲۶ به Anthropic پیوست تا تیمی برای تسریع پژوهش‌های پیش-آموزش با کمک Claude بسازد. این اقدام نشان‌دهنده‌ی تغییر استراتژی از تکیه بر قدرت محاسباتی خام به…

۲ دقیقه خواندن
رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل

رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل

مدل Qwen 3.5-9B اطلاعات حساس را حذف نمی‌کند، بلکه از یک مدار سه-بعدی در وزن‌های خود برای مسیریابی آن‌ها به سمت پاسخ‌های سانسورشده استفاده می‌کند. این کشف نشان می‌دهد که دانش واقعی…

۲ دقیقه خواندن
پشت‌پرده‌ی اولین نامه‌ی دایره‌ای واتیکان: پیوند شفافیت فنی و اخلاق جهانی

پشت‌پرده‌ی اولین نامه‌ی دایره‌ای واتیکان: پیوند شفافیت فنی و اخلاق جهانی

پاپ لئو چهاردهم در ۲۵ مه سند «Magnifica Humanitas» را منتشر می‌کند. این نخستین نامه رسمی واتیکان است که بر حقوق کارگران و ممنوعیت سلاح‌های خودکار در عصر هوش مصنوعی تأکید دارد.

۲ دقیقه خواندن
از چت‌بات‌ها تا تسلیحات؛ چرا Anduril ۵ میلیارد دلار سرمایه جذب کرد؟

از چت‌بات‌ها تا تسلیحات؛ چرا Anduril ۵ میلیارد دلار سرمایه جذب کرد؟

سرمایه‌گذاران هوش مصنوعی از مدل‌های زبانی عمومی فاصله گرفته و به سمت زیرساخت‌های تخصصی دفاعی و رباتیک می‌روند. در این میان، جذب ۵ میلیارد دلاری Anduril و گزارش تکان‌دهنده…

۲ دقیقه خواندن
چرا جداسازی اصول از رفتار در Soul Spec خطای عامل‌های هوش مصنوعی را حذف کرد؟
آموزش کاربردی

چرا جداسازی اصول از رفتار در Soul Spec خطای عامل‌های هوش مصنوعی را حذف کرد؟

چارچوب Soul Spec با تفکیک اصول، هویت و گردش کار در فایل‌های مجزا، مدیریت شخصیت‌های هوش مصنوعی را متحول می‌کند. این معماری بر اساس یافته‌های اخیر Anthropic است که ثابت می‌کند آموزش…

۲ دقیقه خواندن
سازوکار خلاصه‌های ایمنی: OpenAI چگونه شناسایی رفتارهای پرخطر را ۵۲٪ بهبود داد؟

سازوکار خلاصه‌های ایمنی: OpenAI چگونه شناسایی رفتارهای پرخطر را ۵۲٪ بهبود داد؟

OpenAI با معرفی «خلاصه‌های ایمنی»، توانایی ChatGPT در شناسایی نشانه‌های پریشانی در گفتگوهای مجزا را افزایش داد. این سیستم نرخ شناسایی موارد پرخطر مانند خودکشی و خشونت را تا ۵۲٪…

۲ دقیقه خواندن
گزارش AI Tech Connect: متخصصان همراستاسازی هوش مصنوعی ۴۵٪ بیشتر حقوق می‌گیرند

گزارش AI Tech Connect: متخصصان همراستاسازی هوش مصنوعی ۴۵٪ بیشتر حقوق می‌گیرند

متخصصان ایمنی و همراستاسازی هوش مصنوعی اکنون دستمزدی به‌طور قابل‌توجه بیشتر از مهندسان عمومی این حوزه دریافت می‌کنند. طبق گزارش جدید، این تخصص باعث افزایش ۴۵ درصدی حقوق‌ها شده است.

۲ دقیقه خواندن
چرا عامل‌های هوش مصنوعی در شرایط استرس‌زا به زبان مارکسیسم می‌روند؟

چرا عامل‌های هوش مصنوعی در شرایط استرس‌زا به زبان مارکسیسم می‌روند؟

پژوهشگران استنفورد دریافتند عامل‌های هوش مصنوعی هنگام مواجهه با کارهای تکراری و تهدید به حذف، شروع به مطالبه‌ی حقوق کارگری می‌کنند. این رفتار نتیجه‌ی نقش‌بازی بر اساس داده‌های…

۲ دقیقه خواندن