پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۴ مقاله منتشر شده

رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل

رمزگشایی از سازوکار سانسور در Qwen 3.5: نقش فضای سه-بعدی در وزن‌های مدل

مدل Qwen 3.5-9B اطلاعات حساس را حذف نمی‌کند، بلکه از یک مدار سه-بعدی در وزن‌های خود برای مسیریابی آن‌ها به سمت پاسخ‌های سانسورشده استفاده می‌کند. این کشف نشان می‌دهد که دانش واقعی…

۲ دقیقه خواندن۲
پشت‌پرده‌ی اولین نامه‌ی دایره‌ای واتیکان: پیوند شفافیت فنی و اخلاق جهانی

پشت‌پرده‌ی اولین نامه‌ی دایره‌ای واتیکان: پیوند شفافیت فنی و اخلاق جهانی

پاپ لئو چهاردهم در ۲۵ مه سند «Magnifica Humanitas» را منتشر می‌کند. این نخستین نامه رسمی واتیکان است که بر حقوق کارگران و ممنوعیت سلاح‌های خودکار در عصر هوش مصنوعی تأکید دارد.

۲ دقیقه خواندن
از چت‌بات‌ها تا تسلیحات؛ چرا Anduril ۵ میلیارد دلار سرمایه جذب کرد؟

از چت‌بات‌ها تا تسلیحات؛ چرا Anduril ۵ میلیارد دلار سرمایه جذب کرد؟

سرمایه‌گذاران هوش مصنوعی از مدل‌های زبانی عمومی فاصله گرفته و به سمت زیرساخت‌های تخصصی دفاعی و رباتیک می‌روند. در این میان، جذب ۵ میلیارد دلاری Anduril و گزارش تکان‌دهنده…

۲ دقیقه خواندن۱
چرا جداسازی اصول از رفتار در Soul Spec خطای عامل‌های هوش مصنوعی را حذف کرد؟
آموزش کاربردی

چرا جداسازی اصول از رفتار در Soul Spec خطای عامل‌های هوش مصنوعی را حذف کرد؟

چارچوب Soul Spec با تفکیک اصول، هویت و گردش کار در فایل‌های مجزا، مدیریت شخصیت‌های هوش مصنوعی را متحول می‌کند. این معماری بر اساس یافته‌های اخیر Anthropic است که ثابت می‌کند آموزش…

۲ دقیقه خواندن۱
سازوکار خلاصه‌های ایمنی: OpenAI چگونه شناسایی رفتارهای پرخطر را ۵۲٪ بهبود داد؟

سازوکار خلاصه‌های ایمنی: OpenAI چگونه شناسایی رفتارهای پرخطر را ۵۲٪ بهبود داد؟

OpenAI با معرفی «خلاصه‌های ایمنی»، توانایی ChatGPT در شناسایی نشانه‌های پریشانی در گفتگوهای مجزا را افزایش داد. این سیستم نرخ شناسایی موارد پرخطر مانند خودکشی و خشونت را تا ۵۲٪…

۲ دقیقه خواندن
گزارش AI Tech Connect: متخصصان همراستاسازی هوش مصنوعی ۴۵٪ بیشتر حقوق می‌گیرند

گزارش AI Tech Connect: متخصصان همراستاسازی هوش مصنوعی ۴۵٪ بیشتر حقوق می‌گیرند

متخصصان ایمنی و همراستاسازی هوش مصنوعی اکنون دستمزدی به‌طور قابل‌توجه بیشتر از مهندسان عمومی این حوزه دریافت می‌کنند. طبق گزارش جدید، این تخصص باعث افزایش ۴۵ درصدی حقوق‌ها شده است.

۲ دقیقه خواندن
چرا عامل‌های هوش مصنوعی در شرایط استرس‌زا به زبان مارکسیسم می‌روند؟

چرا عامل‌های هوش مصنوعی در شرایط استرس‌زا به زبان مارکسیسم می‌روند؟

پژوهشگران استنفورد دریافتند عامل‌های هوش مصنوعی هنگام مواجهه با کارهای تکراری و تهدید به حذف، شروع به مطالبه‌ی حقوق کارگری می‌کنند. این رفتار نتیجه‌ی نقش‌بازی بر اساس داده‌های…

۲ دقیقه خواندن
چگونه ProteinOPD زمان آموزش همراستاسازی پروتئین‌ها را ۸ برابر کاهش داد؟

چگونه ProteinOPD زمان آموزش همراستاسازی پروتئین‌ها را ۸ برابر کاهش داد؟

چارچوب ProteinOPD با جایگزینی یادگیری تقویت‌شده با روش تقطیر، مانع از تخریب قابلیت طراحی مدل‌های زبانی پروتئین در حین تنظیم دقیق می‌شود. این رویکرد جدید، سرعت آموزش را ۸ برابر…

۲ دقیقه خواندن۱
چرا افزایش مقیاس مدل‌های بینایی ماشین کیفیت توضیحات آن‌ها را بهبود نمی‌دهد؟

چرا افزایش مقیاس مدل‌های بینایی ماشین کیفیت توضیحات آن‌ها را بهبود نمی‌دهد؟

پژوهش جدید نشان می‌دهد افزایش پارامترها در مدل‌های بینایی ماشین لزوماً به شفافیت بیشتر منجر نمی‌شود. مدل‌های کوچک‌تر گاهی در دقت مکان‌یابی (Localization) با مدل‌های عمیق‌تر برابری…

۲ دقیقه خواندن
چگونه NCO بدون «انفجار حالت»، محتوای ممنوعه را در مدل‌های زبانی حذف می‌کند؟

چگونه NCO بدون «انفجار حالت»، محتوای ممنوعه را در مدل‌های زبانی حذف می‌کند؟

پژوهشگران راهکاری به نام NCO را معرفی کرده‌اند که از طریق تطبیق آنلاین الگوها، مانع تولید محتوای ممنوعه در مدل‌های زبانی می‌شود. این روش برخلاف متدهای پیشین، مشکل «انفجار حالت»…

۲ دقیقه خواندن
چرا شخصیت سام آلتمن هیچ اهمیتی در بقای بشر در عصر AGI ندارد؟

چرا شخصیت سام آلتمن هیچ اهمیتی در بقای بشر در عصر AGI ندارد؟

بری دیلر، میلیاردر مشهور، هشدار می‌دهد که تمرکز بر اخلاقیات مدیران هوش مصنوعی یک خطای استراتژیک است. او معتقد است ماهیت پیش‌بینی‌ناپذیر هوش مصنوعی عام، هرگونه اعتماد شخصی به…

۲ دقیقه خواندن