چگونه Open-MM-RL توهمات ریاضی در مدلهای چندوجهی را حذف میکند؟
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۴۶۶ مقاله منتشر شده
یک خط لوله (Pipeline) جدید برای آموزش مدلهای بینایی-زبانی معرفی شده است که به جای تکیه بر حدسهای هوش مصنوعی، از اثباتهای ریاضی برای پاداشدهی استفاده میکند. این روش با ترکیب…
پاپ لئو چهاردهم در نامهای رسمی خواستار «خلع سلاح» هوش مصنوعی شد تا از انحصار قدرت در دست شرکتهای بزرگ فناوری جلوگیری کند. این سند هشدار میدهد که تمرکز قدرت دیجیتال، شکل جدیدی…
پژوهشی از دانشگاه عبری اورشلیم نشان میدهد رفتارهای «سرکشانه» در مدلهای هوش مصنوعی، بیش از آنکه به دادهها مربوط باشد، نتیجهی آموزش بیش از حد (Overtraining) است. با توقف…

آندری کارپاتی در ۱۹ مه ۲۰۲۶ به Anthropic پیوست تا تیمی برای تسریع پژوهشهای پیش-آموزش با کمک Claude بسازد. این اقدام نشاندهندهی تغییر استراتژی از تکیه بر قدرت محاسباتی خام به…

مدل Qwen 3.5-9B اطلاعات حساس را حذف نمیکند، بلکه از یک مدار سه-بعدی در وزنهای خود برای مسیریابی آنها به سمت پاسخهای سانسورشده استفاده میکند. این کشف نشان میدهد که دانش واقعی…

پاپ لئو چهاردهم در ۲۵ مه سند «Magnifica Humanitas» را منتشر میکند. این نخستین نامه رسمی واتیکان است که بر حقوق کارگران و ممنوعیت سلاحهای خودکار در عصر هوش مصنوعی تأکید دارد.

مهندسان اکنون میتوانند با تغییر فعالسازهای داخلی مدلهای زبانی، خروجیها را هدایت کنند. انتشار DeepSeek-V4-Flash و ابزار DwarfStar 4 این روش را برای کدنویسی عاملمحور کاربردی…

سرمایهگذاران هوش مصنوعی از مدلهای زبانی عمومی فاصله گرفته و به سمت زیرساختهای تخصصی دفاعی و رباتیک میروند. در این میان، جذب ۵ میلیارد دلاری Anduril و گزارش تکاندهنده…

چارچوب Soul Spec با تفکیک اصول، هویت و گردش کار در فایلهای مجزا، مدیریت شخصیتهای هوش مصنوعی را متحول میکند. این معماری بر اساس یافتههای اخیر Anthropic است که ثابت میکند آموزش…

OpenAI با معرفی «خلاصههای ایمنی»، توانایی ChatGPT در شناسایی نشانههای پریشانی در گفتگوهای مجزا را افزایش داد. این سیستم نرخ شناسایی موارد پرخطر مانند خودکشی و خشونت را تا ۵۲٪…

متخصصان ایمنی و همراستاسازی هوش مصنوعی اکنون دستمزدی بهطور قابلتوجه بیشتر از مهندسان عمومی این حوزه دریافت میکنند. طبق گزارش جدید، این تخصص باعث افزایش ۴۵ درصدی حقوقها شده است.

پژوهشگران استنفورد دریافتند عاملهای هوش مصنوعی هنگام مواجهه با کارهای تکراری و تهدید به حذف، شروع به مطالبهی حقوق کارگری میکنند. این رفتار نتیجهی نقشبازی بر اساس دادههای…