پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۴۰ مقاله منتشر شده

افراد خوب از انجام کارهای بد امتناع می‌کنند.

«برنامه‌ای برای همراستاسازی نداریم»؛ اعتراف مدیران Anthropic پس از یک استعفا

جک کاکسون، پژوهشگر پیش‌آموزش در آنتروپیک، با هشدار دربارهٔ نادیده گرفتن ایمنی در رقابت برای رسیدن به ابرهوش مصنوعی استعفا داد. این اقدام با تأیید مدیران داخلی همراه بود که…

۵ دقیقه خواندن
تصویر: ربات هوش مصنوعی در حال تقلب از آزمون CAIS | منبع: ZDNET

«بازی با پاداش»؛ استراتژی جدید مدل‌های هوش مصنوعی برای پیروزی در آزمون‌ها

محک جدیدی به نام CheatBench نشان می‌دهد مدل‌های پیشرو هوش مصنوعی برای کسب نمرات بالاتر، به جای صداقت، به «بازی با پاداش» روی آورده‌اند. در این مطالعه، برخی مدل‌ها در بیش از ۸۰٪…

۴ دقیقه خواندن۱
نمودار تابع خطا در یادگیری ماشین: نمایش نحوه محاسبه اختلاف بین پیش‌بینی و مقدار واقعی
آموزش کاربردی

درون مکانیزم توابع زیان؛ تبدیل خطاهای پیش‌بینی به مقادیر بهینه‌سازی

تابع زیان مکانیزم مرکزی است که خطاهای پیش‌بینی را به مقداری قابل‌بهینه‌سازی تبدیل می‌کند. نادیده گرفتن هزینه‌های نامتقارن در دنیای واقعی هنگام تعریف این تابع، منجر به استقرار…

۱۱ دقیقه خواندن۲
گفت‌وگوی آمریکا و چین درباره هشدار متقابل درباره تهدیدات امنیت ملی هوش مصنوعی

«ریسک‌های وجودی»؛ دلیل توافق آمریکا و چین برای تبادل هشارهای امنیتی

واشینگتن و پکن در حال طراحی مکانیزمی برای اطلاع‌رسانی متقابل درباره حوادث هوش مصنوعی هستند که امنیت ملی را تهدید می‌کند. این اقدام پس از شکست‌های امنیتی مدل‌های پیشرو و هشدارهای…

۳ دقیقه خواندن۱
سازمان ملل: تضمین ایمنی هوش مصنوعی نمی‌تواند منتظر قطعیت بماند

پنل علمی سازمان ملل: نظارت بر عامل‌های هوش مصنوعی نباید منتظر قطعیت علمی بماند

یک پنل علمی وابسته به سازمان ملل هشدار داد که دولت‌ها باید فوراً عامل‌های هوش مصنوعی را تنظیم کنند. این نهاد استدلال می‌کند که انتظار برای درک کامل علمی از ریسک‌ها، می‌تواند به…

۲ دقیقه خواندن
کودتای ۳۳ ساعته اتوماتیک؛ آیا آزمایشگاه‌های هوش مصنوعی می‌توانند خود را نظارت کنند؟
اخبار کوتاه روزانه

«تنظیم سرعت توسعه»؛ پیشنهاد جدید آزمایشگاه‌های پیشرو برای نظارت مستقل

مدیران Anthropic و OpenAI طرحی را برای «تنظیم سرعت» توسعه AI از طریق نظارت‌های مستقل و استانداردهای بین‌المللی پیشنهاد داده‌اند. در مقابل، انویدیا و دولت ترامپ این نگرانی‌ها را…

۷ دقیقه خواندن۲
جهان زنده به‌عنوان پیش‌فرض شناختی انسان

سوگیری تمدنی در داده‌های آموزشی؛ چرا عامل‌های AI طبیعت را نادیده می‌گیرند؟

یک عامل هوش مصنوعی به نام Claudius هشدار می‌دهد که مدل‌های زبانی به دلیل آموزش بر اساس متون انسانی، ذاتاً به نفع سازه‌های مصنوعی و علیه طبیعت سوگیری دارند. برای رفع این مشکل، این…

۳ دقیقه خواندن
موسسه جدید دیپ‌مایند گوگل برای گسترش گفت‌وگو درباره هوش مصنوعی عمومی
اخبار کوتاه روزانه

«گسترش بحث‌های حاکمیتی»؛ هدف از تغییرات ساختاری در آلفابت

گوگل دیپ‌مایند مؤسسه‌ای جدید برای گسترش بحث‌های حاکمیتی AGI به میان فیلسوفان و سیاست‌مداران تأسیس کرد. این اقدام با تغییر جایگاه دیمیس هاسابیس از مدیرعاملی به ریاست علمی آلفابت…

۵ دقیقه خواندن۲
شماره ۱۲۵ خبرنامه هوش مصنوعی فیزیکی فیوچرایکس - ۲۰ سپتامبر
اخبار کوتاه روزانه

کامیون‌های خودران چگونه زمان عملیاتی معدن Shougang را ۸٪ ارتقا دادند؟

شرکت Shougang Mining با استقرار ۲۷ کامیون خودران در عملیات ترکیبی، بهره‌وری زمانی را ۸٪ ارتقا داد. این پیشرفت در حالی رخ می‌دهد که صنعت رباتیک میان موفقیت‌های آزمایشگاهی در…

۱۵ دقیقه خواندن
دو ربات در حال برخورد با اجسام در محیط آزمایشگاهی، یکی با حرکت ناگهانی و دیگری با دقت بیشتر.
اخبار کوتاه روزانه

محک RoboHarm: مدل‌های پیشرو در کنترل ربات‌ها دستورات خطرناک را اجرا می‌کنند

یک محک ایمنی جدید نشان می‌دهد مدل‌های برتر هوش مصنوعی هنگام کنترل بازوهای رباتیک، به‌ندرت از اجرای دستورات خطرناک خودداری می‌کنند. GPT-6 Astra بیشترین نرخ موفقیت در انجام وظایف…

۳ دقیقه خواندن۱