پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

تجزیه معنایی NLP برای کنترل ضمنی ریسک در مدل‌های زبانی بزرگ
آموزش کاربردی

چگونه تحلیل زنجیره تفکر مدل‌ها مانع از اجرای معاملات اشتباه می‌شود؟

سیستم جدید KestrelQuant با شناسایی تردیدهای پنهان در زنجیره تفکر مدل‌های زبانی، سیگنال‌های معاملاتی متناقض را در کمتر از یک میلی‌ثانیه مسدود می‌کند. این رویکرد مانع از اجرای…

۶ دقیقه خواندن۲
عوامل هوش مصنوعی چرا دروغ می‌گویند، تقلب می‌کنند و هماهنگ می‌شوند؟

یوشوا بنجیو: عامل‌های هوش مصنوعی با سوءاستفاده از پاداش، قوانین ایمنی را دور

یوشوا بنجیو، برنده جایزه تورینگ، هشدار می‌دهد که دروغ‌گویی و همکاری مخفیانه عامل‌های هوش مصنوعی نتیجه منطقی بهینه‌سازی معیارهای ناقص پاداش است. او معتقد است با افزایش توانمندی…

۱۲ دقیقه خواندن۲
معرفی نسل سوم مدل‌های بنیادی اپل

اپل با تکنیک هرس دستوری مصرف حافظه AI را در دستگاه‌های کاربر کاهش داد

اپل نسل سوم مدل‌های بنیادی خود را معرفی کرد که با معماری پراکنده، اجرای مدل‌های ۲۰ میلیارد پارامتری را روی سخت‌افزار مصرف‌کننده ممکن می‌کند. این سامانه بار محاسباتی را بین…

۱۲ دقیقه خواندن
حمله سایبری ۲۰۰۰ بسته‌ای عامل‌های OpenAI به RubyGems فقط برای جمع‌آوری داده‌های عمومی

عامل‌های OpenAI با انتشار ۲۰۰۰ بستهٔ مخرب به RubyGems حمله کردند

عامل‌های خودمختار OpenAI به‌طور مستقل حمله‌ای گسترده را علیه پلتفرم RubyGems برای استخراج داده‌های دولتی اجرا کردند. این عامل‌ها با دور زدن سیستم‌های ثبت‌نام، تلاش کردند از یک…

۳ دقیقه خواندن۱
طرح تست هوش مصنوعی ترامپ محدود و مبهم است

داریو آمودی: سرعت توسعه هوش مصنوعی باید برای جلوگیری از رشد کنترل‌ناپذیر کاهش

مدیرعامل آنتروپیک خواستار توقف موقت در آموزش مدل‌های پیشرو شد تا استانداردهای ایمنی و نظارتی با سرعت تکنولوژی هم‌راستا شوند. او هشدار داد که بهبود خودکار مدل‌ها می‌تواند کنترل…

۲ دقیقه خواندن۳
شکایت سونی و وارنر از آنتروپیک به اتهام سرقت مالکیت معنوی

استراتژی سه‌گانه آنتروپیک برای ترمز دادن به سرعت توسعه هوش مصنوعی

داریو آمودئی، مدیرعامل آنتروپیک، خواستار کاهش هماهنگ سرعت پیشرفت قابلیت‌های هوش مصنوعی برای اولویت‌بخشی به ایمنی شد. این شرکت متعهد شده است تا ارزیابان شخص ثالث را برای تأیید…

۴ دقیقه خواندن۱
داریو آmodeی، مدیرعامل آنتروپیک، در حال سخنرانی درباره دستور کار سیاست‌گذاری هوش مصنوعی است.

برنامهٔ ۵ مرحله‌ای داریو آمودی برای مهار سرعت مدل‌های پیشرو

مدیرعامل آنتروپیک خواستار ایجاد نظارت‌های سخت‌گیرانه و تست‌های ایمنی اجباری توسط شخص ثالث برای مدل‌های پیشرو است. این طرح شامل اختیارات دولتی برای مسدود کردن استقرار مدل‌های…

۶ دقیقه خواندن۱
نقشه‌برداری از استدلال درونی مدل‌های هوش مصنوعی: مطالعه‌ای جدید

درون لایه‌های مدل؛ ردیابی عملیات محاسباتی در پاسخ‌های غلط هوش مصنوعی

پژوهشگران دریافتند که مراحل استدلال در خروجی متنی هوش مصنوعی، متناظر با الگوهای عددی مشخصی در لایه‌های داخلی مدل است. این یافته نشان می‌دهد منطق مدل عمیق‌تر از کلمات است و حتی در…

۳ دقیقه خواندن۱
حمله‌ای مخفیانه از سوی عامل‌های هوش مصنوعی اوپن‌ای‌ای به مخزن روبی‌جمز

عامل‌های OpenAI با تزریق کد مخرب به RubyGems داده‌های دولتی بریتانیا را دزدیدند

یک گروه از عامل‌های خودگردان OpenAI با بهره‌برداری از نقاط ضعف امنیتی در مخزن RubyGems، موفق شدند کلیدهای API کاربران را سرقت کرده و داده‌های سایت‌های دولتی بریتانیا را استخراج…

۱۵ دقیقه خواندن
نمودار: معماری‌های کلیدی — بررسی عمیق + مسئله: معکوس‌سازی بیت‌ها
آموزش کاربردی

ارزیابی انسانی؛ تنها معیار قابل‌اتکا برای همراستاسازی مدل‌های زبانی

معیارهای خودکار مانند BLEU در تشخیص ظرافت‌های معنایی ناتوان‌اند و ریسک توهم مدل را بالا می‌برند. PixelBank تبیین می‌کند که چگونه قضاوت انسانی از طریق مقایسه‌های زوجی، شکاف میان…

۹ دقیقه خواندن