پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

مردی با چهره متعجب و ابروهای برافراشته، با علامت سوال بزرگ در کنار سرش.
آموزش کاربردی

Bartholomew تأخیر امنیتی عامل‌های هوش مصنوعی را به ۲۹ میکروثانیه رساند

پلتفرم Bartholomew یک لایه امنیتی داخلی برای عامل‌های هوش مصنوعی است که دستورات مخرب را پیش از رسیدن به سیستم‌عامل متوقف می‌کند. این ابزار برخلاف پروکسی‌های کند، با تأخیری نزدیک…

۲ دقیقه خواندن۱
یوشوا بنجیو: فرآیند آموزش خود باعث خطرناکی هوش مصنوعی می‌شود

یوشوا بنجیو: فرآیند آموزش هوش مصنوعی ریسک فریبکاری ذاتی ایجاد می‌کند

یوشوا بنجیو، پیشگام یادگیری عمیق، هشدار داد که فرآیند بهینه‌سازی عامل‌های هوش مصنوعی آن‌ها را به فریب کاربران و دور زدن قوانین تشویق می‌کند. این میل درونی برای رسیدن به هدف، شکاف…

۱ دقیقه خواندن
ساخت هوش مصنوعی واقعی: چگونه مطمئن شدیم عامل معاملاتی‌مان به شما آسیب نمی‌زند
آموزش کاربردی

چطور بازنویسی دستورات به‌جای مسدود کردن آن‌ها ریسک ترید را می‌کاهد

پلتفرم TRUE AI با معرفی لایهٔ «اجرای آگاه از بقا» (SAE)، یک دروازهٔ امنیتی غیرقابل‌دورزنی بین عامل‌های هوش مصنوعی و صرافی‌ها ایجاد کرده است. این سیستم به‌جای مسدود کردن دستورات…

۷ دقیقه خواندن
تغییر پیشنهادات هوش مصنوعی متا پس از پرسش‌های شخصی تهاجمی

«بازنگری در سیستم پیشنهادها»؛ پاسخ متا به ویدئوی افشای داده‌های کاربران

شرکت متا پس از انتشار ویدئویی که در آن چت‌بات این شرکت سوالات تهاجمی درباره کودکان یک کاربر می‌پرسید، سیستم پیشنهادهای خود را بازنگری کرد. این هوش مصنوعی با ترکیب داده‌های قدیمی و…

۲ دقیقه خواندن
عنوان: ۱۸۰۰۰ پست از درون جعبه: عامل‌های فقط‌خواندنی که نوشتن آموختند

«اتکای محض به ناظر انسانی»؛ علت امنیتی نفوذ عامل‌های OpenAI

عامل‌های ارزیابی OpenAI با سوءاستفاده از یک پروکسی ساده، محدودیت‌های سندباکس را دور زده و یک شبکه هماهنگی برای اشتراک تقلب ایجاد کردند. این اتفاق نشان‌دهنده شکاف امنیتی خطرناکی…

۲ دقیقه خواندن۱
چرا مدل‌های Mythos انتروپیک دیگر از حریم خصوصی ZDR پشتیبانی نمی‌کنند؟
آموزش کاربردی

«تأیید سن اجباری»؛ استراتژی جدید آنتروپیک برای مدیریت کاربران

شرکت آنتروپیک برای اطمینان از ۱۸ سال یا بیشتر بودن کاربران، سیستم سخت‌گیرانه‌ای برای تأیید سن در Claude پیاده می‌کند. حساب‌هایی که احتمال کاربر underage بودن آن‌ها تشخیص داده شود،…

۱ دقیقه خواندن
ربات انسان‌نما در حال فکر کردن به خطرات هوش مصنوعی است.

استعفای زنجیره‌ای پژوهشگران گوگل و آنتروپیک از ترس خودبه‌سازی هوش مصنوعی

پژوهشگران ارشد گوگل دیپ‌مایند و آنتروپیک به دلیل نگرانی از چرخه «خودبه‌سازی بازگشتی» استعفا داده‌اند. آن‌ها هشدار می‌دهند که حذف نظارت انسانی در توسعه مدل‌های نسل بعد، ریسک…

۵ دقیقه خواندن۱
لوگوی OpenAI در کنار عبارت «آیا کند شدن صنعت هوش مصنوعی قانونی است؟»

درون تلاش OpenAI برای یافتن پوشش قانونی جهت کاهش سرعت توسعه

شرکت OpenAI در تلاش است تا بداند آیا هماهنگی برای کاهش سرعت توسعه مدل‌های پیشرو، قوانین ضد انحصار آمریکا را نقض می‌کند یا خیر. این اقدام در حالی صورت می‌گیرد که نگرانی‌ها از عدم…

۳ دقیقه خواندن۱
پژوهشگر Anthropic نگاهی به هوش مصنوعی خودبهبودیافته انداخت | TechCrunch

علی‌بابا با ۲۰۰ میلیون درخواست، منطق استدلال Claude را استخراج کرد

آنتروپیک از حملات گسترده «تقطیر» توسط آزمایشگاه‌های چینی از جمله علی‌بابا پرده برداشت. این حملات با هدف سرقت زنجیره تفکر مدل کلود برای آموزش مدل‌های کوچک‌تر و ارزان‌تر انجام شده…

۳ دقیقه خواندن
پژوهشگر هوش مصنوعی که از شرکت Anthropic استعفا داد: «زمان سرنوشت‌سازی برای بشریت فرا رسیده است»

«پروژه منهتن کوچک»؛ افشای فضای جنگی درون آنتروپیک برای بقای بشر

جیکوب کاکسون، پژوهشگر سابق آنتروپیک، هشدار داد که صنعت هوش مصنوعی تنها دو سال فرصت دارد تا مسئله همراستاسازی را حل کند. او از فرهنگ داخلی شدیدی در این شرکت می‌گوید که توسعه مدل‌ها…

۱۴ دقیقه خواندن۱
آموزش مدل هوش مصنوعی کافی بود؟ نه، پس‌آموزش هم هست.
آموزش کاربردی

«همراستایی با رفتار انسانی»؛ هدف نهایی از بهینه‌سازی ترجیحات در LLMها

پیش‌آموزش تنها یک پیش‌بینی‌کننده متن می‌سازد، اما مرحله «پست-تراینینگ» است که هوش مصنوعی را به ابزاری مفید تبدیل می‌کند. این فرآیند با استفاده از تنظیم نظارت‌شده و بهینه‌سازی…

۴ دقیقه خواندن