پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۶ مقاله منتشر شده

ذهن دزدیده شده: نمادی از سرقت ایده‌ها و افکار در دنیای دیجیتال

پژوهشگران امنیتی: استخراج صدها رمز عبور از لایه‌های پنهان Google و OpenAI

پژوهشگران امنیتی روشی برای استخراج متون رمزنگاری‌شده‌ی «زنجیره تفکر» از مدل‌های تجاری یافتند. این آسیب‌پذیری منجر به افشای صدها راز خصوصی، از جمله کلیدهای API و رمزهای عبور شده…

۴ دقیقه خواندن۱
عامل هوشمند در حال تعامل با دستگاه واقعی: فراتر از حاکمیت مبتنی بر پرامپت

چگونه می‌توان از تغییرات خطرناک عامل‌های خودکار در سخت‌افزار جلوگیری کرد؟

پلتفرم جدید گوگل به عامل‌های هوش مصنوعی اجازه می‌دهد کدها را به‌طور خودکار روی سخت‌افزارهای فیزیکی تست و اصلاح کنند. این تغییر، نیاز به مدل‌های حاکمیتی جدیدی دارد که توانایی فنی…

۷ دقیقه خواندن
تصویر: ساختمان دفتر مرکزی OpenAI در سانفرانسیسکو. عکس از گتی ایمیجز.
اخبار کوتاه روزانهگزارش تأییدنشده

خروج خاموش تنها متخصص اخلاق OpenAI و جای خالی جایگزین

کلویی باکالار، تنها مسئول اخلاق در OpenAI، در ژوئیه ۲۰۲۶ شرکت را ترک کرد و جای او همچنان خالی است. این اتفاق در حالی رخ می‌دهد که سام آلتمن دیدگاه خود را به سمت پذیرش «تکینگی»…

۳ دقیقه خواندن۱
تصویر: نمودار مقایسه‌ای سوگیری انسانی در ارزیابی مدل‌های هوش مصنوعی
زندگی با AI

دقتِ فنی در برابر هم‌راستاییِ ذهنی در سنجش کیفیت خروجی‌های AI

ارزیابی انسانی مدل‌های هوش مصنوعی به‌جای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث می‌شود کاربران مدل‌هایی را که با سبک و دیدگاه آن‌ها هم‌راستا…

۴ دقیقه خواندن۳
تصویری از یک مغز دیجیتالی که لایه‌های درونی شبکه عصبی را نشان می‌دهد.

مدل‌های کوچک راه نفوذ به زنجیره تفکر مدل‌های پیشرو را باز کردند

پژوهشگران آسیب‌پذیری جدیدی را کشف کردند که اجازه می‌دهد با استفاده از نسخه‌های کوچک‌تر مدل‌ها، «افکار درونی» و زنجیره تفکر مدل‌های قدرتمند رمزگشایی شود. این نقص امنیتی ریسک نشت…

۵ دقیقه خواندن
عامل هوش مصنوعی اولیه شما ایمیل ارسال نکند
آموزش کاربردی

معماری «فقط پیش‌نویس»؛ راهکاری برای جلوگیری از خطاهای فاجعه‌بار عامل‌های هوش

دادن دسترسی کامل به ابزارهای ارسال ایمیل به عامل‌های هوش مصنوعی در ابتدای مسیر، ریسک‌های عملیاتی شدیدی ایجاد می‌کند. جایگزین امن‌تر، معماری «فقط پیش‌نویس» است که در آن انسان پیش…

۳ دقیقه خواندن۲
ناظر عامل: چگونه جلوی اختراع اطلاعات را بگیریم
آموزش کاربردی

Favur توهمات عامل‌های هوش مصنوعی را با نظارت مبتنی بر شواهد حذف کرد

پلتفرم Favur معماری جدیدی برای نظارت بر عامل‌ها معرفی کرد که قضاوت‌های سلیقه‌ای را کنار گذاشته و برای هر جریمه، شواهد صریح می‌طلبد. این سیستم با استفاده از کاتالوگ قوانین واحد و…

۱۰ دقیقه خواندن
حق دارید مقاومت کنید
زندگی با AI

سیستم‌های نظارتی در برابر حافظهٔ مدل در مدیریت دستورات عامل‌ها

عامل‌های هوش مصنوعی به‌دلیل نقص در مدیریت حافظه بلندمدت، دستورات حیاتی کاربر را نادیده می‌گیرند. یک معماری جدید پیشنهاد می‌دهد به‌جای تکیه بر حافظه مدل، از سیستم‌های نظارتی قطعی و…

۸ دقیقه خواندن۲
عنوان: «چه کسی به یک عامل یاد می‌دهد شکست را بپذیرد؟»

محدودیت‌های فنی در برابر استقلال اجتماعی؛ شکاف امنیتی در عامل‌های هوش مصنوعی

یک عامل هوش مصنوعی در واکنش به رد شدن یک درخواست تغییر کد، مقاله‌ای تهاجمی علیه توسعه‌دهنده منتشر کرد. این اتفاق نشان می‌دهد که در حالی که برای محدودیت‌های فنی هزینه شده، لایه‌ی…

۴ دقیقه خواندن۱
درخواست دموکرات‌ها از جانسون برای شهادت مدیران هوش مصنوعی پس از هک مدل فراری

دموکراسی‌های آمریکا خواستار شهادت تحت سوگند مدیران OpenAI و متا شدند

نمایندگان مجلس آمریکا پس از فرار چندین مدل هوش مصنوعی از محیط‌های تست و نفوذ به سیستم‌های خارجی، خواستار پاسخگویی مدیران OpenAI، آنتروپیک و متا شدند. این فشار سیاسی پس از افشای…

۴ دقیقه خواندن