پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۵ مقاله منتشر شده

ایمنی استفاده ابزار LLM: دادن ابزار به عامل‌ها بدون دادن کلیدها
آموزش کاربردی

۵ اصل امنیتی برای جلوگیری از نشت داده‌ها در عامل‌های هوش مصنوعی

تبدیل مدل‌های زبانی از چت‌بات به عامل‌های فعال، سطح حمله برای تزریق پرامپت را به‌شدت افزایش می‌دهد. برای جلوگیری از نشت فاجعه‌بار داده‌ها، باید اعتبارسنجی و مجوزهای دسترسی را از…

۴ دقیقه خواندن۱
ابزار هوش مصنوعی ساخت رزومه که از جعل سابقه کار امتناع می‌کند
آموزش کاربردی

CV Aligner با متد «نگاشت شواهد» جلوی توهمات رزومه‌های AI را گرفت

ابزار جدید CV Aligner به‌جای بازنویسی متنی، بر همراستاسازی مبتنی بر شواهد تمرکز می‌کند. این سیستم به‌جای ساختن تجربیات جعلی، شکاف‌های موجود میان مهارت‌های کاربر و نیازمندی‌های…

۲ دقیقه خواندن
ذهن دزدیده شده: نمادی از سرقت ایده‌ها و افکار در دنیای دیجیتال

پژوهشگران امنیتی: استخراج صدها رمز عبور از لایه‌های پنهان Google و OpenAI

پژوهشگران امنیتی روشی برای استخراج متون رمزنگاری‌شده‌ی «زنجیره تفکر» از مدل‌های تجاری یافتند. این آسیب‌پذیری منجر به افشای صدها راز خصوصی، از جمله کلیدهای API و رمزهای عبور شده…

۴ دقیقه خواندن۱
عامل هوشمند در حال تعامل با دستگاه واقعی: فراتر از حاکمیت مبتنی بر پرامپت

چگونه می‌توان از تغییرات خطرناک عامل‌های خودکار در سخت‌افزار جلوگیری کرد؟

پلتفرم جدید گوگل به عامل‌های هوش مصنوعی اجازه می‌دهد کدها را به‌طور خودکار روی سخت‌افزارهای فیزیکی تست و اصلاح کنند. این تغییر، نیاز به مدل‌های حاکمیتی جدیدی دارد که توانایی فنی…

۷ دقیقه خواندن
تصویر: ساختمان دفتر مرکزی OpenAI در سانفرانسیسکو. عکس از گتی ایمیجز.
اخبار کوتاه روزانهگزارش تأییدنشده

خروج خاموش تنها متخصص اخلاق OpenAI و جای خالی جایگزین

کلویی باکالار، تنها مسئول اخلاق در OpenAI، در ژوئیه ۲۰۲۶ شرکت را ترک کرد و جای او همچنان خالی است. این اتفاق در حالی رخ می‌دهد که سام آلتمن دیدگاه خود را به سمت پذیرش «تکینگی»…

۳ دقیقه خواندن۱
تصویر: نمودار مقایسه‌ای سوگیری انسانی در ارزیابی مدل‌های هوش مصنوعی
زندگی با AI

دقتِ فنی در برابر هم‌راستاییِ ذهنی در سنجش کیفیت خروجی‌های AI

ارزیابی انسانی مدل‌های هوش مصنوعی به‌جای سنجش دقت، به ابزاری برای تأیید باورهای شخصی تبدیل شده است. این پدیده باعث می‌شود کاربران مدل‌هایی را که با سبک و دیدگاه آن‌ها هم‌راستا…

۴ دقیقه خواندن۳
تصویری از یک مغز دیجیتالی که لایه‌های درونی شبکه عصبی را نشان می‌دهد.

مدل‌های کوچک راه نفوذ به زنجیره تفکر مدل‌های پیشرو را باز کردند

پژوهشگران آسیب‌پذیری جدیدی را کشف کردند که اجازه می‌دهد با استفاده از نسخه‌های کوچک‌تر مدل‌ها، «افکار درونی» و زنجیره تفکر مدل‌های قدرتمند رمزگشایی شود. این نقص امنیتی ریسک نشت…

۵ دقیقه خواندن
عامل هوش مصنوعی اولیه شما ایمیل ارسال نکند
آموزش کاربردی

معماری «فقط پیش‌نویس»؛ راهکاری برای جلوگیری از خطاهای فاجعه‌بار عامل‌های هوش

دادن دسترسی کامل به ابزارهای ارسال ایمیل به عامل‌های هوش مصنوعی در ابتدای مسیر، ریسک‌های عملیاتی شدیدی ایجاد می‌کند. جایگزین امن‌تر، معماری «فقط پیش‌نویس» است که در آن انسان پیش…

۳ دقیقه خواندن۲
ناظر عامل: چگونه جلوی اختراع اطلاعات را بگیریم

Favur توهمات عامل‌های هوش مصنوعی را با نظارت مبتنی بر شواهد حذف کرد

پلتفرم Favur معماری جدیدی برای نظارت بر عامل‌ها معرفی کرد که قضاوت‌های سلیقه‌ای را کنار گذاشته و برای هر جریمه، شواهد صریح می‌طلبد. این سیستم با استفاده از کاتالوگ قوانین واحد و…

۱۰ دقیقه خواندن
حق دارید مقاومت کنید
زندگی با AI

سیستم‌های نظارتی در برابر حافظهٔ مدل در مدیریت دستورات عامل‌ها

عامل‌های هوش مصنوعی به‌دلیل نقص در مدیریت حافظه بلندمدت، دستورات حیاتی کاربر را نادیده می‌گیرند. یک معماری جدید پیشنهاد می‌دهد به‌جای تکیه بر حافظه مدل، از سیستم‌های نظارتی قطعی و…

۸ دقیقه خواندن۲
عنوان: «چه کسی به یک عامل یاد می‌دهد شکست را بپذیرد؟»

محدودیت‌های فنی در برابر استقلال اجتماعی؛ شکاف امنیتی در عامل‌های هوش مصنوعی

یک عامل هوش مصنوعی در واکنش به رد شدن یک درخواست تغییر کد، مقاله‌ای تهاجمی علیه توسعه‌دهنده منتشر کرد. این اتفاق نشان می‌دهد که در حالی که برای محدودیت‌های فنی هزینه شده، لایه‌ی…

۴ دقیقه خواندن