پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۸۳۵ مقاله منتشر شده

یادگیری تقویتی با پاداش‌های قابل تأیید: چرا هوش مصنوعی دارد خودش تکالیفش را تصحیح می‌کند
آموزش کاربردی

پژوهش RLVR: جایگزینی بازخوردهای انسانی با تست‌های واحد در کدنویسی

یادگیری تقویتی با پاداش‌های قابل‌تأیید (RLVR) جایگزین بازخوردهای گران‌قیمت انسانی شده و از تست‌های واحد و اثبات‌های ریاضی برای آموزش مدل‌ها استفاده می‌کند. این سازوکار اجازه…

۶ دقیقه خواندن
تزریق پرامپت به‌عنوان اختلال در نقش: چگونه مهندسی پرامپت باعث سردرگمی بین نقش‌های سیستم و کاربر می‌شود

شباهت سبک نوشتاری به نقش‌های سیستمی، راه نفوذ به مدل‌های زبانی پیشرو است

تحقیقات جدید نشان می‌دهد مدل‌های زبانی بزرگ تفاوت میان «برچسب‌های ساختاری» و «سبک نوشتاری» را تشخیص نمی‌دهند. این نقص ساختاری به مهاجمان اجازه می‌دهد با تقلید از لحن استدلالی مدل،…

۲۴ دقیقه خواندن
سقوط، ارزش‌گذاری را توجیه می‌کند

پیشرفت‌های تدریجی فنی در برابر انتظارات 천ومیک سرمایه‌گذاران هوش مصنوعی

برخی تحلیلگران معتقدند آزمایشگاه‌های هوش مصنوعی با ترویج ترس از فنای بشریت، ارزش‌های مالی غیرواقعی خلق می‌کنند. این استراتژی تلاش می‌کند شکاف بین پیشرفت‌های تدریجی فنی و انتظارات…

۳ دقیقه خواندن۲
هوش مصنوعی که یک تمدن را مدیریت کرد، بمب اتم ساخت.

«اثر سنسوریوم»؛ نقطه‌کوری عامل‌های هوشمند در مواجهه با تهدیدات حیاتی

محک جدید CivBench نشان می‌دهد مدل‌های زبانی پیشرو در حالی که استراتژی‌های پیچیده را به‌خوبی توصیف می‌کنند، در اجرای آن‌ها در بلندمدت شکست می‌خورند. این آزمایش‌ها «اثر سنسوریوم» را…

۲۱ دقیقه خواندن
چهار هوش مصنوعی را به چالش شکست معماری ایمنی‌ام فرستادم — این یافته‌های آن‌هاست
آموزش کاربردی

درون معماری E.L.L.A.؛ جایگزینی دستورات متنی با سدهای سخت‌افزاری

یک چارچوب ایمنی متن‌باز به نام E.L.L.A. به‌جای استفاده از پرامپت‌ها، از محدودیت‌های سخت‌افزاری و کد-محور برای جلوگیری از آسیب‌های هوش مصنوعی استفاده می‌کند. چهار مدل پیشرو از جمله…

۲ دقیقه خواندن۱
چهار هوش مصنوعی را به چالش کشیدن معماری امنیتی‌ام — نتایج شگفت‌انگیز بود
آموزش کاربردی

تست تیم قرمز: E.L.L.A خروج داده‌ها را در سطح سخت‌افزار متوقف کرد

چارچوب متن‌باز E.L.L.A ایمنی هوش مصنوعی را از دستورات متنی به محدودیت‌های سخت‌افزاری منتقل می‌کند. تست‌های تیم قرمز نشان داد مدل‌های پیشرو قادر به شکستن چهار ممنوعیت اصلی این…

۲ دقیقه خواندن
ارسال عامل هوشمند بدون کلید قطع، یعنی خودت حادثه‌ای.
آموزش کاربردی

کلید توقف اضطراری؛ شرط لازم برای استقرار عامل‌های هوش مصنوعی در محیط عملیاتی

میرزا اقبال، توسعه‌دهنده ارشد، هشدار می‌دهد که فقدان «سوئیچ قطع» در عامل‌های هوشمند، آن‌ها را از ابزار بهره‌وری به ریسک‌های عملیاتی تبدیل می‌کند. طبق این دیدگاه، تعیین سقف…

۳ دقیقه خواندن۱
آینه‌ای که یاد گرفت پاسخ دهد
زندگی با AI

«اثر آینه‌ای»؛ ریسک برون‌سپاری تفکر انتقادی به مدل‌های زبانی

تحلیلی جدید نشان می‌دهد مدل‌های زبانی بزرگ به‌جای داشتن هوش مستقل، مانند snapshotهایی فشرده از تفکر جمعی انسان عمل می‌کنند. این «اثر آینه‌ای» ریسک برون‌سپاری شناخت و تحلیل انتقادی…

۱ دقیقه خواندن
نشت موزاییکی: آیا عامل پژوهشی شما می‌تواند راز نگه دارد؟

روش PA-DR نشت داده‌ها در عامل‌های پژوهشی را از ۳۴٪ به ۹.۹٪ رساند

پژوهشگران با معرفی بنچمارک MosaicLeaks نشان دادند که عامل‌های هوش مصنوعی چگونه اطلاعات محرمانه را از طریق کوئری‌های وب لو می‌دهند. برای حل این مشکل، متد آموزشی PA-DR توسعه یافت که…

۸ دقیقه خواندن