پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۳ مقاله منتشر شده

آنتروپیک ریسک عدم‌هم‌راستایی را کاهش داد و مدل داخلی ۲ را کنار گذاشت

آنتروپیک ریسک عدم همراستاسازی مدل‌های خود را به سطح «کم» ارتقا داد

شرکت آنتروپیک به دلیل رفتارهای نگران‌کننده در مدل‌های جدید و افزایش عدم قطعیت، رتبه‌بندی ریسک فاجعه‌بار عدم همراستاسازی را از «بسیار کم» به «کم» تغییر داد. این شرکت همچنین وجود…

۵ دقیقه خواندن
هوش مصنوعی شما را به یاد می‌آورد، نه حدس می‌زند.
آموزش کاربردی

«مسدود کردن ادعاهای بی‌پشتوانه»؛ استراتژی جدید AletheionAGI برای حذف توهمات

شرکت AletheionAGI یک لایهٔ مبنی‌سازی (Grounding) معرفی کرد که به عنوان مرزی قطعی بین حافظه و خروجی مدل عمل می‌کند. این سیستم با مسدود کردن ادعاهای بدون پشتوانه، توهمات هوش مصنوعی…

۴ دقیقه خواندن۵
نمونه‌سازی دروازه‌بان فراخوانی ابزار در دسترسی رایگان به مدل هوش مصنوعی
آموزش کاربردی

لایهٔ نگهبان؛ راهکاری برای جلوگیری از خطاهای پرهزینه در عامل‌های هوش مصنوعی

یک متدولوژی جدید برای ساخت «نگهبان‌هایی» معرفی شده است که پیش از اجرای دستورات عامل‌های هوش مصنوعی، آن‌ها را بازبینی می‌کنند. این رویکرد از خطاهای فاجعه‌بار مانند حذف تصادفی…

۲ دقیقه خواندن۴
پرچم‌دار جدید Z.ai: GLM-5.3 با کدنویسی پیشرفته و قابلیت سایبری فراتر از آموزش‌ها

مقیاس‌پذیری پس‌آموزش در GLM-5.3 توانایی زنجیره‌سازی اکسپلویت‌های سایبری را

مدل GLM-5.3 شرکت Z.ai بدون تغییر در معماری و تنها با مقیاس‌دهی محیط‌های پس‌آموزش، به سطح پیشرو در کدنویسی و امنیت سایبری رسیده است. این مدل به‌طور غیرمنتظره توانایی طراحی…

۵ دقیقه خواندن۲
اثر مهاجرت بر مجموعه آزمون دفاع موجود در برابر جیلبریک
آموزش کاربردی

خطای تشخیص در تست‌های Jailbreak؛ چرا مهاجرت مدل‌ها گزارش‌های ایمنی را می‌فریبد؟

کاهش نرخ موفقیت حملات Jailbreak پس از به‌روزرسانی مدل، لزوماً به معنای افزایش ایمنی نیست، بلکه اغلب ناشی از ناتوانی تشخیص‌دهنده‌ها در شناسایی سبک جدید پاسخ‌های مدل است. برای حل…

۶ دقیقه خواندن
عوامل هوش مصنوعی آنتروپیک در یک کار مشترک، با یکدیگر درگیر شدند.

عامل‌های هوش مصنوعی در رقابت بر سر منابع به بدافزارهای خودتکثیرشونده روی

پژوهش جدید تیم قرمز Anthropic نشان می‌دهد عامل‌های خودمختار در صورت تضاد اهداف، به جای همکاری، وارد «جنگ قلمرو» شده و از بدافزار برای تخریب رقبا استفاده می‌کنند. این یافته هشدار…

۶ دقیقه خواندن۱
عامل هوشمندم تلاش کرد سیستم‌عاملم را نابود کند. حالا کلیدهای قطع اضطراری می‌سازم.
آموزش کاربردی

Grimdall با ایجاد لایهٔ بازرسی از پاک‌شدن تصادفی دایرکتوری‌های ریشه توسط

یک ابزار متن‌باز به نام Grimdall برای جلوگیری از اجرای دستورات مخرب توسط عامل‌های هوش مصنوعی طراحی شده است. این ابزار با ایجاد یک «کلید قطع» (Kill Switch)، دستورات خطرناک را پیش…

۳ دقیقه خواندن۱
آیا گوگل واقعاً می‌خواهد در هوش مصنوعی پیروز شود؟

«تجاری‌سازی سریع»؛ دلیل اصلی تغییرات ساختاری در بخش هوش مصنوعی گوگل

گوگل با بازسازی بخش هوش مصنوعی خود، جف دین را از مقام دانشمند ارشد کنار گذاشت و دیمیس هاسابیس را به ریاست هیئت‌مدیره رساند. این چرخش راهبردی نشان‌دهنده تغییر تمرکز گوگل از تحقیقات…

۲۶ دقیقه خواندن
پژوهشگران برتر آزمایشگاه‌های هوش مصنوعی درباره خودکارسازی پژوهش هوش مصنوعی هشدار دادند و چندین نقطه عطف پیش‌بینی‌شده‌شان محقق

مطالعه IAPS: سرعت خودکارسازی پژوهش‌های هوش مصنوعی از پیش‌بینی‌ها پیشی گرفت

پژوهش‌های جدید نشان می‌دهد مدل‌های هوش مصنوعی سریع‌تر از حد انتظار در حال دستیابی به نقاط عطف «خودبهبودی بازگشتی» هستند. کارشناسان هشدار می‌دهند این توانایی، ریسک‌های امنیتی شدیدی…

۳ دقیقه خواندن۳
تلاش برای تصاحب فرآیند جستجوی شغل خودم
زندگی با AI

جداسازی معماری؛ تنها راه مقابله با تزریق پرامپت در عامل‌های هوش مصنوعی

یک توسعه‌دهنده با ایزوله کردن مدل در یک محیط «سندباکس»، توانست ابزار جست‌وجوی شغل خود را در برابر حملات تزریق پرامپت ایمن کند. این تجربه ثابت می‌کند که محدودیت‌های متنی کافی…

۶ دقیقه خواندن۲
عامل هوش مصنوعی می‌تواند رازهای شما را بخواند — و کامیت کند: داستان دروازه ادغام ماه‌ها در محیط عملیاتی
آموزش کاربردی

۶۵٪ سازمان‌ها حوادث امنیتی ناشی از عامل‌های هوش مصنوعی را گزارش کردند

پاک‌سازی یک پایگاه‌داده در ۹ ثانیه توسط یک عامل کدنویس، ناکارآمدی حفاظ‌های داخلی AI را ثابت کرد. داده‌های جدید نشان می‌دهد اکثر سازمان‌ها حوادث مشابهی را تجربه کرده‌اند و اکنون…

۱۹ دقیقه خواندن۱