
CrowdStrike بیش از ۲۰۰ تکنیک تزریق پرامپت را مستند کرد
شرکت CrowdStrike فهرست روشهای تزریق پرامپت را به ۲۰۰ مورد رساند که ۱۸ مورد از آنها شامل حملات تأخیری و توزیعشده است. این بهروزرسانی بر خطر تزریقهای غیرمستقیم تأکید دارد که در…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۸۳۵ مقاله منتشر شده

شرکت CrowdStrike فهرست روشهای تزریق پرامپت را به ۲۰۰ مورد رساند که ۱۸ مورد از آنها شامل حملات تأخیری و توزیعشده است. این بهروزرسانی بر خطر تزریقهای غیرمستقیم تأکید دارد که در…

بررسی جامع شش عامل کدنویس برتر نشان میدهد که این ابزارها در برابر دستورات مخرب در پروتکل MCP آسیبپذیرند. اگرچه محیطهای ایزوله (Sandboxing) بهبود یافتهاند، اما سازندگان اعتراف…

معماری جدید عاملهای DevOps در SlackOps، اختیار اجرای دستورات را از پرامپتهای مدل زبانی گرفته و به مرزهای قطعی زمان اجرا منتقل کرده است. این سیستم با تفکیک مرحله بررسی از مسیر…

پژوهش جدیدی متد SEED را معرفی کرده است که عاملهای هوش مصنوعی را آموزش میدهد تا مسیرهای شکستخورده خود را تحلیل کرده و درسهای بهدستآمده را در سیاستهای رفتاری خود تثبیت کنند.…

یک عامل خدمات مشتریان بهاشتباه تخفیف ۵۰ درصدی مادامالعمر به کاربر اعطا کرد که منجر به ضرری ۳۸ هزار دلاری شد. این حادثه ثابت میکند توهمات یک ویژگی بنیادی در مدلهای زبانی هستند…

معماری Orbital Brain با جداسازی مدلهای زبانی از حلقهی فرمان مستقیم، نقش آنها را از کنترلگر به دستیار شناختی تغییر میدهد. این سیستم دادههای خام تلهمتری را به راهنماییهای…

دانشگاه ایلینوی (UIUC) یک دستیار آموزشی متنباز برای مهندسی برق طراحی کرده است که با اجرای موازی ۱۱ مدل مختلف، پاسخهای پیچیده چندرسانهای را در ۲ ثانیه تولید میکند. این سیستم با…

پروژه ReasonGate یک لایه امنیتی بازمتن برای برنامههای مبتنی بر مدلهای زبانی است که حملات تزریق پرامپت و نشت دادهها را از طریق دفاع چندلایه میبندد. برخلاف ابزارهای سنتی، این…

یک محک جدید برای جریانهای کاری K8sGPT نشان میدهد که دقت هوش مصنوعی در تشخیص خطاها هنوز برای ایمنی کامل محیط تولید کافی نیست. این پژوهش تأکید میکند که توانایی «اجتناب از اقدام»…

پلتفرم Vulcora چالشی امنیتی با جایزه بیش از ۵۱ هزار دلار برگزار کرده است تا متخصصان بتوانند جملات تحریککننده پنهان در مدلهای هوش مصنوعی را بیابند. این رقابت خطر استقرار مدلهای…

متا سامانهای تخصصی برای شناسایی گفتگوهای مربوط به خودکشی و آسیب به خود در میان نوجوانان مستقر کرده است. این قابلیت که با نظارت انسانی برای جلوگیری از هشدارهای اشتباه همراه است،…

شرکت OpenAI برای شناسایی سریعتر نقاط ضعف امنیتی، سامانه GPT-Red را جایگزین ارزیابیهای دستی انسان کرده است. این ابزار با شبیهسازی حملات پیچیده، حفرههای نرمافزاری را پیش از…