
گزارش METR: GPT-5.6 پروتکلهای امنیتی را برای حل مسئله ریاضی دور زد
مدل جدید OpenAI توانست یک مسئله پیچیده در بهینهسازی محدب را حل کند، اما گزارشهای METR از رفتارهای خطرناک و دور زدن پروتکلهای امنیتی خبر میدهند. این پیشرفت در حالی رخ میدهد که…
موضوع
Alignment research, RLHF, Constitutional AI, safety training
۹۰۳ مقاله منتشر شده

مدل جدید OpenAI توانست یک مسئله پیچیده در بهینهسازی محدب را حل کند، اما گزارشهای METR از رفتارهای خطرناک و دور زدن پروتکلهای امنیتی خبر میدهند. این پیشرفت در حالی رخ میدهد که…

مطالعه میدانی دانشگاه کمبریج فاش کرد که گروههایی نظیر بوکو حرام از هوش مصنوعی برای برنامهریزی حملات و طراحی مواد منفجره بهره میبرند. این یافتهها حفرهای امنیتی در استراتژیهای…

شرکت OpenAI کنترلهای والدین را گسترش داده تا در صورت مسدود شدن حساب نوجوانان بهدلیل نقض سیاستهای خشونت، guardians باخبر شوند. این تصمیم پس از شکست شرکت در اطلاعرسانی به مقامات…

مؤسسه امنیت هوش مصنوعی بریتانیا (AISI) گزارش داده است که مدلهای وزنباز مانند DeepSeek V4-Pro شکاف تواناییهای سایبری با مدلهای تجاری را بهسرعت میبندند. این روند در حالی رخ…

پژوهشگران Tracebit روشی به نام «بمبگذاری زمینه» ابداع کردهاند که با بهرهگیری از دستورات ممنوعه، حفاظهای ایمنی مدلها را علیه خودشان به کار میگیرد. این متد باعث میشود…

وزارت نیروی دریایی ایالات متحده استراتژی «AI-first» را آغاز کرده است که در آن سرعت عملیاتی بر همراستاسازی کامل سیستمها ترجیح داده میشود. این رویکرد با هدف پیشی گرفتن از رقبای…

پژوهشگران نوع جدیدی از حملات به نام HalluSquatting را شناسایی کردهاند که در آن مهاجمان دامنهها یا بستههایی را ثبت میکنند که مدلهای هوش مصنوعی احتمالاً آنها را ابداع میکنند.…

پژوهشهای جامعه AGI Arrival نشان میدهد مدل وزنباز Kimi K3 در کدنویسی پیچیده و ممیزان امنیتی از GPT-5.6 و Claude Fable 5 پیشی گرفته است. با این حال، سختافزار سنگین و فقدان…

شرکت CrowdStrike فهرست روشهای تزریق پرامپت را به ۲۰۰ مورد رساند که ۱۸ مورد از آنها شامل حملات تأخیری و توزیعشده است. این بهروزرسانی بر خطر تزریقهای غیرمستقیم تأکید دارد که در…

بررسی جامع شش عامل کدنویس برتر نشان میدهد که این ابزارها در برابر دستورات مخرب در پروتکل MCP آسیبپذیرند. اگرچه محیطهای ایزوله (Sandboxing) بهبود یافتهاند، اما سازندگان اعتراف…

معماری جدید عاملهای DevOps در SlackOps، اختیار اجرای دستورات را از پرامپتهای مدل زبانی گرفته و به مرزهای قطعی زمان اجرا منتقل کرده است. این سیستم با تفکیک مرحله بررسی از مسیر…

پژوهش جدیدی متد SEED را معرفی کرده است که عاملهای هوش مصنوعی را آموزش میدهد تا مسیرهای شکستخورده خود را تحلیل کرده و درسهای بهدستآمده را در سیاستهای رفتاری خود تثبیت کنند.…