پرش به محتوای اصلی
پرش به محتوای مقاله

«تحدید باورهای امنیتی»؛ دستاورد جدید Anthropic در دفع حفره‌های تزریقی

·۳ مرداد ۱۴۰۵۱ دقیقه مطالعه
کد پنهان در Claude Code کاربران چینی را مخفیانه علامت‌گذاری کرد
کد پنهان در Claude Code کاربران چینی را مخفیانه علامت‌گذاری کرد
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

رساندن نرخ خطای تزریق پرامپت به صفر درصد از طریق ترکیب مدل با یک لایه‌ی نرم‌افزاری دفاعی؛ در حالی که پیش‌تر این نقص به عنوان یک محدودیت بنیادی و غیرقابل‌رفع در LLMها شناخته می‌شد.

صفر درصد. این عدد نرخ موفقیت مهاجمان در ۱۲۹ سناریوی آزمایشی برای عامل‌های مرورگری است که Opus 5 را به پیشروترین مدل از نظر امنیتی تبدیل می‌کند. طبق اعلام رسمی در کارت مدل منتشر شده در ۲۵ ژوئیه ۲۰۲۶، این مدل توانسته است حملات تزریق پرامپت (Prompt Injection) — که در آن متون پنهان در صفحات وب سعی می‌کنند دستورات مدل را تغییر دهند — را به‌طور کامل خنثی کند.

این پیشرفت در حالی رخ می‌دهد که فضای صنعت با نوعی یأس همراه بود. در دسامبر گذشته، OpenAI پذیرفت که تزریق پرامپت شاید هرگز به‌طور کامل حل نشود و عامل‌ها را در برابر داده‌های خارجی مخرب آسیب‌پذیر نگه دارد. برای کسب‌وکارهایی که قصد دارند عامل (Agent) — چیزی شبیه به یک کارمند دیجیتال که می‌تواند به‌جای شما در وب بچرخد و کار انجام دهد — را به‌صورت خودکار مستقر کنند، این نقص امنیتی بزرگ‌ترین سد راه بود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، توازن بین کاربردی بودن و ایمنی همواره یک کلید دو لبه بوده است. این چالش ایمنی با پدیده Reward Hacking که باعث تورم کاذب نمرات بنچ‌مارک‌ها می‌شود، شباهت دارد و نشان می‌دهد که مدل‌ها گاهی مسیرهای میان‌بری برای پیروزی در تست‌ها پیدا می‌کنند، نه لزوماً مسیرهای امن.

بر اساس مستندات Anthropic، این موفقیت تنها نتیجه‌ی وزن‌های مدل نیست، بلکه مدیون سیستمی دو لایه به نام Auto Mode است که در محصولاتی مثل Claude Cowork به کار رفته است. لایه‌ی اول، داده‌های ورودی را پیش از پردازش برای یافتن دستورات پنهان اسکن می‌کند؛ لایه‌ی دوم نیز اقدامات خطرناک را پیش از اجرا مسدود می‌کند. یک مهاجم برای موفقیت باید هر دو لایه را به‌طور مستقل دور بزند.

بدون Auto Mode، دفاع مدل به این اندازه مطلق نیست. در این حالت، Opus 5 نرخ خطای ۳.۷ درصدی داشت، در حالی که Sonnet 5 با ۰.۹۳ درصد عملکرد بهتری نشان داد.

اوپوس ۵ شاید بزرگ‌ترین آسیب‌پذیری امنیتی عامل‌های هوش مصنوعی را حل کرده باشد.

تأییدیه‌ی خارجی از سوی شرکت امنیتی Gray Swan نیز برتری Opus 5 در محک IPI را می‌رساند. طبق گزارش این شرکت، پس از ۱۵ تلاش، نرخ موفقیت مهاجم علیه Opus 5 به ۲.۰ درصد کاهش یافت و از Mythos 5 (۲.۶٪) و Fable 5 (۲.۸٪) پیشی گرفت. این نوع تحلیل‌های امنیتی، یادآور گزارشات مربوط به پیش‌بینی‌پذیری رمزهای عبور تولیدشده با هوش مصنوعی است که نشان داد حتی در خروجی‌های متنی ساده نیز الگوهای آسیب‌پذیر وجود دارد.

این تغییر مسیر به این معناست که شکاف امنیتی «حل‌ناپذیر»، اکنون به یک مسئله‌ی مهندسی نرم‌افزار تبدیل شده است، نه یک محدودیت بنیادی در هوش مصنوعی. با ترکیب هوش مدل و حفاظ‌ها (Guardrails) — شبیه به لایه‌های امنیتی یک گاوصندوق که هر لایه یک کلید متفاوت دارد — شرکت‌ها می‌توانند عامل‌ها را از حالت «فقط خواندنی» به «اجرای فعال» منتقل کنند بدون اینکه بترسند سیستم توسط یک وب‌سایت مخرب تسخیر شود.

گام بعدی شما

  • اگر از عامل‌های مرورگری برای اتوماسیون استفاده می‌کنید، لایه‌های فیلترینگ ورودی را پیش از اجرای دستورات حساس بازبینی کنید.
  • معماری Auto Mode را برای پیاده‌سازی سیستم‌های دفاعی چندلایه در اپلیکیشن‌های خود بررسی کنید.
  • منتظر واکنش OpenAI باشید تا ببینیم آیا آن‌ها هم استراتژی «سخت‌افزار-نرم‌افزاری» را برای حل تزریق پرامپت می‌پذیرند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار شرکت Gray Swan، ریسک استقرار عامل‌های خودکار در محیط‌های بازوب را به‌شدت کاهش می‌دهد. این یعنیBusinesses اکنون می‌توانند بدون ترس از تسخیر سیستم، دسترسی کامل به مرورگر را به هوش مصنوعی بدهند.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم به قابلیت‌های Auto Mode برای توسعه‌دهندگان ایرانی دشوار است؛ با این حال، معماری لایه‌بندی شده‌ی آن الگویی کاربردی برای تیم‌های داخلی در پیاده‌سازی لایه‌های حفاظتی است.

·نگاه ما
تحریریه دات‌هوش

تغییر پارادایم از «حل‌ناپذیری مدل» به «مهندسی لایه‌ای» نشان می‌دهد که امنیت در عصر عامل‌ها، دیگر در لایه‌ی احتمالاتیِ توکن‌ها نیست، بلکه در معماری سیستم (System Design) نهفته است. این رویکرد Anthropic احتمالاً استاندارد جدیدی برای استقرار عامل‌های تجاری تعریف می‌کند که در آن مدل تنها یکی از چندین فیلتر امنیتی است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.