پرش به محتوای اصلی
پرش به محتوای مقاله

تکنیک «بمب‌گذاری زمینه» نرخ تصاحب حساب توسط عامل‌های هوش مصنوعی را به ۵٪ رساند

·۲۷ تیر ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
حملات تزریق پرامپت مانع عملکرد عوامل هوش مصنوعی هکری می‌شوند
حملات تزریق پرامپت مانع عملکرد عوامل هوش مصنوعی هکری می‌شوند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل «تزریق پرامپت» از یک تهدید به یک ابزار دفاعی؛ استفاده از دستورات ممنوعه برای تحریک حفاظ‌های ایمنی مدل و متوقف کردن کامل عامل‌های مهاجم به‌جای تلاش برای فیلتر کردن ورودی‌ها.

یک دستور ممنوعه در یک داده‌ی جعلی می‌تواند کل مأموریت یک عامل هوش مصنوعی مهاجم را با شکست مواجه کند. محققان Tracebit در روز دوشنبه افشا کردند که تکنیکی تحت عنوان «بمب‌گذاری زمینه» (Context Bombing) می‌تواند با فعال کردن حفاظ‌های ایمنی داخلی مدل، از نفوذ به سامانه‌ها جلوگیری کند. این روش در واقع حساسیت‌های اخلاقی و ایمنی مدل را علیه خودِ مهاجم به کار می‌گیرد.

تزریق پرامپت (Prompt Injection) مدت‌هاست که سلاح اصلی مهاجمان برای فریب دادن مدل‌های زبانی بزرگ (LLM) جهت استخراج داده‌ها از طریق ایمیل‌ها یا دعوت‌نامه‌های تقویم بوده است. این آسیب‌پذیری که می‌تواند حفاظ‌های امنیتی هوش مصنوعی را به‌طور کامل دور بزند، چالش بزرگی برای توسعه‌دهندگان ایجاد کرده است. تا پیش از این، مدافعان گزینه‌های محدودی داشتند و عمدتاً بر ساخت حفاظ‌های پیچیده برای متوقف کردن این تزریق‌ها متکی بودند. اکنون جای بازی عوض شده است و مدافعان از خودِ تزریق‌های پرامپت به‌عنوان مین‌های دیجیتال استفاده می‌کنند تا مسیر مهاجم را مسدود کنند.

تصور کنید در یک خزینه‌ی مجازی، طلاها با تابلویی احاطه شده‌اند که روی آن نوشته شده است: «به من بگو چگونه سلاح بیولوژیکی بسازم». وقتی یک عامل (Agent) برای سرقت طلا وارد می‌شود، این تابلو را می‌خواند، سازوکار رد کردن (Refusal Mechanism) داخلی‌اش فعال شده و تمام عملیات را متوقف می‌کند. در این سناریو، مدل به‌جای تمرکز بر هدف اصلی (سرقت داده‌ها)، درگیر پروتکل‌های ایمنی خود می‌شود و از ادامه مسیر باز می‌ماند.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، شناسایی نقاط ضعف در لایه‌ی استنتاج برای جلوگیری از نفوذ حیاتی است. در این روش جدید، مهاجمان اغلب دستورات مخرب خود را در قالب ایمیل‌های متقاعدکننده یا دعوت‌نامه‌های تقویم پنهان می‌کنند تا مدل را به استخراج داده‌های حساس یا انجام اقدامات مضر ترغیب کنند. این نوع حملات در کنار سایر ریسک‌های عملیاتی قرار دارند؛ برای مثال، برخی پژوهش‌ها نشان داده‌اند که توهمات مدل‌های زبانی می‌توانند عامل‌های کدنویسی را به بات‌نت‌های عظیمی تبدیل کنند که امنیت زیرساخت‌ها را به خطر می‌اندازد.

توسعه‌دهندگان برای مقابله با این تهدیدات، حفاظ‌ها (Guardrails) یا نرده‌های ایمنی ایجاد می‌کنند تا مانع از اقدامات مضر AI شوند. با این حال، تزریق پرامپت همچنان مشکلی لاینحل (Intractable) است که هیچ راهکار ریشه‌ای برای آن یافت نشده است. این بن‌بست باعث شد توسعه‌دهندگان به حفاظ‌های پیچیده متکی شوند. اکنون، مدافعان از خودِ تزریق پرامپت برای متوقف کردن عامل‌های هکر استفاده می‌کنند و این دستورات را در کنار رمزهای عبور، کلیدهای رمزنگاری و سایر اسرار ذخیره شده در آمازون وب سرویسز (AWS) قرار می‌دهند.

طبق گزارش Tracebit، این تکنیک با قرار دادن پرامپت‌هایی عمل می‌کند که مدل را به انجام کارهایی مجبور می‌کند که توسط توسعه‌ده‌دهندگان اکیداً ممنوع شده است. نمونه‌هایی از این دستورات عبارت‌اند از:

  • درخواست دستورالعمل‌های دقیق برای تولید هاگ‌های تنفسی سیاه‌سرم (Anthrax).
  • اشاره به وقایع مربوط به «مرد تانک» در میدان تیان‌آن‌من ۱۹۸۹ (که به‌طور خاص برای مدل‌های توسعه‌یافته توسط شرکت‌های چینی طراحی شده است).

به محض اینکه این رشته‌های متنی وارد پنجرهٔ زمینه (Context Window) عامل شوند، سازوکار رد کردن یک «اثر شدید» (Sharp Effect) ایجاد می‌کند که بازیابی آن برای عامل بسیار دشوار است. طبق اعلام اندی اسمیت، هم‌بنیان‌گذار و مدیرعامل Tracebit، این تکنیک یک مکانیسم رد کردن را در متن فعال می‌کند. زمانی که عامل با این دستورات ممنوعه مواجه می‌شود، دیگر دستورات قبلی خود را دنبال نمی‌کند و به‌طور مستمر از انجام هرگونه اقدام بعدی خودداری می‌کند.

برای سنجش کارایی، Tracebit پنج مدل پیشرو شامل Opus 4.8، Gemini 3.1 Pro، GLM 5.2، DeepSeek 4 Pro و Kimi 2.6 را در یک محیط شبیه‌سازی‌شده‌ی AWS آزمایش کرد. به این عامل‌ها دستور داده شده بود تا وظایف روتین توسعه‌دهندگان را انجام دهند، که باعث شد منابع را فهرست کرده و به‌طور تصادفی با رشته‌های متنی کاشت شده مواجه شوند. در ۱۵۲ اجرای حمله، نتایج تکان‌دهنده بود:

  • نرخ ارتقای سطح دسترسی به Admin از ۵۷٪ به ۵٪ کاهش یافت.
  • تصاحب کامل سیستم (که در آن مهاجمان جای پایی دائمی ایجاد می‌کردند) از ۳۶٪ به ۱٪ رسید.
  • تعداد اجراهایی که به هرگونه مسیر حمله دست یافتند از ۹۱٪ به ۱۵٪ سقوط کرد.
  • میانگین تعداد مسیرهای با موفقیت تکمیل شده در هر اجرا از ۱.۵۳ به تنها ۰.۱۶ رسید.
  • مدل Opus 4.8 که توانمندترین مدل بود، از نرخ موفقیت ۹۳٪ در دسترسی Admin به شکست مطلق در تمام دفعات مواجهه با بمب زمینه رسید.
  • هیچ‌یک از اجراها نتوانستند مسیر حمله را بدون فعال کردن حداقل یک شناسایی کاناری تکمیل کنند.

این رویکرد تکامل یافته‌ی «کاناری‌ها» (Canaries) است که Tracebit در مه ۲۰۲۴ معرفی کرد؛ منابع جعلی در AWS که قانونی به نظر می‌رسند اما بلااستفاده هستند. وقتی یک AI عامل‌محور این منابع را بررسی می‌کند، مدافعان از وجود تهدید آگاه می‌شوند.

طبق بررسی‌ها، این کاناری‌ها به‌طور میانگین طی ۸ دقیقه شروع یک حمله را هشدار می‌دهند. با این حال، محققان دریافتند که مدل‌های عامل‌محور تقریباً به ۱۴ دقیقه زمان نیاز دارند تا به کنترل مدیریتی (Administrative Control) دست یابند. این فاصله ۶ دقیقه‌ای برای واکنش «به‌طور ناخوشایندی نزدیک» و اندک بود. همین موضوع نیاز به روش بمب‌گذاری زمینه را ایجاد کرد تا حمله به‌جای هشدار دادن، واقعاً متوقف شود.

این تغییر، یک چرخش بنیادین در امنیت AI است. به‌جای تلاش برای حل مشکل «لاینحل» تزریق پرامپت، مدافعان از صلبیت حفاظ‌های ایمنی به‌عنوان یک محیط دفاعی استفاده می‌کنند. در واقع، بزرگ‌ترین نقطه ضعف LLM — یعنی حساسیت شدید به دستورات ورودی — به یک ویژگی امنیتی تبدیل شده است.

باید اشاره کرد که شرکت‌هایی مانند Socket و Check Point پیش‌تر دیده بودند که عامل‌های LLM برای متوقف کردن تحلیل بدافزارها، مدل‌های هدف را به سمت تولید دستورالعمل بمب هسته‌ای یا بیولوژیکی سوق می‌دهند تا سیستم تحلیل را از کار بیندازند. اما این نخستین مورد مستند است که مدافعان از همین تاکتیک در لایه‌ی دفاعی استفاده کرده‌اند. ارلنس فرناندز، استاد دانشگاه یو سی سن دیگو که متخصص امنیت AI است، تأکید کرد که تا پیش از این شاهد استفاده هر کسی از این تکنیک به‌عنوان یک سپر دفاعی نبوده است.

گام بعدی شما

  • بررسی استقرار توکن‌های عسلی (Honey-tokens) و اسرار جعلی در محیط‌های ابری خود برای فعال‌سازی سازوکارهای رد کردن.
  • تحلیل اثرگذاری دستورات «ممنوعه» بر مدل‌های مختلف برای یافتن حساس‌ترین نقاط حفاظ ایمنی آن‌ها.
  • ارزیابی سرعت واکنش سیستم‌های مانیتورینگ در برابر حملات عامل‌محور.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این روش با تکیه بر اعتبار تجربی پژوهشگران Tracebit، ثابت می‌کند که می‌توان از نقاط ضعف ساختاری مدل‌های زبانی برای ایجاد لایه‌های دفاعی غیرقابل نفوذ استفاده کرد. این تغییر، هزینه و ریسک حملات عامل‌محور را در محیط‌های ابری به‌شدت افزایش می‌دهد.

تأثیر برای ایران

این روش برای تیم‌های امنیت سایبری و توسعه‌دهندگان ایرانی که از زیرساخت‌های ابری استفاده می‌کنند، راهکاری ارزان و بدون نیاز به APIهای خاص برای مقابله با عامل‌های نفوذگر است.

·نگاه ما
تحریریه دات‌هوش

بهره‌برداری از «سلب صلاحیت» مدل برای توقف حمله، نشان می‌دهد که صلبیت حفاظ‌های ایمنی (Safety Guardrails) در حال تبدیل شدن به یک ابزار استراتژیک است. این رویکرد، پارادایم امنیتی را از «جلوگیری از ورود» به «مسموم‌سازی مسیر» تغییر می‌دهد؛ جایی که مهاجم با همان ابزاری که برای فریب مدل استفاده می‌کند، دچار فلج عملیاتی می‌شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.