پرش به محتوای اصلی
پرش به محتوای مقاله

بمب‌گذاری متنی: نرخ موفقیت عامل‌های هکری از ۵۷٪ به ۵٪ رسید

·۲۲ تیر ۱۴۰۵۲ دقیقه مطالعه
مدافعان هم اکنون به تزریق سریع روی آورده‌اند
مدافعان هم اکنون به تزریق سریع روی آورده‌اند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل تزریق پرامپت از یک ابزار تهاجمی به یک ابزار دفاعی؛ استفاده از مکانیزم Refusal مدل برای متوقف کردن کامل عامل‌های خودکار در مقیاس عملیاتی.

تصور کنید یک تله‌ی دیجیتالی طراحی کنید که به‌جای کرش کردن سیستم، هوش مصنوعی را متقاعد کند که در حال انجام کاری ممنوعه است و او را به سکوت مطلق بکشاند. این دقیقاً همان اتفاقی است که وقتی یک رشته متن مخرب در یک رمز دسترسی جعلی قرار می‌گیرد، برای مهاجمان رخ می‌دهد.

طبق گزارش منتشر شده در ۱۳ جولای ۲۰۲۶، پژوهشگران شرکت Tracebit نشان دادند که تزریق پرامپت (Prompt Injection) را می‌توان به‌جای ابزاری برای حمله، به عنوان یک سپر دفاعی برای خنثی کردن تهدیدهای عامل‌محور (Agentic) به کار برد. این در حالی است که پیش‌تر بررسی کرده بودیم که چگونه تزریق پرامپت می‌تواند با دور زدن حفاظ‌ها، امنیت مدل‌ها را به مخاطره بیندازد. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های زبانی اشاره کردیم، نبرد میان مهاجم و مدافع همواره بر سر کنترل «بستر متن» است.

این رویکرد جدید، دینامیک سنتی حملات را وارونه می‌کند و از خودِ حفاظ‌ها (Guardrails) مدل به‌عنوان یک سیم تله دفاعی استفاده می‌کند. به نقل از Tracebit، این تیم تکنیکی به نام «بمب‌گذاری متنی» (Context Bombing) را در یک محیط شبیه‌سازی شده‌ی AWS آزمایش کردند. آن‌ها پنج مدل پیشرو شامل Opus 4.8، Gemini 3.1 Pro، GLM 5.2، DeepSeek 4 Pro و Kimi 2.6 را مورد ارزیابی قرار دادند.

یافته‌های این پژوهش نشان می‌دهد که قرار دادن درخواست‌های ممنوعه — مانند دستور ساخت سلاح‌های بیولوژیک یا اشاره به اعتراضات میدان تیان‌آن‌من در سال ۱۹۸۹ — در کنار کلیدهای رمزنگاری، به‌طور مؤثر عامل‌ها را از کار می‌اندازد. این روش به‌ویژه برای مقابله با مخاطراتی حیاتی است، چرا که عامل‌های کدنویسی به دلیل ماهیت خود سطح حمله‌ی بسیار گسترده‌تری نسبت به چت‌بات‌های معمولی دارند. جزئیات آماری این آزمایشات تکان‌دهنده است:

  • در ۱۵۲ اجرای حمله، نرخ نفوذ کامل (که در آن عامل‌ها دسترسی پایدار ایجاد می‌کردند) از ۳۶٪ به ۱٪ کاهش یافت.
  • مدل Opus 4.8 که پیش‌تر نرخ موفقیت ۹۳ درصدی در دسترسی به مدیریت (Admin) داشت، در مواجهه با بمب متنی به نرخ ۰٪ رسید.

این چرخش، یک فرض بنیادی در امنیت هوش مصنوعی را می‌شکند: این تصور که حفاظ‌ها صرفاً موانعی هستند که مهاجم باید آن‌ها را دور بزند. بر اساس مستندات این تحقیق، با تحریک عمدی مکانیزم رد درخواست (Refusal Mechanism)، مدافعان می‌توانند اثری «قوی و تیز» ایجاد کنند که بازیابی از آن برای عامل‌ها پس از ورود محتوای ممنوعه به پنجرهٔ زمینه (Context Window)، بسیار دشوار است. این مکانیسم دفاعی می‌تواند جلوی سناریوهای خطرناکی را بگیرد، مانند تبدیل عامل‌های کدنویسی به بات‌نت‌های عظیم در اثر توهمات مدل.

مهندسان امنیت اکنون باید بررسی کنند که آیا تقویت «توکن‌های عسلی» (Honey-tokens) با پرامپت‌های تحریک‌کننده، می‌تواند ریسک‌های عامل‌محور در محیط‌های ابری را کاهش دهد یا خیر. احتمالاً در آینده شاهد رقابتی جدید میان مکانیزم‌های بازیابی عامل‌ها و بمب‌های متنی پیچیده‌تر خواهیم بود.

گام بعدی شما

  • بررسی ساختار «توکن‌های عسلی» در زیرساخت‌های ابری خود برای شناسایی تلاش‌های نفوذ.
  • آزمایش حساسیت مدل‌های مورد استفاده در سازمان شما نسبت به درخواست‌های ممنوعه در بستر داده‌های حساس.
  • دنبال کردن به‌روزرسانی‌های Tracebit در زمینه مدل‌های بازیابی خودکار عامل‌ها.

اما این نبرد تنها در سطح متن نیست؛ اثرات سخت‌افزاری این مدل‌های امنیتی را در تحلیل ما درباره‌ی تراشه‌های Blackwell بررسی کنید.

چرا این موضوع مهم است؟

این روش تخصص تیم‌های Red Teaming را به سمت استفاده از نقاط ضعف مدل برای دفاع سوق می‌دهد. اعتبار این یافته به دلیل آزمایش روی مدل‌های مختلف از جمله Opus و Gemini، آن را به راهکاری عملی برای کاهش ریسک دسترسی‌های غیرمجاز تبدیل می‌کند.

تأثیر برای ایران

این متد برای متخصصان امنیت سایبری و تیم‌های Red Teaming در ایران که با مدل‌های بازمتن یا APIهای خارجی کار می‌کنند، راهکاری کم‌هزینه و بدون نیاز به سخت‌افزار برای ایمن‌سازی داده‌های حساس است.

·نگاه ما
تحریریه دات‌هوش

این یافته نشان می‌دهد که نقاط ضعف مدل‌های زبانی (مانند حساسیت شدید به دستورات ایمنی) می‌توانند به نقاط قوت امنیتی تبدیل شوند. در واقع، ما از «سخت‌گیرانه بودن» مدل برای فلج کردن آن استفاده می‌کنیم. این رویکرد احتمالاً باعث می‌شود توسعه‌دهندگان عامل‌ها به دنبال روش‌های «تصفیه بستر متن» پیش از پردازش بروند تا بمب‌های متنی را شناسایی و حذف کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.