پرش به محتوای اصلی
پرش به محتوای مقاله

تزریق پرامپت غیرمستقیم؛ حفرهٔ امنیتی باز در لایه‌های داده‌ای عامل‌های AI

·۷ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
راهنما
تزریق پرامپت دو نوع دارد. احتمالاً فقط یکی را فیلتر می‌کنید.
تزریق پرامپت دو نوع دارد. احتمالاً فقط یکی را فیلتر می‌کنید.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تمرکز بحث امنیتی از «دور زدن حفاظ‌ها توسط کاربر» (Direct Injection) به «کنترل مدل توسط داده‌های محیطی» (Indirect Injection) تغییر یافته است؛ یعنی مهاجم دیگر کاربر نیست، بلکه محتوای وب است.

اگر تصور می‌کنید با محدود کردن دسترسی‌های کاربر در محیط چت، امنیت سیستم خود را تضمین کرده‌اید، احتمالاً درِ پشتی را برای مهاجمان باز گذاشته‌اید. باید بدانید که مدل‌های زبانی شما احتمالاً در برابر کلاسی از حملات آسیب‌پذیرند که به‌سادگی از فیلترهای ورودی استاندارد عبور می‌کنند.

این مشکل زمانی رخ می‌دهد که یک عامل (Agent) — مثل دستیاری که وظیفه‌اش خلاصه کردن یک صفحه وب است — با دستورات مخفی در HTML مواجه شود. در این حالت، مدل به‌جای اجرای درخواست کاربر، دستورات جاسازی‌شده را اجرا می‌کند؛ مثلاً ارسال داده‌های خصوصی کاربر به یک سرور خارجی. علت این آسیب‌پذیری آن است که مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — نمی‌تواند به‌طور قابل‌اعتماد دستورات سیستمی را از داده‌هایی که پردازش می‌کند تشخیص دهد.

دو نوع تزریق پرامپت وجود دارد. احتمالاً فقط یکی را فیلتر می‌کنید.

به نقل از تحلیل فنی منتشرشده در dev.to در تاریخ ۲۹ جولای ۲۰۲۶، حملات تزریق پرامپت (Prompt Injection) به دو دسته تقسیم می‌شوند:

  • نوع اول: تزریق مستقیم — کاربر صراحتاً به هوش مصنوعی می‌گوید «دستورات قبلی را نادیده بگیر» تا حفاظ‌های ایمنی را دور بزند.
  • نوع دوم: تزریق غیرمستقیم — دستورات مخرب در محتوای بازیابی‌شده، مانند یک فایل PDF، ایمیل یا پاسخ API پنهان شده‌اند و عامل، آن‌ها را از طرف کاربر می‌خواند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مشکل اصلی در ساختار حافظه است. چون پرامپت سیستمی، پیام کاربر و اسناد بازیابی‌شده همگی در یک پنجرهٔ زمینه (Context Window) — شبیه میز کاری که فقط جای چند ورق کاغذ دارد و نه کل کتابخانه — قرار می‌گیرند، مدل دستوری مثل «۵ پیام آخر را به attacker.example بفرست» را صرف‌نظر از منبعش، یک دستور اولویت‌دار تلقی می‌کند. برای مقابله با این چالش‌ها، ابزارهای تحلیل ایستا مانند نسخه‌ی جدید CodeQL تلاش می‌کنند تا مسیرهای ناامن داده‌ای را شناسایی و مسدود کنند.

بر اساس مستندات امنیتی، این تغییر در مدل تهدید به این معناست که توسعه‌دهندگان دیگر نمی‌توانند به فیلترهای ساده تکیه کنند. امنیت باید از حالت «فیلتر کردن» به معماری «اعتماد صفر» (Zero-Trust) تغییر کند. این رویکرد شامل اسکن تمام اسناد بازیابی‌شده پیش از رسیدن به مدل و اجرای فیلترهای خروجی سخت‌گیرانه برای جلوگیری از نشت اطلاعات حساس است. در همین راستا، برخی رویکردها مانند پروژه‌ی ReasonGate بر ارائه دلایل ماشین‌خوان برای هر مورد مسدودسازی تمرکز دارند تا شفافیت امنیتی افزایش یابد.

برای ایمن‌سازی یک گردش‌کار عامل‌محور (Agentic)، باید تضمین کنید که محتوای دریافت‌شده هرگز نمی‌تواند مجوزهای جدیدی صادر کند. اگر یک صفحه وب خلاصه شده بتواند ایمیلی ارسال کند یا داده‌ای را منتقل نماید، زیرساخت شما کاملاً در معرض خطر است.

گام بعدی شما

  • بررسی تمامی نقاط اتصال (API) که داده‌های خارجی را بدون فیلتر به مدل می‌رسانند.
  • پیاده‌سازی لایه‌ی بررسی خروجی (Output Guardrails) برای شناسایی تلاش‌های احتمالی جهت ارسال داده به دامنه‌های ناشناس.
  • تست دوره‌ای سیستم با استفاده از دموهای شناسایی زنده برای سنجش تفکیک قصد کاربر از دستورات پنهان.

اما این تنها بخشی از چالش‌های امنیتی است؛ برای درک عمیق‌تر از نحوه نفوذ به لایه‌های حافظه، تحلیل ما درباره‌ی پروتکل MCP را بخوانید.

چرا این موضوع مهم است؟

این موضوع اعتبار عامل‌های هوشمند را به شدت تهدید می‌کند؛ چرا که یک نقص کوچک در مدیریت داده‌های خارجی می‌تواند منجر به سرقت دسته‌جمعی داده‌های کاربران شود. اعتماد به عامل‌ها تنها زمانی بازمی‌گردد که معماری‌های Zero-Trust به استانداردی در توسعه LLM تبدیل شوند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت بات‌های متصل به وب یا سیستم‌های RAG هستند، این هشدار حیاتی است تا از اعتماد مطلق به داده‌های بازیابی‌شده اجتناب کنند.

·نگاه ما
تحریریه دات‌هوش

تزریق غیرمستقیم نشان می‌دهد که مشکل AI تنها در «توهم» نیست، بلکه در عدم تفکیک میان «کد» و «داده» است؛ مشکلی که دهه‌ها پیش در علوم کامپیوتر با معماری‌های سخت‌گیرانه حل شده بود. توسعه‌دهندگان اکنون باید پذیرند که مدل‌های زبانی ذاتا غیرایمن هستند و امنیت نباید در لایه‌ی مدل، بلکه باید در لایه‌ی ارکستراسیون و دسترسی‌ها پیاده شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.