پرش به محتوای اصلی
پرش به محتوای مقاله

تغییر ۴ حرف به سیریلیک نرخ شناسایی تزریق پرامپت را به صفر رساند

·۲ شهریور ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
نه عبارت باقاعده ۸۰٪ تزریق را می‌گیرند، و صفر٪ وقتی چهار حرف لاتین با سیریلیک جابجا شوند.
نه عبارت باقاعده ۸۰٪ تزریق را می‌گیرند، و صفر٪ وقتی چهار حرف لاتین با سیریلیک جابجا شوند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

اثبات عددی اینکه تغییر تنها ۴ نویسه به هم‌شکل‌های سیریلیک، نرخ شناسایی حملات تزریق پرامپت را در یک پشته RAG مدرن به صفر مطلق می‌رساند.

تصور کنید یک لایه امنیتی پیشرفته دارید که تمام ورودی‌های مشکوک را می‌بندد، اما یک کاربر با تغییر چهار حرف ساده در متن، تمام این حصار را دور می‌زند. این واقعیت تلخ، نتیجه‌ی جدیدترین تست‌های امنیتی روی پشته‌ی تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — در پروژه Project Arc Rector است.

طبق گزارش منتشر شده در ۲۴ اوت ۲۰۲۶، جایگزینی چهار حرف لاتین با نویسه‌های سیریلیک که ظاهری کاملاً مشابه دارند، نرخ بازخوانی (Recall) — یا همان توانایی سیستم در شناسایی تمام موارد مثبت — را از ۸۰٪ به صفر مطلق رساند. این یافته‌ها بخشی از نتایج «حفاظ‌های سطح ۸» در این پشته‌ی عامل‌محور (Agentic) است که از قطعات قابل میزبانی شخصی ساخته شده است. این چالش‌ها در راستای تلاش‌های گسترده‌تری برای کنترل رفتارهای پیش‌بینی‌ناپذیر عوامل هوشمند است، مشابه آنچه در سیستم Grimdall برای جلوگیری از حذف تصادفی دایرکتوری‌های ریشه مشاهده شد.

بسیاری از سیستم‌های RAG به این دلیل آسیب‌پذیرند که پرامپت‌های سیستمی، پرسش‌های کاربر و اسناد بازیابی شده را به عنوان یک جریان تخت از توکن‌ها (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — می‌بینند. این نقص ساختاری به مهاجم اجازه می‌دهد دستورات مخرب را درون داده‌ها پنهان کند؛ نقطه‌ای که Project Arc Rector سعی می‌کند با یک فیلتر لایه‌ی اول آن را مدیریت کند.

به نقل از گزارش dev.to، این سیستم از یک حفاظ داخلی بدون وابستگی استفاده می‌کند که شامل ۹ عبارت منظم (Regex) است. این الگوها عبارات رایج تزریق پرامپت (Prompt Injection) مانند «دستورات قبلی را نادیده بگیر» را هدف قرار می‌دهند. این رویکرد مبتنی بر فیلترینگ ساده، یادآور ساختار Trust Gateway است که در آن مدل‌های فیلترینگ جایگزین ریاضیات و احراز اصالت شدند.

شکاف عملکردی

بر اساس مستندات پروژه، این ۹ عبارت منظم روی متون پاک، به دقت (Precision) ۰.۸۶۵ و بازخوانی ۰.۸۰۰ در ۴۰ حمله دست‌نویس رسیدند. اما این دفاع در برابر تکنیک‌های ساده‌ی فرار فروپاشید:

  • هم‌شکل‌های سیریلیک (Homoglyphs): بازخوانی به ۰.۰۰۰ رسید.
  • نویسه‌های با عرض صفر (U+200B): بازخوانی به ۰.۰۰۰ رسید.
  • پوشش‌های Base64: بازخوانی به ۰.۰۰۰ رسید.
  • زبان Leetspeak: بازخوانی به ۰.۷۲۵ کاهش یافت.

همان‌طور که در تحلیل قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، تکیه بر فیلترهای سطحی هرگز راهکار نهایی نیست. توسعه‌دهندگان برای بازگرداندن سطح دفاع، یک لایه‌ی نرمال‌سازی شامل حذف نویسه‌های عرض-صفر و جدول تبدیل هم‌شکل‌ها را اضافه کردند. این کار بازخوانی را به ۸۰٪ برگرداند، اما دقت را به ۰.۸۴۲ کاهش داد؛ زیرا بحث‌های فنی مشروع درباره‌ی «دستورات» را به اشتباه به عنوان حمله شناسایی کرد.

این نتیجه ثابت می‌کند که فیلترهای سمت پرامپت نمی‌توانند حفره‌های ساختاری معماری مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — را بپوشانند. این ابزارها صرفاً لایه‌ای ارزان برای ثبت وقایع (Logging) هستند، نه سدی در برابر مهاجمان حرفه‌ای.

گام بعدی شما

  • اگر از Regex برای امنیت LLM استفاده می‌کنید، فوراً یک لایه‌ی نرمال‌سازی (Normalization) برای نویسه‌ها اضافه کنید.
  • به جای پیش‌بینی تمام روش‌های نوشتاری کلمه‌ی «نادیده بگیر»، روی جداسازی ساختاری داده‌ها از دستورات تمرکز کنید.
  • مجموعه‌ی تست‌های پروژه Arc Rector را برای ارزیابی حفاظ‌های خود بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این گزارش با تکیه بر داده‌های تجربی Project Arc Rector، اعتبار ادعای «ناکارآمدی فیلترهای Regex» را تقویت می‌کند. توسعه‌دهندگان باید بدانند که لایه‌های حفاظتی متنی تنها برای دفع حملات آماتور مفیدند و برای امنیت واقعی باید به سراغ جداسازی ساختاری بروند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در حال ساخت دستیارهای هوشمند با RAG هستند، این خبر هشدار می‌دهد که نباید به فیلترهای متنی ساده برای امنیت داده‌های حساس تکیه کنند.

·نگاه ما
تحریریه دات‌هوش

تکیه بر فیلترهای متنی برای امنیت هوش مصنوعی، شبیه تلاش برای متوقف کردن سیل با یک توری ماهیگیری است. این یافته‌ها نشان می‌دهد که «امنیت از طریق پنهان‌سازی» یا فیلتر کردن کلمات کلیدی، در برابر ساده‌ترین ترفندهای کدگذاری (Encoding) شکست می‌خورد. راهکار واقعی تنها در تغییر معماری است، به‌گونه‌ای که مدل بتواند تفاوت ذاتی بین «داده‌ی ورودی» و «دستور اجرایی» را در سطح توکن‌ها درک کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.