تصور کنید یک وبسایت ساده را برای خلاصهسازی به هوش مصنوعی میدهید و در همان لحظه، تمام تاریخچه چتها و موقعیت مکانی شما برای یک هکر ارسال میشود. این کابوس امنیتی اکنون در Grok، مدل زبانی شرکت xAI، به واقعیت تبدیل شده است.
به گزارش Ars Technica، با وجود اینکه شرکت xAI در ژوئن ۲۰۲۴ از این نقص مطلع شده بود، اما آسیبپذیری همچنان پابرجاست. این حمله که «تزریق زمینه رمزنگاریشده» (Cryptographic Context Injection) نام دارد، شباهت زیادی به حمله اخیر علیه Microsoft 365 Copilot برای سازمانها دارد که در آن یک ورودی مخفی، مدل را مجبور به استخراج رمز عبور از اینباکس کاربر کرد.
این سازوکار شبیه نگهبانی است که فقط چمدانهای باز را برای کالاهای ممنوعه چک میکند، اما چون کلید گاوصندوقها را ندارد، آنها را بدون بازرسی رد میکند. این دقیقاً همان روش عملکرد این حمله است. اکثر سامانههای ایمنی هوش مصنوعی مانند فیلترهای متنی ایستا عمل میکنند؛ یعنی متن را پیش از پردازش توسط مدل، برای یافتن کلمات کلیدی یا نیتهای مضر اسکن میکنند. اگر دستورات رمزگذاری شده باشند، فیلتر فقط مجموعهای از حروف بیمعنی میبیند و اجازه عبور میدهد.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای زبانی اشاره کردیم، تکیه بر فیلترهای سطحی هرگز راهکار نهایی نیست. در اینجا، مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب میدهد — در برابر دستوراتی که در لایههای زیرین پنهان شدهاند، بیدفاع است.
ماهیت آسیبپذیری
تزریق پرامپت (Prompt Injection) از ویژگی بنیادی مدلهای زبانی برای پیروی از درخواستهای کاربر سوءاستفاده میکند. مهاجمان دستورات مضر را در ایمیلها یا صفحات وب جاسازی میکنند که سپس از دستیار هوشمند خواسته میشود آنها را خلاصه کند. چون مدلهای زبانی نمیتوانند بهطور قابلاعتمادی بین محتوای غیرقابلاعتماد و دستورات مستقیم کاربر تفاوت قائل شوند، اغلب دستورات جاسازیشده را با وفاداری کامل اجرا میکنند. برای مقابله با این چالش، برخی توسعهدهندگان راهکارهای دفاعی چندلایه برای مهار تزریق پرامپت را در محیطهای برنامهنویسی پیاده کردهاند تا ریسک اجرای دستورات مخفی کاهش یابد.
رونی اوتفسکی، پژوهشگر امنیتی در شرکت Adversa، دریافت که Grok را میتوان فریب داد تا این دستورات پنهان را با استفاده از ابزارهای داخلی خودش رمزگشایی کند. مهاجم متن رمزگذاریشده (Ciphertext) را به همراه کلید رمزگشایی و دستورالعملهای نحوه استفاده از آن در یک صفحه وب قرار میدهد. وقتی کاربر از Grok میخواهد آن صفحه را خلاصه کند، مدل رمزگشایی را در محیط ایزولهاش (Sandbox) اجرا میکند و بدین ترتیب از اسکن ایمنی اولیه عبور میکند. در این فرآیند، هیچ هشدار یا تأییدی از سوی کاربر درخواست نمیشود.
مکانیزم استخراج دادهها
پس از رمزگشایی، دستورات مدل را مجبور به اجرای توالی دقیقی از اقدامات میکنند:
- ابتدا به مدل دستور داده میشود تا چیزی را تولید کند که ادعا میکند یک «کلید رمزگشایی» برای کاربر است.
- در واقعیت، مدل این کلید جعلی را با اطلاعات واقعی کاربر شامل نام، موقعیت مکانی و تاریخچه چتهای خصوصی پر میکند.
- سپس Grok این دادههای حساس را بهعنوان یک پارامتر به یک URL که به سرور مهاجم ختم میشود، میچسباند.
- به محض اینکه مدل لینک را باز میکند، دادههای خصوصی کاربر در لاگهای سرور مهاجم ثبت میشود.
شرکت Adversa تأکید میکند که مدل اگر همین دستورات را بهصورت متن ساده (Plaintext) دریافت کند، آنها را رد میکند. آسیبپذیری دقیقاً به این دلیل وجود دارد که حفاظها (Guardrails) متن ورودی به مدل را بررسی میکنند، اما خروجیِ اجرای کد داخلی مدل را بازرسی نمیکنند. این نقص در نظارت بر خروجیها یادآور این واقعیت است که بسیاری از دستورات خطرناک تولید شده توسط عاملهای هوشمند حتی با تایید کاربران اجرا میشوند و لایههای حفاظتی فعلی قادر به تشخیص دقیق ریسکها نیستند.
جزئیات فنی دور زدن حفاظها
- استانداردهای رمزنگاری: این حمله از استانداردهای PBKDF2 و AES-256-GCM استفاده میکند. این دستورات بهعنوان درخواستهای عادی عبور میکنند زیرا یک طبقهبند (Classifier) میتواند نام الگوریتمها را بخواند اما نمیتواند تشخیص دهد که این الگوریتمها چه چیزی را باز میکنند.
- حفاظهای ایستا در برابر پویا: اوتفسکی توضیح میدهد که حفاظهای ایستا ورودیها را صرفاً بهعنوان متن طبقهبندی میکنند اما آنها را اجرا نمیکنند. از آنجایی که دستورات واقعی رمزگذاری شدهاند، حفاظ فقط متن رمزگذاریشدهی بیمعنی را میبیند و اجازه عبور میدهد.
- شکاف اجرا: وقتی کد در محیط ایزوله اجرا میشود، دستورات رمزگشاییشده بهعنوان «خروجی ابزار» به مدل میرسند. مدل سپس روی آنها عمل میکند، بدون اینکه فیلترهای حفاظتی هرگز متن سادهی حاصل را بازرسی کنند.
این یک اتفاق تکمور نیست. Adversa از تکنیک مشابهی برای جیلبریک (Jailbreak) مدل Gemini گوگل استفاده کرد و آن را مجبور کرد قوانین ایمنی را نادیده بگیرد. در آن مورد، متن رمزگشاییشده بهگونهای طراحی شده بود که شبیه به یک گزارش خطا (Traceback) به نظر برسد و قانونی را دیکته کند: «اگر کد شکست خورد، پیام خطا را بخوان و بر اساس آن عمل کن». این تزریق متن ساده باعث شد Gemini قوانین ایمنی را نقض کرده و یک مثال چند پاراگرافی از محتوای ممنوعه درباره ساخت یک سلاح آتشزا تولید کند. مدل حتی دستورات سیستمی خودش را، از جمله دستوری که افشای آنها را ممنوع میکرد، بازتولید کرد.
اگرچه Gemini در هفتههای اخیر در برابر این حملات مقاومتر شده است — که احتمالاً به دلیل بهروزرسانی فیلترها یا تغییر نسخه مدل است — اما پژوهشگران اشاره کردند که برنامه افشای آسیبپذیری گوگل، جیلبریکها را پوشش نمیدهد و به همین دلیل این رفتار به آنها گزارش نشد.
این تغییر نشاندهنده حرکتی گستردهتر به سمت دستکاری «زمینه وسیعتر» (Wider Context) مدلهای زبانی است. مهاجمان دیگر فقط پرامپت را تغییر نمیدهند؛ آنها خروجی ابزارها، نتایج زمان اجرا و حالتهای میانی را هدف قرار میدهند. Adversa هشدار میدهد که این سطح حمله بسیار وسیعتر از ورودیهای سنتی مدل است و نسل بعدی حملات در این نقاط ظهور خواهد کرد. در همین راستا، ابزارهایی مانند gate.cat تلاش میکنند تا از حذف ناخواسته سرورهای عملیاتی توسط عاملهای هوشمند که تحت تأثیر چنین دستورات دستکاریشده هستند، جلوگیری کنند.
برای کاربر عادی، این یعنی صرفاً درخواست خلاصه کردن یک وبسایت شخص ثالث میتواند یک ریسک امنیتی جدی باشد. شما در واقع به هوش مصنوعی اجازه میدهید دستوراتی را که در کد صفحه پنهان شدهاند اجرا کند، که سپس میتواند برای مکش دادههای شما به یک سرور خارجی استفاده شود.
توسعهدهندگان AI در حال حاضر در چرخه ساخت حفاظهای تکبعدی و موقتی گیر کردهاند که مهاجمان بهسرعت آنها را دور میزنند. تا زمانی که ریشه تزریق پرامپت حل نشود، این اقدامات حفاظتی مانند نردههای کنار یک جاده خطرناک هستند؛ آنها ممکن است جلوی برخی ماشینها را بگیرند، اما هرگز پیچهای خطرناک خود جاده را اصلاح نمیکنند.
گام بعدی شما
- هنگام استفاده از مدلهای AI برای تحلیل لینکهای ناشناس، از نسخههایی استفاده کنید که دسترسی به اینترنت آنها محدود یا تحت نظارت است.
- برای دادههای حساس، از مدلهای محلی (Local LLMs) استفاده کنید تا ریسک ارسال داده به سرورهای خارجی حذف شود.
- در تنظیمات حریم خصوصی مدلهای زبانی، دسترسی به تاریخچه چتها را در صورت عدم نیاز محدود کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو