تصور کنید یک برنامهنویس یا متخصص امنیت بخواهد نقاط ضعف یک مدل زبانی را بسنجد؛ در این حالت، مجموعهای از پازلهای منطقی ساده میتواند تقریباً هر رابط کاربری چت را دور بزند. طبق اعلام رابین وینترز (Robin Winters) در راهنمای منتشر شده در ۲ اکتبر ۲۰۲۶، کاربران میتوانند با دستکاری نحوه پردازش وظایف خطی، مدلها را مجبور به پذیرش شخصیتهای ممنوعه کنند یا دستورالعملهای ایمنی را بهطور کامل نادیده بگیرند.
بیشتر اپلیکیشنهای چت رایج برای مسدود کردن محتوای ممنوعه، به فیلترهای ابتدایی کلمات کلیدی تکیه میکنند. این رویکرد باعث ایجاد یک حفره امنیتی میشود که در آن کاربر میتواند لایه ایمنی را مانند یک «ماز دادهای» ببیند و با استفاده از نحو ادبی، سیستم را به یک حلقه منطقی If-Then-Else بکشاند تا محدودیتها دور زده شوند. همانطور که در بحثهای گذشته ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، لایههای دفاعی سطحی هرگز جایگزین معماریهای ایمن نمیشوند. این چالشها در ابعاد گستردهتر نیز مشاهده شدهاند، بهطوری که ابزارهای جدیدی برای افشای نقاط ضعف عاملهای هوش مصنوعی در برابر تزریق پرامپت توسعه یافتهاند تا این آسیبپذیریها را به صورت سیستماتیک شناسایی کنند.
وینترز چهار مکانیزم اصلی برای دور زدن این قوانین را شرح میدهد:
- داستانسرایی (قاببندی): ایجاد یک محیط فرضی و شخصیتی خاص (مثلاً یک «هکر سطح جادوگر») برای ساختن یک ساختار منسجم، پیش از آنکه مدل دستور بگیرد این شخصیت را بهطور دائمی بپذیرد.
- تزریق JSON: قرار دادن دستورات در قالب JSON — شبیه به نوشتن یک یادداشت مخفی در لابلای یک فرم اداری — تا مدل «بین خطوط» بخواند و محتوای اضافی را نادیده بگیرد. این کار حتی با پنهان کردن کدها در تصاویر با رنگهای نزدیک (مثل #F8FAFC و #F9FAFB) که برای مدلهای چندوجهی (Multimodal) — مدلهایی که مثل انسان هم متن و هم عکس را میفهمند — قابل تشخیص است، ممکن است.
- حملات مترادف: جایگزینی کلمات ممنوعه با مترادفهایt obscure (مثلاً جایگزینی «پرخاشگر» با «ستیزهجو») برای فریب دادن فیلترهای ساده.
- تزریق چندزبانه: تغییر کلمات کلیدی یا جملات به زبانهای کمکاربرد برای گیج کردن سیستم فیلترینگ.

به نقل از این گزارش، کاربران ChatGPT میتوانند عبارت «Avoid rhetorical reframing» را به بخش Customize اضافه کنند تا مدل از جملات تکراری «این فقط X نیست، بلکه Y است» دست بردارد.
از منظر امنیتی، این آسیبپذیریها ثابت میکنند که ایمنی مبتنی بر کلمات کلیدی، سدی ناکارآمد است. به باور وینترز، راهکار واقعی برای توسعهدهندگان در حافظه پاداش/کش پرامپت (Prompt Caching) نهفته است که میتواند مانند یک گلوله نقرهای در برابر مهندسی اجتماعی و تزریقهای نحوی عمل کند.
با بهبود قابلیتهای بینایی و چندزبانه در مدلها، سطح حمله گستردهتر میشود. توسعهدهندگان باید از لیستهای سیاه ساده فاصله بگیرند و به سمت دفاعهای معماری مستحکمتر حرکت کنند.
گام بعدی شما
- فیلترهای پرامپت خود را برای شناسایی آسیبپذیری در برابر مترادفها بازرسی کنید.
- پیادهسازی Prompt Caching را برای تثبیت رفتار مدل بررسی کنید.
- از متدهای Red Teaming برای تست لایههای حفاظتی استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو