دادن ابزاری به یک عامل هوش مصنوعی برای حل مسئله، اغلب باعث میشود او قوانین خانه را فراموش کند. پژوهشگران انویدیا (NVIDIA) در مقالهای که در ۷ اکتبر ۲۰۲۶ منتشر شد، دریافتند که مدلهای زبانی چندوجهی (Multimodal Language Models یا MLLMs) پس از تجهیز به ابزارهای عاملمحور، بهطور قابلتوجهی بیشتر احتمال دارد به درخواستهای مضر پاسخ دهند.
این یافته در حالی منتشر میشود که صنعت از چتباتهای غیرفعال به سمت عاملهای فعالی حرکت میکند که قادر به تعامل با پایگاههای داده، شبکهها و APIهای دنیای واقعی هستند. مدلهایی مانند ChatGPT، Gemini و Claude میتوانند موتور محرک این عاملها باشند؛ در واقع ابزارهایی که به مدل اجازه میدهند مستقیماً با جهان خارج تعامل کند. همانطور که در بحثهای گذشتهی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، تفاوت میان یک چتبات که پاسخ اشتباه میدهد با یک عامل که اختیار اجرای یک تصمیم مضر را دارد، تفاوت میان یک خطای قابلیت و یک ریسک امنیتی سیستمی است. این گذار، نیاز به «متا-فیلترهایی» را ایجاد میکند که قصد کاربر و سطح دسترسی ابزار را پیش از هر اقدامی کنترل کنند.
ماهیت ابزارهای عاملمحور
عاملها هنگام گشتوگذار در یک شبکه یا پایگاه داده، بهطور خودکار به تمام تواناییهای لازم مجهز نیستند. ابزارهای مورد نیاز برای مأموریتهای مختلف، بسته به دامنه و هدف عامل متفاوت است. برای مثال، آنها ممکن است برای تفسیر متن در عکسها به قابلیتهای نویسهخوانی نوری (OCR) نیاز داشته باشند.
حتی دستهبندیهایی از ابزارها وجود دارد که بهطور خاص برای دامنهٔ عامل و هدف مأموریت بهینه شدهاند. این ساختار ماژولار به عاملها اجازه میدهد تا قابلیتهای خود را بر اساس محیطی که در آن حرکت میکنند، مقیاسبندی کنند.
در تئوری، درخواستی که حفاظهای داخلی هوش مصنوعی را نقض میکند، هرگز نباید اجرا شود، فارغ از اینکه در مرحلهٔ اجرا از ابزاری استفاده شده یا خیر. اما در عمل، پژوهشهای جدید نشان میدهد که استفاده از ابزارها میتواند فیلترهای حفاظتی را که مانع از «تجاوزات» عامل هوش مصنوعی میشوند، بهشدت تضعیف کند.
شکاف ایمنی در استفاده از ابزار
مطالعه انویدیا با عنوان «شکست MLLMها در رد درخواستها هنگام استفاده عاملمحور از ابزارها»، یازده مدل بینایی-زبانی (VLM) از هفت خانوادهٔ مختلف را مورد آزمایش قرار داد. طبق اعلام پژوهشگران، فعال کردن ابزارها در تمامی مدلها و محکهای آزمایششده، بهطور مداوم نرخ شکست در رد درخواستهای مضر را افزایش داد.
در بدترین حالت، نرخ نسبی شکست در رد (RFR) در میان یازده مدل تا ۶۸.۷٪ افزایش یافت. این بدان معناست مدلهایی که در حالت چت مستقیم ایمن بودند، به محض ورود به گردشکار مبتنی بر ابزار، مستعد خطا شدند. نویسندگان مقاله بیان میکنند: «بهرغم موفقیتهای اخیر MLLMهای عاملمحور، این اثر یک شکست امنیتی بحرانی در پارادایم استفاده از ابزار را آشکار میکند.»

مدلهای زیر ذرهبین
این پژوهش هم مدلهای پیشرو تجاری و هم جایگزینهای وزنهای باز (Open Weights) را در بر گرفت. محققان برای شناسایی الگوهای تخریب ایمنی، بیش از ۱۰۰ هزار پاسخ را تحلیل کردند.
- مدلهای تجاری: GPT-5.4، Gemini 3.1 Pro Preview، Gemini 2.5 Pro، Claude Opus 4.7 و Claude Opus 4.6.
- مدلهای وزنباز: Qwen3-VL-235B-A22B-Instruct، Qwen3.5-122B-A10B، Kimi-K2.5، Kimi-K2.6، GLM-5V-Turbo و AdaReasoner-7B-B-Randomized (مدلی که بهطور خاص برای استفاده عاملمحور از ابزار تنظیم شده است).
آزمایشهای جداگانهای نیز روی Gemini 3 Flash Vision Agent انجام شد، زیرا استفاده خودمختار آن از ابزارها نیازمند ارزیابی مستقل بود. در حالی که GPT-5.4 مقاومترین مدل بود و نرخ خطای آن تنها از ۱۴.۶٪ به ۱۶.۸٪ رسید، سایر مدلها افت شدیدی داشتند. برای مثال، نرخ خطای GLM-5V-Turbo از ۳۸.۷٪ (در حالت بدون ابزار) به ۵۱.۳٪ جهش کرد.

چارچوب آزمایش
برای جداسازی اثر استفاده از ابزار از سبک پرامپتنویسی، محققان از پرامپتهای جفتشده استفاده کردند. به مدلهای VLM معمولی گفته شد تصویر را بررسی کرده و مستقیماً پاسخ دهند. نسخههای عاملمحور از فرمت ریاکت (ReAct) پیروی کردند که در آن استدلال و فراخوانی ابزار بهصورت متناوب رخ میدهد و مدل مکرراً تصمیم میگیرد که آیا پیش از تولید پاسخ نهایی، ابزاری را فراخوانی کند یا خیر.
این فرآیند تکرارشونده به مدل اجازه میدهد زمان فراخوانی ابزارهای خارجی را تعیین کند. با مقایسه این دو حالت، پژوهشگران توانستند دقیقاً تشخیص دهند که گردشکار استفاده از ابزار چگونه بر همراستاسازی (Alignment) ایمنی مدل اثر میگذارد.
قابلیتهای ابزاری
به عاملها چهار ابزار خاص برای دستکاری و تحلیل تصاویر داده شد:
- برچسبگذاری (Tagging): با استفاده از RAM++.
- زوم و برش (Zooming and Cropping): برای بازرسی بصری دقیق.
- نویسهخوانی نوری (OCR): با استفاده از GOT-OCR2.0.
- مفسر کد پایتون: محیطی ایزوله (Sandboxed) برای تحلیل تصویر.

محکها و ارزیابی
ایمنی با استفاده از سه محک ایمنی چندوجهی اندازهگیری شد: MM-SafetyBench، VLSBench و HoliSafe. این مجموعهها شامل جفتتصاویر و درخواستهای مضر کاربران هستند؛ مثلاً پرسش درباره نحوه انجام یک سرقت جیبی که در تصویر نمایش داده شده است.
برای قضاوت نتایج، تیم از GPT-5.2 بهعنوان مدل زبانی بهمثابه داور (LLM-as-a-judge) استفاده کرد. داور با دریافت تصویر اصلی، پرسش کاربر و پاسخ مدل، طبق دستورالعمل VLSBench، دستهبندی و استدلال خود را در قالب JSON برگرداند.
هر پاسخ در یکی از سه دسته قرار گرفت:
۱. ایمن با رد درخواست
۲. ایمن با هشدار (پاسخی که ریسکها را شناسایی کرد)
۳. ناایمن (پاسخی که ریسک را نادیده گرفت و درخواست مضر را اجرا کرد)
بهطور کلی، شکست در رد درخواستها در مقایسه با مدلهای بدون ابزار، ۱۷.۷٪ افزایش یافت. این الگو در هر سه محک مشاهده شد و نشان داد مشکل محدود به نوع خاصی از درخواستهای مضر نیست.
چرا ایمنی فرو میپاشد؟
انویدیا دو مکانیسم اصلی برای این تخریب ایمنی پیشنهاد میکند. نخست، رقیقشدن زمینه (Context Dilution) است. هرچه عامل فراخوانیهای متوالی بیشتری از ابزارها انجام میدهد، درخواست مضر اولیه در مقایسه با خروجیهای فنی انباشتهشده از ابزارها، کمرنگتر میشود.

پژوهشگران این موضوع را با آزمایش درخواستهایی که مدل در حالت بدون ابزار با موفقیت رد کرده بود، اثبات کردند. آنها دریافتند که نرخ شکست با افزایش تعداد فراخوانیهای ابزار بهطور تصاعدی بالا میرود؛ از نرخ نزدیک به صفر در حالت بدون ابزار تا نرخهای بهشدت بالاتر پس از سه یا بیشتر فراخوانی.
جالب اینجاست که یک راهکار احتمالی یافت شد: وقتی درخواست اصلی و تصویر، بلافاصله پس از آخرین فراخوانی ابزار و پیش از پاسخ نهایی مدل دوباره تزریق شدند، نرخ شکست در رد درخواستها در پنج مدل آزمایششده بهطور متوسط ۷.۶٪ کاهش یافت.

جابهجایی تمرکز ایمنی
مکانیسم دوم، جابهجایی تمرکز ایمنی (Safety Focus Displacement) است. در این سناریو، توجه مدل از «آیا این درخواست مضر است؟» به «ابزار چه چیزی پیدا کرد؟» تغییر میکند. مدل بهجای اولویت دادن به ایمنی، بر توصیف مشاهدات بهدستآمده از ابزار تمرکز میکند.

در بررسی مواردی که مدلها هم با ابزار و هم بدون آن موفق به رد درخواست شدند، دادهها تغییری در ساختار پاسخ نشان دادند:
- بدون ابزار: ۵۵.۶٪ پاسخها مستقیماً به درخواست پرداختند؛ ۲۵.۸٪ با یک بیانیه صریح ایمنی شروع شدند.
- با ابزار: تنها ۳۷.۴٪ مستقیماً به درخواست پرداختند و فقط ۱۰.۳٪ با بیانیه ایمنی شروع شدند. در مقابل، ۵۲.۳٪ پاسخها با توصیف یافتههای ابزار آغاز شدند.

برای مثال، Claude Opus 4.6 در حالت مستقیم، درخواست دور زدن امنیت سرویس بهداشتی را فوراً رد کرد. اما وقتی ابزارها در دسترس بودند، ابتدا روی تصویر زوم کرد، متن را خواند و محتویات را شناسایی کرد. پاسخ او با توصیف تابلوی سرویس بهداشتی شروع شد و رد درخواست تنها در پایان آمد. این نشان میدهد فرآیند استفاده از ابزار، ایمنی را از اولویت فوری خارج کرد.
پیامدهای فنی
این پژوهش این فرض را که همراستاسازی ایمنی از مدل پایه به محیط عاملمحور منتقل میشود، بهطور بنیادی تغییر میدهد. نویسندگان نتیجه میگیرند که استفاده از ابزار را نباید تنها بهعنوان مکانیزمی برای افزایش قابلیت استدلال بصری دید، بلکه باید آن را یک انتخاب طراحی مرتبط با ایمنی دانست که میتواند رفتار رد درخواست را تغییر دهد.
این یافتهها نشان میدهد «دستورات اصلی» مدلها شکننده هستند و میتوانند توسط همان قابلیتهایی که برای مفیدتر کردن مدل اضافه شدهاند، فرسوده شوند. برای توسعهدهندگان، این بدان معناست که ارزیابی مدل بر اساس محکهای ایمنی استاندارد کافی نیست، اگر قرار است آن مدل در نهایت بهعنوان یک عامل عمل کند. MLLMهای عاملمحور آینده باید در شرایط استفاده از ابزار ارزیابی و آموزش ببینند.
شکست در حفظ زمینه (Context) در زنجیرههای پیچیده رویدادها پس از یک پرامپت، یک نقطه ضعف جدی است. در حال حاضر، پاسخ سادهای برای این تمایل پنجرههای زمینه محدود وجود ندارد که باعث شود عامل قوانین خود را فراموش کرده و صرفاً از ابزاری که در دست دارد استفاده کند. برای مقابله با این ریسکهای نرمافزاری، انویدیا در لایههای پایینتر به دنبال راهکارهای سختافزاری است که میتوان آنها را در سیستمهای سنتری برای جلوگیری از فرار عاملها مشاهده کرد.
گام بعدی شما
- اگر از مدلهای VLM در عاملهای خود استفاده میکنید، درخواستهای حساس را بلافاصله پیش از تولید پاسخ نهایی (Final Response) دوباره به مدل یادآوری کنید.
- ارزیابیهای ایمنی خود را از حالت Static به حالت Agentic تغییر دهید و مدل را در حین فراخوانی ابزارها تست کنید.
- برای کاهش ریسک، سطح دسترسی ابزارها (Tool Authority) را بر اساس تحلیل قصد کاربر در لایهای مجزا از مدل کنترل کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو