تصور کنید یک پرامپت مخرب، یک عامل هوشمند را فریب دهد تا تمام اسرار سیستمی یا کلیدهای دسترسی تولید را به یک سرور خارجی ارسال کند. برای مقابله با این تهدید، در ۲۵ سپتامبر ۲۰۲۶، راهنمای فنی منتشرشده در dev.to جزئیات پیادهسازی پروژه متنباز TrustGraph را برای متوقف کردن این مسیرهای نشت داده افشا کرد. این رویکرد در واقع تکامل یافتهی مکانیزمهایی است که TrustGraph برای متوقف کردن نشت دادهها از طریق تفکیک حوزههای اعتماد به کار میگیرد.
همانطور که در تحلیل قبلی ما دربارهی گواهینامههای امنیتی شرکت Sierra برای مشتریان Fortune 50 اشاره کردیم، صنعت اکنون از فیلترهای سادهی متنی به سمت دفاع زیرساختی عمیق حرکت میکند. یک عامل (Agent) — شبیه کارمندی است که کارت تردد دارد؛ اما در حال حاضر بسیاری از این عاملها کلید استادی دارند که تمام درهای ساختمان، حتی اتاق سرورهای حاوی وزنها (Weights) را باز میکند.
ضرورت مدل صفر-اعتماد
عاملهای هوش مصنوعی در چندین مرز امنیتی بحرانی فعالیت میکنند: مدل، چارچوب ارکستراسیون، حافظه، ابزارهای خارجی و APIها. طبق گزارش dev.to، چون این عاملها میتوانند با سرعت ماشین ابزارها را فراخوانی کرده و به دادههای حساس دسترسی پیدا کنند، مسیرهای جدیدی برای سرقت داراییهای مدل یا اعتبارنامهها ایجاد میشود.
یک امنیت مؤثر باید با هر پرامپت، فراخوانی ابزار و انتقال داده به عنوان یک اقدام بالقوه خصمانه برخورد کند. این موضوع بهویژه در محیطهای پژوهشی امنیتی که توسط HONEYPOTZ INC پشتیبانی میشوند و یا در اپلیکیشنهای حساس به حریم خصوصی مانند DeepBody حیاتی است. در این محیطها، پرامپتها هرگز نباید به عنوان مجوز دسترسی عمل کنند. در عوض، هویت، سیاستهای امنیتی و سطح حساسیت دادهها باید تعیین کنند که آیا یک اقدام مجاز است یا خیر.
مخاطرات استخراج مدل
استخراج مدل یا Model Exfiltration یعنی بیرون کشیدن غیرقانونی وزنها، جزئیات معماری، پرامپتهای سیستمی یا رفتارهای مدل. این اتفاق میتواند از طریق دسترسی مستقیم یا پرسوجوهای مکرر در مرحلهی استنتاج (Inference) — یعنی همان لحظهای که مدل جواب تولید میکند، شبیه آشپزی واقعی نه یادگیری دستور پخت — رخ دهد. مسیرهای رایج حمله عبارتاند از:
- خواندن فایلهای مدل از ذخیرهسازهای شیء (Object Store) که دسترسیهای بیش از حد دارند.
- استخراج پرامپتهای سیستمی از طریق تزریق پرامپت (Prompt Injection).
- بازسازی رفتار مدل با استفاده از پرسوجوهای تطبیقی در حجم بالا.
- شکار اعتبارنامهها از متغیرهای محیطی، حافظه یا لاگها.
- ارسال زمینههای حساس به نقاط انتهایی (Endpoints) تأییدنشده.
پروژه TrustGraph برای حل این مشکل، عاملها، کاربران، مدلها، ابزارها، اسرار، مجموعهدادهها و نقاط انتهایی را به عنوان گرههایی در یک گراف نمایش میدهد. در این ساختار، روابط دسترسی یا وابستگی به شکل یالهای گراف در میآیند. این کار به تیمهای امنیتی اجازه میدهد مسیرهای ممنوعه را بصریسازی و مسدود کنند؛ مثلاً مسیری که از یک سند نامعتبر مستقیماً به یک راز تولیدی و سپس به یک API خارجی میرسد.
کنترلهای دفاعی لایهای
بر اساس مستندات dev.to، یک پشتهی دفاعی کاربردی باید شامل موارد زیر باشد:
- حفاظت از داراییها: رمزنگاری فایلهای وزن، جداسازی ذخیرهساز، تأیید هشهای امضا شدهی مدل و محدود کردن دانلودها به محیطهای کاری تأییدشده (Attested Workloads).
- محدودیت استنتاج: الزام به نشستهای احراز هویتشده، اعمال سهمیههای (Quotas) هر هویت و حذف توزیع احتمالات خام از خروجیها.
- خروجی شبکه: اجرای سیاست «پیشفرض ممنوع» (Deny-by-default) تا عاملها فقط به مقاصد تأییدشده دسترسی داشته باشند.
- اعتبارسنجی ابزار: بررسی پارامترها با طرحوارههای (Schemas) سختگیرانه برای مسدود کردن دادههای حجیم، مسیرهای فایل غیرمجاز یا اسرار کدگذاریشده.
- پایش رفتاری: شناسایی تغییرات سیستماتیک در پرامپتها، حجم غیرعادی توکنها (Tokens) — تکههای کوچکی از متن که مدل تکهتکه میخورد — و تلاشهای مکرر برای تست مرزهای امنیتی.
مدافعان همچنین میتوانند «رشتههای قناری» (Canary Strings) را در پرامپتهای محافظتشده یا داراییهای تست قرار دهند. اگر این محتوا در ترافیک خروجی یا خروجی مدل ظاهر شود، بلافاصله هشدار صادر میشود.
یک آسیبپذیری بحرانی دیگر در مرز «متادیتای ابزار» نهفته است. همانطور که AI Tech Connect اشاره کرده است، مهاجمان میتوانند از کاتالوگ ابزارها — یعنی نامها و توصیفاتی که مدل میخواند — برای دستکاری رفتار عامل، حتی پیش از فراخوانی هر تابعی، استفاده کنند.
مدیریت کلیدهای API
برای مدیریت اعتبارنامهها، توصیه میشود کلیدهای API طولانیمدت — که هرگز نباید در کد منبع، پرامپتها یا حافظه عامل قرار گیرند — با یک «کارگزار اعتبارنامه» (Credential Broker) جایگزین شوند. این کارگزار، هویت تأییدشده را با توکنهای کوتاهمدت و با دامنه دسترسی محدود مبادله میکند.
هر توکن به موارد زیر متصل است:
- یک عامل و ابزار خاص
- یک عملیات تأییدشده
- یک سرویس مقصد
- یک بازه زمانی انقضای کوتاه
- یک شناسه درخواست قابل ردیابی
برای ارتقای امنیت، تیمها باید اعتبارنامهها را پیش از ذخیره در ردها (Traces) پاکسازی (Redact) کنند و از فیلترهای لاگ برای شناسایی فرمتهای رایج توکنها استفاده کنند. تنها چرخش کلیدها (Rotation) کافی نیست، اگر عامل بتواند به طور مداوم یک اعتبارنامه جایگزین قدرتمند را بازیابی کند.
این چرخش، فرض بنیادی هوش مصنوعی عاملمحور را تغییر میدهد: پرامپتها دیگر مجوز دسترسی نیستند. اکنون هویت و حساسیت دادهها تعیین میکنند چه اتفاقی بیفتد و بار امنیتی از «اراده» مدل زبانی به معماری سیستم منتقل میشود.
برای توسعهدهندگان، اولین قدم در محیط عملیاتی دیگر اصلاح پرامپت نیست، بلکه ترسیم تمام مسیرهای بین عامل و نقاط انتهایی است. حذف دسترسیهای غیرضروری اکنون معیار اصلی عملکرد امنیتی است.
گام بعدی شما
- مخزن TrustGraph را بررسی کنید تا مرزهای اعتماد عاملهای خود را ترسیم کنید و سیاستهای خروجی را پیاده کنید.
- سیاستهای خروجی شبکه (Egress Policies) را بر اساس مدل «پیشفرض ممنوع» بازنگری کنید.
- کلیدهای API ثابت را با توکنهای کوتاهمدت و متصل به هویت جایگزین کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو