پرش به محتوای اصلی
پرش به محتوای مقاله

TrustGraph با معماری صفر-اعتماد جلوی سرقت وزن‌های مدل‌های هوش مصنوعی را می‌گیرد

·۴ مهر ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
راهنما
عامل هوشمند در حال محافظت از داده‌ها در برابر نشت اطلاعات، با سپری امنیتی و جریان داده‌های در حال انتقال.
عامل هوشمند در حال محافظت از داده‌ها در برابر نشت اطلاعات، با سپری امنیتی و جریان داده‌های در حال انتقال.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

جایگزینی مدل‌های فیلترینگ متنی با مدل‌های گراف‌محور برای کنترل دسترسی؛ در این روش، امنیت بر اساس مسیرهای فیزیکی داده‌ها تعریف می‌شود، نه محتوای پرامپت.

تصور کنید یک پرامپت مخرب، یک عامل هوشمند را فریب دهد تا تمام اسرار سیستمی یا کلیدهای دسترسی تولید را به یک سرور خارجی ارسال کند. برای مقابله با این تهدید، در ۲۵ سپتامبر ۲۰۲۶، راهنمای فنی منتشرشده در dev.to جزئیات پیاده‌سازی پروژه متن‌باز TrustGraph را برای متوقف کردن این مسیرهای نشت داده افشا کرد. این رویکرد در واقع تکامل یافته‌ی مکانیزم‌هایی است که TrustGraph برای متوقف کردن نشت داده‌ها از طریق تفکیک حوزه‌های اعتماد به کار می‌گیرد.

همان‌طور که در تحلیل قبلی ما درباره‌ی گواهینامه‌های امنیتی شرکت Sierra برای مشتریان Fortune 50 اشاره کردیم، صنعت اکنون از فیلترهای ساده‌ی متنی به سمت دفاع زیرساختی عمیق حرکت می‌کند. یک عامل (Agent) — شبیه کارمندی است که کارت تردد دارد؛ اما در حال حاضر بسیاری از این عامل‌ها کلید استادی دارند که تمام درهای ساختمان، حتی اتاق سرورهای حاوی وزن‌ها (Weights) را باز می‌کند.

ضرورت مدل صفر-اعتماد

عامل‌های هوش مصنوعی در چندین مرز امنیتی بحرانی فعالیت می‌کنند: مدل، چارچوب ارکستراسیون، حافظه، ابزارهای خارجی و APIها. طبق گزارش dev.to، چون این عامل‌ها می‌توانند با سرعت ماشین ابزارها را فراخوانی کرده و به داده‌های حساس دسترسی پیدا کنند، مسیرهای جدیدی برای سرقت دارایی‌های مدل یا اعتبارنامه‌ها ایجاد می‌شود.

یک امنیت مؤثر باید با هر پرامپت، فراخوانی ابزار و انتقال داده به عنوان یک اقدام بالقوه خصمانه برخورد کند. این موضوع به‌ویژه در محیط‌های پژوهشی امنیتی که توسط HONEYPOTZ INC پشتیبانی می‌شوند و یا در اپلیکیشن‌های حساس به حریم خصوصی مانند DeepBody حیاتی است. در این محیط‌ها، پرامپت‌ها هرگز نباید به عنوان مجوز دسترسی عمل کنند. در عوض، هویت، سیاست‌های امنیتی و سطح حساسیت داده‌ها باید تعیین کنند که آیا یک اقدام مجاز است یا خیر.

مخاطرات استخراج مدل

استخراج مدل یا Model Exfiltration یعنی بیرون کشیدن غیرقانونی وزن‌ها، جزئیات معماری، پرامپت‌های سیستمی یا رفتارهای مدل. این اتفاق می‌تواند از طریق دسترسی مستقیم یا پرس‌وجوهای مکرر در مرحله‌ی استنتاج (Inference) — یعنی همان لحظه‌ای که مدل جواب تولید می‌کند، شبیه آشپزی واقعی نه یادگیری دستور پخت — رخ دهد. مسیرهای رایج حمله عبارت‌اند از:

  • خواندن فایل‌های مدل از ذخیره‌سازهای شیء (Object Store) که دسترسی‌های بیش از حد دارند.
  • استخراج پرامپت‌های سیستمی از طریق تزریق پرامپت (Prompt Injection).
  • بازسازی رفتار مدل با استفاده از پرس‌وجوهای تطبیقی در حجم بالا.
  • شکار اعتبارنامه‌ها از متغیرهای محیطی، حافظه یا لاگ‌ها.
  • ارسال زمینه‌های حساس به نقاط انتهایی (Endpoints) تأییدنشده.

پروژه TrustGraph برای حل این مشکل، عامل‌ها، کاربران، مدل‌ها، ابزارها، اسرار، مجموعه‌داده‌ها و نقاط انتهایی را به عنوان گره‌هایی در یک گراف نمایش می‌دهد. در این ساختار، روابط دسترسی یا وابستگی به شکل یال‌های گراف در می‌آیند. این کار به تیم‌های امنیتی اجازه می‌دهد مسیرهای ممنوعه را بصری‌سازی و مسدود کنند؛ مثلاً مسیری که از یک سند نامعتبر مستقیماً به یک راز تولیدی و سپس به یک API خارجی می‌رسد.

کنترل‌های دفاعی لایه‌ای

بر اساس مستندات dev.to، یک پشته‌ی دفاعی کاربردی باید شامل موارد زیر باشد:

  • حفاظت از دارایی‌ها: رمزنگاری فایل‌های وزن، جداسازی ذخیره‌ساز، تأیید هش‌های امضا شده‌ی مدل و محدود کردن دانلودها به محیط‌های کاری تأییدشده (Attested Workloads).
  • محدودیت استنتاج: الزام به نشست‌های احراز هویت‌شده، اعمال سهمیه‌های (Quotas) هر هویت و حذف توزیع احتمالات خام از خروجی‌ها.
  • خروجی شبکه: اجرای سیاست «پیش‌فرض ممنوع» (Deny-by-default) تا عامل‌ها فقط به مقاصد تأییدشده دسترسی داشته باشند.
  • اعتبارسنجی ابزار: بررسی پارامترها با طرح‌واره‌های (Schemas) سخت‌گیرانه برای مسدود کردن داده‌های حجیم، مسیرهای فایل غیرمجاز یا اسرار کدگذاری‌شده.
  • پایش رفتاری: شناسایی تغییرات سیستماتیک در پرامپت‌ها، حجم غیرعادی توکن‌ها (Tokens) — تکه‌های کوچکی از متن که مدل تکه‌تکه می‌خورد — و تلاش‌های مکرر برای تست مرزهای امنیتی.

مدافعان همچنین می‌توانند «رشته‌های قناری» (Canary Strings) را در پرامپت‌های محافظت‌شده یا دارایی‌های تست قرار دهند. اگر این محتوا در ترافیک خروجی یا خروجی مدل ظاهر شود، بلافاصله هشدار صادر می‌شود.

یک آسیب‌پذیری بحرانی دیگر در مرز «متادیتای ابزار» نهفته است. همان‌طور که AI Tech Connect اشاره کرده است، مهاجمان می‌توانند از کاتالوگ ابزارها — یعنی نام‌ها و توصیفاتی که مدل می‌خواند — برای دستکاری رفتار عامل، حتی پیش از فراخوانی هر تابعی، استفاده کنند.

مدیریت کلیدهای API

برای مدیریت اعتبارنامه‌ها، توصیه می‌شود کلیدهای API طولانی‌مدت — که هرگز نباید در کد منبع، پرامپت‌ها یا حافظه عامل قرار گیرند — با یک «کارگزار اعتبارنامه» (Credential Broker) جایگزین شوند. این کارگزار، هویت تأییدشده را با توکن‌های کوتاه‌مدت و با دامنه دسترسی محدود مبادله می‌کند.

هر توکن به موارد زیر متصل است:

  • یک عامل و ابزار خاص
  • یک عملیات تأییدشده
  • یک سرویس مقصد
  • یک بازه زمانی انقضای کوتاه
  • یک شناسه درخواست قابل ردیابی

برای ارتقای امنیت، تیم‌ها باید اعتبارنامه‌ها را پیش از ذخیره در ردها (Traces) پاک‌سازی (Redact) کنند و از فیلترهای لاگ برای شناسایی فرمت‌های رایج توکن‌ها استفاده کنند. تنها چرخش کلیدها (Rotation) کافی نیست، اگر عامل بتواند به طور مداوم یک اعتبارنامه جایگزین قدرتمند را بازیابی کند.

این چرخش، فرض بنیادی هوش مصنوعی عامل‌محور را تغییر می‌دهد: پرامپت‌ها دیگر مجوز دسترسی نیستند. اکنون هویت و حساسیت داده‌ها تعیین می‌کنند چه اتفاقی بیفتد و بار امنیتی از «اراده» مدل زبانی به معماری سیستم منتقل می‌شود.

برای توسعه‌دهندگان، اولین قدم در محیط عملیاتی دیگر اصلاح پرامپت نیست، بلکه ترسیم تمام مسیرهای بین عامل و نقاط انتهایی است. حذف دسترسی‌های غیرضروری اکنون معیار اصلی عملکرد امنیتی است.

گام بعدی شما

  • مخزن TrustGraph را بررسی کنید تا مرزهای اعتماد عامل‌های خود را ترسیم کنید و سیاست‌های خروجی را پیاده کنید.
  • سیاست‌های خروجی شبکه (Egress Policies) را بر اساس مدل «پیش‌فرض ممنوع» بازنگری کنید.
  • کلیدهای API ثابت را با توکن‌های کوتاه‌مدت و متصل به هویت جایگزین کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تغییر رویکرد بر اساس تخصص در معماری Zero Trust، ریسک سرقت مدل‌های تجاری را به‌شدت کاهش می‌دهد. اعتبار این متدولوژی از جایگزینی اعتماد به مدل با اعتماد به زیرساخت سخت‌گیرانه می‌آید.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از مدل‌های متن‌باز روی سرورهای شخصی استفاده می‌کنند، پیاده‌سازی TrustGraph راهکاری رایگان و قدرتمند برای جلوگیری از نشت داده‌های حساس است.

·نگاه ما
تحریریه دات‌هوش

انتقال تمرکز از «مهندسی پرامپت» به «مهندسی زیرساخت» نشان می‌دهد که صنعت بالاخره پذیرفته است مدل‌های زبانی هرگز به‌طور کامل در برابر تزریق پرامپت مقاوم نمی‌شوند. در واقع، TrustGraph پذیرش این واقعیت است که مدل باید «ناپذیرا» باشد، نه «مطیع». این رویکرد، امنیت را از یک لایه نرم‌افزاری به یک لایه توپولوژیک تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.