پرش به محتوای اصلی
پرش به محتوای مقاله

الگوی پیاده‌سازی AWS: حذف خودکار PII برای ارتقای امنیت داده‌ها در LLM

·۲۶ تیر ۱۴۰۵۴ دقیقه مطالعه
راهنما
ساخت خط لوله حذف اطلاعات هویتی با AWS Comprehend و EdgeChains
ساخت خط لوله حذف اطلاعات هویتی با AWS Comprehend و EdgeChains
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر رویکرد از پاک‌سازی با Regex به استفاده از یک لایه Endpoint مستقل در EdgeChains که نظارت لحظه‌ای (Observability) را از طریق TracePilot به فرآیند حذف داده‌های حساس اضافه می‌کند.

اگر امروز داده‌های مشتریان خود را مستقیماً به یک مدل هوش مصنوعی می‌فرستید، احتمالاً در حال پذیرش یک ریسک امنیتی عظیم هستید. باید بدانید که یک خطای کوچک در پرامپت می‌تواند شماره تأمین اجتماعی یا ایمیل‌های حساس را برای همیشه وارد حافظه مدل کند. این معماری جدید با حذف نام‌ها، ایمیل‌ها و شماره‌های شناسایی پیش از رسیدن به مدل، نگرانی‌های اصلی امنیتی در استقرار هوش مصنوعی سازمانی را برطرف می‌کند.

حریم خصوصی داده‌ها اکنون به اصلی‌ترین گلوگاه برای گسترش عامل‌های هوش مصنوعی در محیط‌های شرکتی تبدیل شده است. بسیاری از توسعه‌دهندگان به الگوهای ساده (Regex) تکیه می‌کنند، اما این روش‌ها در برابر فرمت‌های متنوع داده‌های حساس یا موجودیت‌های پیچیده شکست می‌خورند. برای حل این مشکل، می‌توان یک «دیوار آتش امنیتی» در لحظه ایجاد کرد که بین کاربر و مدل قرار می‌گیرد؛ شبیه به یک بازرس سخت‌گیر که پیش از ورود نامه‌ها به دفتر مدیر، تمام اطلاعات محرمانه را سیاه می‌کند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، جداسازی لایه پردازش داده از لایه استنتاج، تنها راه دستیابی به امنیت واقعی است. بر اساس راهنمای فنی منتشر شده در ۱۷ ژوئیه ۲۰۲۶ در وب‌سایت dev.to، این سامانه بر پایه یک معماری زنجیره‌ای بنا شده است. سازوکار اصلی آن کلاس ComprehendPIIRedactor است که دستور DetectPiiEntitiesCommand از AWS SDK v3 را در بر می‌گیرد. این ابزار اجازه می‌دهد تا موجودیت‌های خاصی مانند NAME (نام)، EMAIL (ایمیل)، PHONE (تلفن) و SSN (شماره تأمین اجتماعی) شناسایی شده و با یک نویسه ماسک مانند '█' جایگزین شوند.

زمینه و آماده‌سازی

برای ساخت این خط لوله، توسعه‌دهندگان به Node.js نسخه ۱۸ به بالا و یک حساب AWS با دسترسی فعال به سرویس Comprehend نیاز دارند. محیط عملیاتی شامل نصب بسته‌های @aws-sdk/client-comprehend و EdgeChains در کنار openai و dotenv برای مدیریت کلیدهای API است. این ابزارها زیرساخت لازم برای اتصال سرویس‌های شناسایی داده به مدل‌های زبانی را فراهم می‌کنند.

تنظیمات از طریق فایل‌های .env مدیریت می‌شوند که شامل شناسه‌های دسترسی یعنی AWS_ACCESS_KEY_ID و AWS_SECRET_ACCESS_KEY در کنار منطقه (Region) — که معمولاً us-east-1 است — و همچنین کلید API شرکت OpenAI یعنی OPENAI_API_KEY می‌شود. این ساختار تضمین می‌کند که اعتبارنامه‌ها امن بمانند و خط لوله در مناطق مختلف AWS به‌راحتی قابل جابجایی و انتقال باشد.

پیاده‌سازی فنی

  • پشته اصلی: Node.js ۱۸+، EdgeChains JS SDK و AWS SDK v3.
  • کلاس پاک‌ساز: کلاس ComprehendPIIRedactor از کلاس Endpoint در EdgeChains ارث‌بری می‌کند. این کلاس از یک نوع داده به نام RedactConfig برای تعریف entityTypes اختیاری و یک maskChar قابل شخصی‌سازی استفاده می‌کند که مقدار پیش‌فرض آن '*' است.
  • مکانیزم تشخیص: متد detectPII دستور DetectPiiEntitiesCommand را به AWS Comprehend می‌فرستد در حالی که LanguageCode روی مقدار "en" (انگلیسی) تنظیم شده است. این متد در نهایت آرایه‌ای از اشیای Entity شامل داده‌های حساس شناسایی شده را باز می‌گرداند.
  • منطق ماسک‌گذاری: متد redactPII موجودیت‌ها را بر اساس موقعیت شروع (BeginOffset) به‌صورت معکوس مرتب می‌کند. این منطق خاص برای جلوگیری از جابجایی شاخص‌ها (Index Shifting) به کار می‌رود؛ به‌طوری که وقتی متنی با ماسک جایگزین می‌شود، موقعیت‌های باقی‌مانده برای سایر موجودیت‌ها دقیق باقی بماند.
  • یکپارچه‌سازی: این پاک‌ساز به‌عنوان یک Endpoint در EdgeChains تعریف شده است؛ بنابراین می‌توان آن را به‌راحتی به سرویس‌های دیگر، مانند یک نقطه انتهایی OpenAI که از مدل gpt-4o-mini استفاده می‌کند، متصل کرد.

به‌عنوان مثال، یک پرامپت خام حاوی نام، ایمیل و شماره تأمین اجتماعی (مثلاً: "John Smith... [email protected]... 123-45-6789") پیش از ارسال به OpenAIEndpoint توسط پاک‌ساز پردازش می‌شود. این فرآیند تضمین می‌کند که مدل زبانی بزرگ (LLM) — شبیه کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — فقط نسخه بی‌نام‌سازی شده و پاک‌سازی شده‌ی درخواست را دریافت کند.

نظارت و عیب‌یابی

برای اطمینان از اینکه این پاک‌سازی‌ها دقیقاً طبق برنامه کار می‌کنند، خط لوله با TracePilot یکپارچه شده است. با نصب tracepilot-sdk توسعه‌دهندگان می‌توانند یک پاک‌ساز استاندارد را به یک ObservableRedactor تبدیل کنند تا هر اتفاقی در لایه امنیتی قابل رصد باشد.

به کمک متد tp.wrapToolCall می‌توان دقیقاً رصد کرد که کدام موجودیت‌های PII شناسایی شده‌اند و این تغییر در پرامپت چه تأثیری بر پاسخ نهایی مدل داشته است. این روش، این گام را به‌عنوان یک عملیات «تخریبی» (Destructive) علامت می‌زند تا مشخص شود داده‌ها تغییر یافته‌اند. به طور مشابه، tp.wrapOpenAI اجازه می‌دهد تا سیستم دقیقاً همان پرامپتی را که به مدل ارسال شده و همچنین خروجی حاصل از آن را ثبت کند.

این سطح از نظارت، ماهیت «جعبه سیاه» عامل‌های هوش مصنوعی را از بین می‌برد و سندی شفاف از اجرای pii-redaction-pipeline ارائه می‌دهد. برای یک توسعه‌دهنده، این یعنی تفاوت بین «امیدوار بودن به اینکه مدل داده‌ها را نادیده بگیرد» و «اطمینان از اینکه داده‌ها هرگز به مدل نرسیده‌اند».

انتقال منطق پاک‌سازی به یک نقطه انتهایی زنجیره‌ای، حجم زیادی از کدهای تکراری (Boilerplate) را حذف کرده و سیاست‌های امنیتی را به‌جای پراکندگی در قالب‌های مختلف پرامپت، در یک کلاس متمرکز می‌کند.

این چرخش، صنعت را به معماری‌های «اعتماد صفر» (Zero Trust) نزدیک‌تر می‌کند. وقتی با LLM به‌عنوان موجودیتی غیرقابل‌اعتماد در مواجهه با داده‌های حساس برخورد شود، مسئولیت ایمنی از تراز داخلی مدل به یک لایه بیرونی قابل‌اثبات و نظارت‌پذیر منتقل می‌شود.

گام بعدی شما

  • بسته‌های edgechains و @aws-sdk/client-comprehend را نصب کنید تا اولین زنجیره امن خود را بسازید.
  • برای رصد تغییرات تخریبی داده‌ها، SDK مربوط به TracePilot را به خط لوله خود اضافه نمایید.
  • لیست موجودیت‌های هدف در RedactConfig را بر اساس استانداردهای حریم خصوصی سازمان خود شخصی‌سازی کنید.

اما چالش اصلی، مدیریت هزینه این لایه‌های امنیتی است؛ در تحلیل ما درباره هزینه استنتاج و بهینه‌سازی توکن‌ها، ابعادی از این موضوع را بررسی کرده‌ایم.

چرا این موضوع مهم است؟

این معماری با تکیه بر اعتبار AWS Comprehend، ریسک نشت داده‌های سازمانی را به حداقل می‌رساند. این تغییر باعث می‌شود شرکت‌های بزرگ بدون ترس از نقض قوانین GDPR، عامل‌های هوش مصنوعی را در مقیاس واقعی مستقر کنند.

تأثیر برای ایران

به دلیل محدودیت‌های دسترسی به AWS و OpenAI، پیاده‌سازی این الگو برای توسعه‌دهندگان ایرانی نیازمند ابزارهای تغییر آی‌پی یا سرورهای واسط است، اما منطق «حفاظ بیرونی» برای مدل‌های محلی کاملاً کاربردی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «همراستاسازی» داخلی مدل با «حفاظ‌های» بیرونی، پذیرش این واقعیت است که مدل‌های زبانی هرگز برای حریم خصوصی طراحی نشده‌اند. این رویکرد زنجیره‌ای، امنیت را از یک ویژگی متکی به شانس به یک فرآیند مهندسی قابل‌سنج تبدیل می‌کند. در واقع، ما شاهد تولد «پروکسی‌های امنیتی» برای هوش مصنوعی هستیم که نقش کنترل کیفیت داده را پیش از استنتاج ایفا می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.