پرش به محتوای اصلی
پرش به محتوای مقاله

Privacy Gateway: حذف ۱۰۰ درصدی اطلاعات شخصی پیش از ارسال به مدل

·۲۶ مرداد ۱۴۰۵۳ دقیقه مطالعه۱ بازدید
درگاه حریم خصوصی هوش مصنوعی — اطلاعات هویتی را از پرسش‌ها پیش از ارسال حذف می‌کند
درگاه حریم خصوصی هوش مصنوعی — اطلاعات هویتی را از پرسش‌ها پیش از ارسال حذف می‌کند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد یک پروکسی HTTP شفاف و سبک که بدون نیاز به مدل‌های سنگین NLP یا دیتابیس‌های پیچیده، PII را در سطح شبکه محلی و با تأخیر زیر ۱ میلی‌ثانیه پاک‌سازی می‌کند.

اگر هر روز ایمیل‌های مشتریان یا کلیدهای API را در محیط‌های چت کپی می‌کنید، احتمالاً بخشی از اسرار تجاری شما همین حالا در سرورهای شرکت‌های ثالث ذخیره شده است. دستیاران هوش مصنوعی مانند ChatGPT و DeepSeek بهره‌وری عظیمی ایجاد می‌کنند، اما یک آسیب‌پذیری بحرانی به همراه دارند: داده‌های حساس مشتریان به محض اینکه یک پرامپت از مرزها عبور کند یا تکه‌ای از کد کپی شود، به سرورهای شخص ثالث نشت می‌کند. برای متوقف کردن این نشت داده‌ها، ابزاری به نام AI Privacy Gateway در ۱۷ اوت ۲۰۲۶ منتشر شد تا میان کیبورد شما و مدل‌های ابری، یک فیلتر امنیتی محلی ایجاد کند. این ابزار تنش امنیتی را با رهگیری تماس‌های API در سطح محلی و حذف اطلاعات شناسایی شخصی (PII) پیش از آنکه درخواست به ابر برسد، حل می‌کند.

بسیاری از توسعه‌دهندگان اکنون بین دو گزینه دشوار گیر کرده‌اند: یا باید هزینه‌ی گزاف طرح‌های سازمانی با قراردادهای سخت‌گیرانه‌ی حریم خصوصی را بپردازند، یا ریسک ارسال ایمیل‌ها و کلیدهای API به ابزارهایی مثل ChatGPT را بپذیرند. ابزارهای موجود مانند Presidio مایکروسافت، به دلیل نیاز به نصب PostgreSQL و مدل‌های سنگین NLP، برای یک راهکار سریع محلی بیش از حد پیچیده‌اند. از سوی دیگر، ابزارهایی مثل LLM Guard در واقع SDKهای پایتونی با وابستگی‌های Transformer هستند که نصب آن‌ها می‌تواند کند باشد، و PasteGuard نیز تنها به افزونه‌های مرورگر محدود است و ابزارهای API مانند Cursor یا Claude Code را پوشش نمی‌دهد. این چالش‌ها پیش از این در ابزارهایی نظیر PISIGuard که بر ماسک‌گذاری محلی داده‌ها تمرکز داشت مورد بررسی قرار گرفته بود تا لایه‌ای از امنیت را پیش از ارسال داده به سرورها فراهم کند.

تصور کنید یک صافی دیجیتال — شبیه به یک گیت امنیتی در ورودی ساختمان که مدارک شناسایی را چک می‌کند و موارد غیرمجاز را می‌گیرد — بین شما و هوش مصنوعی قرار بگیرد و بدون کاهش سرعت، اسرار شما را در لحظه شکار کند. به نقل از گزارش dev.to، این ابزار به عنوان یک پروکسی معکوس HTTP شفاف عمل می‌کند. شما می‌توانید آن را تنها با یک دستور داکر اجرا کنید:

docker run -d -p 9999:9999 ghcr.io/gunxueqiu6/ai-privacy-gateway:lite

و سپس آدرس پایه (Base URL) کلاینت هوش مصنوعی خود را به http://localhost:9999 تغییر دهید.

زمینه و معماری

همان‌طور که در بحث‌های گذشته‌ی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، انتقال لایه‌ی نظارت به سمت کاربر، تنها راه مقابله با سیاست‌های متغیر شرکت‌های بزرگ است. این گیت تمام درخواست‌ها به مسیر /v1/chat/completions را رهگیری کرده و بدنه JSON را برای یافتن اطلاعات شناسایی شخصی (PII) اسکن می‌کند. معماری سیستم از یک جریان ساده پیروی می‌کند: [کلاینت AI] $ \rightarrow $ [Privacy Gateway :9999] $ \rightarrow $ [AI API].

این ابزار بر پایه پایتون ۳.۱۱، FastAPI و یک گذرگاه حسابرسی (Audit Bus) مبتنی بر مدل pub/sub ساخته شده است. برای کسانی که به توان عملیاتی (Throughput) — یعنی مقدار داده‌ای که سیستم در هر ثانیه پردازش می‌کند — بالایی نیاز دارند، می‌توان این سرور تک‌پروسه‌ای پایتون را پشت یک Nginx مقیاس‌دهی کرد.

مشخصات فنی

بر اساس مستندات فنی، جزئیات عملکردی این ابزار به شرح زیر است:

  • تشخیص PII: شناسایی خودکار ۲۶ نوع موجودیت (در نسخه v2.0.3)، شامل شماره تلفن، ایمیل، کارت‌های شناسایی چین (۱۸ رقمی)، کارت‌های بانکی (با تایید Luhn) و بیش از ۲۰ فرمت کلید API (مانند OpenAI sk-، AWS AKIA، GitHub ghp_ و Stripe sk_live_). این ابزار همچنین کدهای اعتباری اجتماعی یکپارچه چین، پاسپورت‌ها، مجوزهای هنگ‌کنگ/ماکائو/تایوان، IPها، URLها، تاریخ‌ها، مبالغ، کدهای پستی، شماره پلاک، مختصات، MACها و نام افراد را از طریق NER اختیاری spaCy (مدل‌های zh_core_web_sm و en_core_web_sm) شناسایی می‌کند.
  • عملکرد: استفاده از الگوهای Regex Union کامپایل‌شده که تأخیر (Latency) — همان زمان انتظار برای دریافت پاسخ — را به کمتر از ۱ میلی‌ثانیه می‌رساند. استفاده از NER اختیاری برای موجودیت‌های مبهم، حدود ۲ تا ۵ میلی‌ثانیه به این زمان می‌افزاید.
  • پشتیبانی از استریم: استفاده از بافر پنجره‌لغزان برای مدیریت رویدادهای ارسالی سرور (SSE) تا داده‌های حساس حتی در مرز تکه‌های متنی (Chunks) نیز بدون تأخیر در بافرینگ شناسایی شوند.
  • امنیت: دارای یک خزانه رمزنگاری‌شده AES-256-GCM در SQLite برای بازسازی داده‌های ماسک‌شده در مسیر بازگشت، هرچند یک حالت بدون وضعیت (Stateless) نیز برای استفاده در دسترس است.

این گیت با هر API سازگار با OpenAI، از جمله Claude، DeepSeek، Cursor، Copilot و Open WebUI کار می‌کند. سیستم مقادیر حساس را با جایگزین‌های تایپ‌شده مثل [PHONE_abc123] جایگزین می‌کند تا هوش مصنوعی زاینده (Generative AI) — مثل نویسنده‌ای که با کلمات کلیدی راهنما می‌نویسد بدون اینکه نام واقعی افراد را بداند — بتواند بستر معنایی را حفظ کند بدون اینکه داده خام را ببیند.

این تغییر رویکرد، بار مسئولیت حریم خصوصی را از دوش ارائه‌دهنده AI به زیرساخت خود کاربر منتقل می‌کند. این ابزار تحت لایسنس PolyForm Shield منتشر شده، برای استفاده غیرتجاری رایگان است، کد آن در دسترس است و هیچ‌گونه تله‌متری (جمع‌آوری داده) ندارد.

با این حال، توسعه‌دهنده هشدار می‌دهد که ماسک‌گذاری مبتنی بر Regex یک راهکار مطلق نیست. این ابزار در مجموعه داده‌های آزمایشی خود به نرخ بازیابی (Recall) حدود ۹۵٪ برای انواع ساختاریافته دست یافته است، به این معنی که فرمت‌های غیرمتعارف ممکن است همچنان نشت کنند. همچنین نرخ بازیابی NER برای نام‌های چینی کامل نیست. برای داده‌های با ریسک بالا، حالت Redaction در دسترس است که ماسک‌گذاری را با تگ [REDACTED] غیرقابل‌بازگشت می‌کند.

گام بعدی شما

  • اگر روزانه با داده‌های تراکنشی یا ایمیل‌های کاربران سر و کار دارید، می‌توانید این ابزار را از طریق مخزن گیت‌هاب یا سایت دموی رسمی تست کنید.
  • تنظیمات Base URL را در ابزارهایی مثل Cursor تغییر دهید تا ترافیک از طریق پروکسی محلی عبور کند.
  • برای محیط‌های سازمانی، به‌روزرسانی‌های آینده در زمینه کنترل دسترسی مبتنی بر نقش (RBAC) و خروجی‌های حسابرسی برای میزبانی داخلی را دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف وابستگی به قراردادهای حریم خصوصی شرکت‌های بزرگ، کنترل داده‌ها را به دست توسعه‌دهنده برمی‌گرداند. اعتبار این روش از قابلیت بازرسی کد (Open Source) و اجرای محلی آن نشأت می‌گیرد.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که از ابزارهای Cursor یا Copilot استفاده می‌کنند، این ابزار راهکاری رایگان برای جلوگیری از نشت داده‌های حساس سازمانی به سرورهای خارجی است.

·نگاه ما
تحریریه دات‌هوش

انتقال مسئولیت حریم خصوصی از تامین‌کننده مدل به زیرساخت کاربر، یک چرخش راهبردی در معماری ابزارهای AI است. این رویکرد نشان می‌دهد که اعتماد به قراردادهای سازمانی (Enterprise Agreements) دیگر برای تیم‌های فنی کافی نیست و لایه‌ی «اعتماد صفر» (Zero Trust) باید در سطح شبکه محلی پیاده شود.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.