اگر هر روز ایمیلهای مشتریان یا کلیدهای API را در محیطهای چت کپی میکنید، احتمالاً بخشی از اسرار تجاری شما همین حالا در سرورهای شرکتهای ثالث ذخیره شده است. دستیاران هوش مصنوعی مانند ChatGPT و DeepSeek بهرهوری عظیمی ایجاد میکنند، اما یک آسیبپذیری بحرانی به همراه دارند: دادههای حساس مشتریان به محض اینکه یک پرامپت از مرزها عبور کند یا تکهای از کد کپی شود، به سرورهای شخص ثالث نشت میکند. برای متوقف کردن این نشت دادهها، ابزاری به نام AI Privacy Gateway در ۱۷ اوت ۲۰۲۶ منتشر شد تا میان کیبورد شما و مدلهای ابری، یک فیلتر امنیتی محلی ایجاد کند. این ابزار تنش امنیتی را با رهگیری تماسهای API در سطح محلی و حذف اطلاعات شناسایی شخصی (PII) پیش از آنکه درخواست به ابر برسد، حل میکند.
بسیاری از توسعهدهندگان اکنون بین دو گزینه دشوار گیر کردهاند: یا باید هزینهی گزاف طرحهای سازمانی با قراردادهای سختگیرانهی حریم خصوصی را بپردازند، یا ریسک ارسال ایمیلها و کلیدهای API به ابزارهایی مثل ChatGPT را بپذیرند. ابزارهای موجود مانند Presidio مایکروسافت، به دلیل نیاز به نصب PostgreSQL و مدلهای سنگین NLP، برای یک راهکار سریع محلی بیش از حد پیچیدهاند. از سوی دیگر، ابزارهایی مثل LLM Guard در واقع SDKهای پایتونی با وابستگیهای Transformer هستند که نصب آنها میتواند کند باشد، و PasteGuard نیز تنها به افزونههای مرورگر محدود است و ابزارهای API مانند Cursor یا Claude Code را پوشش نمیدهد. این چالشها پیش از این در ابزارهایی نظیر PISIGuard که بر ماسکگذاری محلی دادهها تمرکز داشت مورد بررسی قرار گرفته بود تا لایهای از امنیت را پیش از ارسال داده به سرورها فراهم کند.
تصور کنید یک صافی دیجیتال — شبیه به یک گیت امنیتی در ورودی ساختمان که مدارک شناسایی را چک میکند و موارد غیرمجاز را میگیرد — بین شما و هوش مصنوعی قرار بگیرد و بدون کاهش سرعت، اسرار شما را در لحظه شکار کند. به نقل از گزارش dev.to، این ابزار به عنوان یک پروکسی معکوس HTTP شفاف عمل میکند. شما میتوانید آن را تنها با یک دستور داکر اجرا کنید:
docker run -d -p 9999:9999 ghcr.io/gunxueqiu6/ai-privacy-gateway:lite
و سپس آدرس پایه (Base URL) کلاینت هوش مصنوعی خود را به http://localhost:9999 تغییر دهید.
زمینه و معماری
همانطور که در بحثهای گذشتهی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، انتقال لایهی نظارت به سمت کاربر، تنها راه مقابله با سیاستهای متغیر شرکتهای بزرگ است. این گیت تمام درخواستها به مسیر /v1/chat/completions را رهگیری کرده و بدنه JSON را برای یافتن اطلاعات شناسایی شخصی (PII) اسکن میکند. معماری سیستم از یک جریان ساده پیروی میکند: [کلاینت AI] $ \rightarrow $ [Privacy Gateway :9999] $ \rightarrow $ [AI API].
این ابزار بر پایه پایتون ۳.۱۱، FastAPI و یک گذرگاه حسابرسی (Audit Bus) مبتنی بر مدل pub/sub ساخته شده است. برای کسانی که به توان عملیاتی (Throughput) — یعنی مقدار دادهای که سیستم در هر ثانیه پردازش میکند — بالایی نیاز دارند، میتوان این سرور تکپروسهای پایتون را پشت یک Nginx مقیاسدهی کرد.
مشخصات فنی
بر اساس مستندات فنی، جزئیات عملکردی این ابزار به شرح زیر است:
- تشخیص PII: شناسایی خودکار ۲۶ نوع موجودیت (در نسخه v2.0.3)، شامل شماره تلفن، ایمیل، کارتهای شناسایی چین (۱۸ رقمی)، کارتهای بانکی (با تایید Luhn) و بیش از ۲۰ فرمت کلید API (مانند OpenAI sk-، AWS AKIA، GitHub ghp_ و Stripe sk_live_). این ابزار همچنین کدهای اعتباری اجتماعی یکپارچه چین، پاسپورتها، مجوزهای هنگکنگ/ماکائو/تایوان، IPها، URLها، تاریخها، مبالغ، کدهای پستی، شماره پلاک، مختصات، MACها و نام افراد را از طریق NER اختیاری spaCy (مدلهای zh_core_web_sm و en_core_web_sm) شناسایی میکند.
- عملکرد: استفاده از الگوهای Regex Union کامپایلشده که تأخیر (Latency) — همان زمان انتظار برای دریافت پاسخ — را به کمتر از ۱ میلیثانیه میرساند. استفاده از NER اختیاری برای موجودیتهای مبهم، حدود ۲ تا ۵ میلیثانیه به این زمان میافزاید.
- پشتیبانی از استریم: استفاده از بافر پنجرهلغزان برای مدیریت رویدادهای ارسالی سرور (SSE) تا دادههای حساس حتی در مرز تکههای متنی (Chunks) نیز بدون تأخیر در بافرینگ شناسایی شوند.
- امنیت: دارای یک خزانه رمزنگاریشده AES-256-GCM در SQLite برای بازسازی دادههای ماسکشده در مسیر بازگشت، هرچند یک حالت بدون وضعیت (Stateless) نیز برای استفاده در دسترس است.
این گیت با هر API سازگار با OpenAI، از جمله Claude، DeepSeek، Cursor، Copilot و Open WebUI کار میکند. سیستم مقادیر حساس را با جایگزینهای تایپشده مثل [PHONE_abc123] جایگزین میکند تا هوش مصنوعی زاینده (Generative AI) — مثل نویسندهای که با کلمات کلیدی راهنما مینویسد بدون اینکه نام واقعی افراد را بداند — بتواند بستر معنایی را حفظ کند بدون اینکه داده خام را ببیند.
این تغییر رویکرد، بار مسئولیت حریم خصوصی را از دوش ارائهدهنده AI به زیرساخت خود کاربر منتقل میکند. این ابزار تحت لایسنس PolyForm Shield منتشر شده، برای استفاده غیرتجاری رایگان است، کد آن در دسترس است و هیچگونه تلهمتری (جمعآوری داده) ندارد.
با این حال، توسعهدهنده هشدار میدهد که ماسکگذاری مبتنی بر Regex یک راهکار مطلق نیست. این ابزار در مجموعه دادههای آزمایشی خود به نرخ بازیابی (Recall) حدود ۹۵٪ برای انواع ساختاریافته دست یافته است، به این معنی که فرمتهای غیرمتعارف ممکن است همچنان نشت کنند. همچنین نرخ بازیابی NER برای نامهای چینی کامل نیست. برای دادههای با ریسک بالا، حالت Redaction در دسترس است که ماسکگذاری را با تگ [REDACTED] غیرقابلبازگشت میکند.
گام بعدی شما
- اگر روزانه با دادههای تراکنشی یا ایمیلهای کاربران سر و کار دارید، میتوانید این ابزار را از طریق مخزن گیتهاب یا سایت دموی رسمی تست کنید.
- تنظیمات Base URL را در ابزارهایی مثل Cursor تغییر دهید تا ترافیک از طریق پروکسی محلی عبور کند.
- برای محیطهای سازمانی، بهروزرسانیهای آینده در زمینه کنترل دسترسی مبتنی بر نقش (RBAC) و خروجیهای حسابرسی برای میزبانی داخلی را دنبال کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو