پرش به محتوای اصلی
پرش به محتوای مقاله

PII GUI نشت داده‌ها در پاک‌سازی اسناد را با مدل‌های محلی متوقف کرد

·۲۸ خرداد ۱۴۰۵۴ دقیقه مطالعه
رابط کاربری گرافیکی برای شناسایی اطلاعات هویتی شخصی در گیت‌هاب
رابط کاربری گرافیکی برای شناسایی اطلاعات هویتی شخصی در گیت‌هاب
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ترکیب مدل‌های کوانتیده ONNX با یک رابط کاربری دسکتاپ برای حذف دائمی (Burn-in) اطلاعات حساس در PDFها، بدون ارسال حتی یک بایت داده به سرور.

اگر با اسناد حساس سر و کار دارید، اکنون می‌توانید تمام اطلاعات شناسایی شخصی (PII) را بدون ارسال حتی یک بایت داده به فضای ابری پاک کنید. PII GUI، یک اپلیکیشن دسکتاپی با رویکرد «اول محلی» (Local-first) که در ۱۸ ژوئن ۲۰۲۶ منتشر شد، به کاربران اجازه می‌دهد نام‌ها، ایمیل‌ها و شناسه‌های حساس را کاملاً روی سخت‌افزار خود شناسایی و حذف کنند.

بیشتر ابزارهای پاک‌سازی داده به APIهای ابری متکی هستند که برای اسناد حقوقی یا پزشکی، ریسک امنیتی بزرگی ایجاد می‌کند. PII GUI این مشکل را با اجرای استنتاج (Inference) — که مثل لحظهٔ آشپزی واقعی است، نه دوره‌ی آموزش آشپز — به‌صورت محلی حل می‌کند تا داده‌ها هرگز سیستم شما را ترک نکند. این برنامه بر بستر Tauri 2 ساخته شده و ترکیبی از رابط کاربری React 19 و TypeScript با یک بک‌اند قدرتمند از زبان Rust است تا پردازش‌های سنگین را بدون کند کردن سیستم انجام دهد.

زمینه فنی

این برنامه برای محیط‌های با امنیت بالا طراحی شده که حاکمیت داده در آن‌ها اولویت اول است. تنها دسترسی شبکه مورد نیاز این برنامه، یک دانلود یک‌باره و اختیاری از مدل‌های ONNX از Hugging Face است. پس از دانلود، این مدل‌ها در پوشه داده‌های برنامه ذخیره می‌شوند و می‌توان آن‌ها را در هر زمان از طریق بخش تنظیمات (Settings) حذف کرد.

برای تضمین پایداری و عملکرد بهینه، این پروژه به Node.js 24+، pnpm و زنجیره ابزار Rust/Cargo نیاز دارد. این نرم‌افزار برای سیستم‌های macOS، ویندوز و لینوکس در دسترس است. همچنین رابط کاربری (UI) برای پشتیبانی از کاربران انگلیسی، کره‌ای و ژاپنی بومی‌سازی شده است.

بر اساس مستندات گیت‌هاب این پروژه، ابزار مذکور از فایل‌های PDF، Markdown و متن ساده (plain-text) پشتیبانی می‌کند و از یک استراتژی شناسایی چندلایه برای یافتن داده‌های حساس استفاده می‌کند:

موتورهای شناسایی

  • Regex (داخلی): شناسایی فوری و پایه برای ایمیل‌ها، شماره تلفن‌ها، URLها، تاریخ‌ها، شماره حساب‌ها و اسرار (secrets).
  • OpenAI Privacy Filter: یک مدل کوانتایز شده (Quantized) — شبیه به فشرده‌سازی یک عکس با کیفیت بالا برای اشغال فضای کمتر — از نوع ONNX که برای اسناد طولانی انگلیسی و شناسایی گسترده طبقه‌بندی‌های حریم خصوصی بهینه شده است.
  • BardsAI EU PII: مدلی تخصصی برای متون با زبان‌های اروپایی که در آن شناسایی نام‌ها، آدرس‌ها و موجودیت‌های شبیه به شناسنامه اهمیت دارد.

این موتورها یافته‌ها را به یک طبقه‌بندی ثابت حریم خصوصی تبدیل می‌کنند و برچسب‌هایی مثل account_number (شماره حساب)، private_address (آدرس خصوصی)، private_email (ایمیل خصوصی)، private_person (شخص خصوصی)، private_phone (تلفن خصوصی)، private_url (لینک خصوصی)، private_date (تاریخ خصوصی) یا secret (رمز/سره) می‌زنند.

رابط کاربری گرافیکی برای شناسایی و حذف اطلاعات هویتی شخصی در داده‌های متنی

در مورد PDFها، برنامه از pdf.js برای تجزیه متن و حفظ موقعیت دقیق هر کاراکتر استفاده می‌کند تا کاربر دقیقاً ببیند یک تطبیق در کجای صفحه رندر شده رخ داده است. برخلاف جایگزینی‌های ساده متنی، این ابزار از pdf-lib برای ترسیم مستطیل‌های کدر (opaque) مستقیماً روی فایل PDF خروجی استفاده می‌کند. این کار تضمین می‌کند که متن‌های حذف‌شده از فایل نهایی قابل بازیابی نباشند، که یک نیاز حیاتی برای امنیت واقعی است.

جزئیات گردش کار

  • متن ← PII: شناسایی موجودیت‌های حساس و خروجی یک نسخه پاک‌سازی شده.
  • PII ← متن: بازگرداندن جایگاه‌نماهای (placeholders) بررسی شده به متن خواندنی برای جریان‌های کاری بازنگری محلی که قابلیت بازگشت دارند.
  • قوانین سفارشی: کاربران می‌توانند Regex یا فیلترهای تطبیق دقیق (exact-match) خود را به هر موتور شناسایی منتخب اضافه کنند.

رابط کاربری گرافیکی برای شناسایی و حذف اطلاعات هویتی شخصی در داده‌های متنی

کاربران می‌توانند هر تطبیق را در یک میزکار (workbench) پیش از خروجی نهایی بررسی کنند. شما می‌توانید شناسایی‌های تک‌تک را فعال یا غیرفعال کنید تا مطمئن شوید هوش مصنوعی به‌اشتباه یک نام غیرحساس یا یک آدرس تجاری عمومی را پاک نکرده است. همچنین جریان کاری «PII ← متن» برای بازگرداندن جایگاه‌نماها در طول یک فرآیند بازبینی بازگشت‌پذیر تعبیه شده است.

رابط کاربری گرافیکی برای شناسایی و حذف اطلاعات هویتی شخصی در داده‌های متنی

مکانیزم‌های داخلی

برای مدیریت اسناد حجیم، سیستم یک خط لوله (pipeline) مشخص را دنبال می‌کند: ورودی سند ← استخراج متن ← تکه‌بندی آگاه از صفحه با محدودیت توکن ← صف وظایف ← دستور redact_text در Rust ← استنتاج Regex/ONNX ← بازبینی ← خروجی.

پردازش‌ها در Rust با استفاده از کتابخانه‌های ort (ONNX Runtime) و tokenizers انجام می‌شود. ذخیره‌سازی داده‌ها نیز از طریق یک پایگاه داده محلی SQLite و فایل‌های نتیجه روی دیسک مدیریت می‌شود تا تب‌ها، قوانین سفارشی و نتایج فیلتر شما پس از ری‌استارت برنامه باقی بمانند.

این چرخش به سمت ابزارهای «اول محلی»، سد ورود به پردازش داده‌های با امنیت بالا را می‌شکند. PII GUI با بهره‌گیری از مدل‌های کوانتایز شده ثابت می‌کند که برای اجرای فیلترهای پیشرفته حریم خصوصی، نیاضی به کلاسترهای عظیم GPU نیست. برای یک متخصص، این یعنی دیگر لازم نیست بین کارایی هوش مصنوعی و حاکمیت داده‌ها یکی را انتخاب کند.

اگر توسعه‌دهنده یا مسئول حریم خصوصی هستید، می‌توانید این ابزار را از طریق صفحه Releases برای macOS، ویندوز یا لینوکس نصب کنید. همچنین می‌توانید منتظر ادغام‌های برنامه‌ریزی شده در نقشه راه با عامل‌های کدنویسی مثل Codex، Claude Code و Cursor باشید که می‌تواند پاک‌سازی PII را مستقیماً در محیط‌های توسعه خودکار کند. سایر اهداف نقشه راه شامل بهبود دسترسی‌پذیری (accessibility)، بازبینی‌های مبتنی بر کیبورد و گسترش تست‌های کیفیت (QA) برای اسناد چندزبانه است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر استانداردهای مدل‌های ONNX، اعتماد کاربران به ابزارهای AI محلی را افزایش می‌دهد. حذف ریسک نشت داده در سازمان‌های تحت نظارت قانونی (مثل GDPR)، پذیرش هوش مصنوعی را در بخش‌های حساس تسریع می‌کند.

تأثیر برای ایران

به دلیل محدودیت‌های دسترسی به APIهای ابری و حساسیت بالای داده‌های سازمانی در ایران، ابزارهای Local-first مانند PII GUI بهترین جایگزین برای توسعه‌دهندگان و مدیران داده داخلی هستند.

·نگاه ما
تحریریه دات‌هوش

انتقال پردازش PII به لبه (Edge) نشان می‌دهد که مدل‌های زبانی کوچک (SLM) اکنون به اندازه مدل‌های غول‌پیکر در کارهای تخصصی مثل شناسایی موجودیت‌ها دقیق هستند. این ابزار ثابت می‌کند که برای بسیاری از کاربردهای سازمانی، «دقت مطلق» اهمیت کمتری نسبت به «تضمین عدم خروج داده» دارد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.