پرش به محتوای اصلی
پرش به محتوای مقاله

IBM با ماسک کردن شناسه‌های مالیاتی برزیل استانداردهای LGPD را در AI پیاده کرد

·۱۶ مهر ۱۴۰۵۴ دقیقه مطالعه
ماسک‌سازی شماره‌های CPF و CNPJ در حفاظت از اطلاعات هویتی
ماسک‌سازی شماره‌های CPF و CNPJ در حفاظت از اطلاعات هویتی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ادغام مستقیم شناسه‌های مالیاتی خاص برزیل (CPF/CNPJ) در لایه‌ی حفاظتی Granite؛ تبدیل ماسک‌گذاری از یک فرآیند دستی به یک قابلیت سیستمی در لایه‌ی استنتاج.

اگر توسعه‌دهنده‌ای هستید که از داده‌های کاربران برزیلی در محیط‌های تست استفاده می‌کنید، افشای شناسه‌های مالیاتی بدون ماسک اکنون شما را با جریمه‌های سنگین قانونی مواجه می‌کند. طبق قطعنامه شماره ۱/۲۰۲۳ ANPD، هرگونه دسترسی غیرمجاز به این شناسه‌ها در سیستم‌های غیرتولیدی، مسئولیت‌های حقوقی شدیدی ایجاد می‌کند. برای حل این چالش، IBM قابلیت ماسک کردن شناسه‌های CPF (برای افراد) و CNPJ (برای شرکت‌ها) را در نسخه ۲.۱ چارچوب حفاظتی گرانیت (Granite Guardrails Framework) که در سه‌ماهه دوم ۲۰۲۴ منتشر شد، ادغام کرد.

این اقدام در حالی صورت می‌گیرد که قانون حفاظت از داده‌های عمومی برزیل (LGPD) فشار را بر هوش مصنوعی زاینده (Generative AI) — که شبیه نویسنده‌ای است که میلیاردها متن را خوانده و حالا بر اساس الگوها تولید می‌کند — افزایش داده است. بر اساس ماده ۶، بند III این قانون، اصل «حداقل‌سازی داده‌ها» ایجاب می‌کند که شناسه‌های حساس در لاگ‌ها و خطوط لوله‌های تست ماسک شوند. علاوه بر این، ماده ۴۶ تعهدات سخت‌گیرانه‌ای را در زمینه محرمانگی بر عهده کنترل‌کنندگان داده می‌گذارد. برای بسیاری از توسعه‌دهندگان، چالش اصلی ایجاد تعادل بین حفظ حریم خصوصی و نیاز به ردیابی داده‌ها در سیستم‌های مختلف، بدون ذخیره شناسه‌های خام است. این ضرورت برای کنترل دقیق جریان داده‌ها، با مفاهیم گسترده‌تری از حاکمیت داده بر زیرساخت همسو است که پیش‌شرط استقرار هوش مصنوعی در صنایع حساس محسوب می‌شود.

زمینه قانونی و نظارتی

طبق ماده ۵، بند X قانون LGPD، شناسه‌های ۱۱ رقمی CPF و ۱۴ رقمی CNPJ به عنوان داده‌های شخصی طبقه‌بندی می‌شوند. سازمان ملی حفاظت از داده‌های برزیل (ANPD) در پیوست قطعنامه شماره ۱/۲۰۲۳، این شناسه‌ها را در «فهرست داده‌های شخصی با ریسک بالا» (Lista de Dados Pessoais de Alto Risco) قرار داده است. افشای کامل و بدون ماسک این شناسه‌ها، نقض مستقیم ماده ۴۷ قانون LGPD محسوب می‌شود.

به نقل از مستندات IBM Cloud که در ۱۲ ژوئن ۲۰۲۴ به‌روزرسانی شد، استقرار مدل گرانیت از ترکیبی از regexهای قابل تنظیم و هشینگ HMAC-SHA256 با کلیدهای چرخان استفاده می‌کند. این روش باعث می‌شود ماسک کردن «قطعی» (Deterministic) باشد؛ یعنی یک شناسه همیشه به یک ماسک یکسان تبدیل می‌شود. این سازوکار به کنترل‌کنندگان مجاز اجازه می‌دهد تا برای مقاصد حسابرسی، داده‌ها را بدون افشای آن‌ها به مدل زبانی (LLM) بازشناسی کنند. این رویکرد دقیقاً با توصیه شماره ۰۲/۲۰۲۳ سازمان ANPD در مورد حفظ «یکپارچگی ارجاعی» (Referential Integrity) مطابقت دارد.

استانداردهای فنی انطباق

  • هشینگ در برابر بریدن: سازمان ANPD در «راهنمای پردازش داده‌های شخصی در محیط‌های هوش مصنوعی» (May 2024)، صراحتاً از HMAC-SHA256 کلیددار و توکن‌سازی بازگشت‌پذیر حمایت کرده است. بریدن ساده داده‌ها (مثلاً نمایش دو رقم آخر مانند ..***-XX) طبق پیوست II قطعنامه شماره ۱/۲۰۲۳ برای پردازش‌های پرریسک ناکافی است، زیرا در تست‌های آنتروپی و مقاومت در برابر تصادم (Collision-resistance) شکست می‌خورد. این رویکرد فنی در واقع نوعی لایه حذف داده‌های حساس است که از نشت اطلاعات شخصی (PII) در عامل‌های هوش مصنوعی جلوگیری می‌کند.
  • دامنه داده‌ها: اگرچه CNPJ یک شناسه شرکتی است، اما طبق یادداشت راهنمای شماره ۰۵/۲۰۲۲ سازمان ANPD، زمانی که این شناسه به اشخاص حقیقی (مانند مالکان انفرادی یا شرکا) مرتبط باشد، به عنوان داده شخصی تلقی می‌شود.
  • محدودیت‌های آموزش: طبق بند ۲.۳ بخشنامه BCB ۴۱۹۸/۲۰۲۳ و قطعنامه شماره ۳/۲۰۲۴ سازمان ANPD، مؤسسات مالی و سایر نهادها از استفاده از CPF/CNPJ ماسک‌نشده در هرگونه داده آموزشی هوش مصنوعی زاینده، حتی در محیط‌های داخلی و ایزوله LLM، منع شده‌اند.
  • الزامات محیطی: تمام محیط‌های غیرتولیدی شامل توسعه، تست، استیجینگ و خطوط لوله لاگ‌گیری باید پیش از ورود داده به پایگاه‌داده برداری (Vector Database) — که مثل یک کتابخانه دیجیتال است که مفاهیم را به جای کلمات ذخیره می‌کند — شناسه‌ها را ماسک کنند. قطعنامه شماره ۳/۲۰۲۴ تصریح می‌کند که تولید داده‌های مصنوعی (Synthetic Data) با استفاده از شناسه‌های واقعی، نیازمند گواهینامه پیش‌-ناشناس‌سازی است.

عدم اجرای این موارد هزینه‌های سنگینی دارد. طبق ماده ۵۲ قانون LGPD، APIهایی که این شناسه‌ها را بدون رضایت صریح و محدودیت هدف افشا کنند، با جریمه‌های اداری تا ۲٪ از درآمد سالانه در برزیل (حداکثر ۵۰ میلیون رئال) به ازای هر تخلف مواجه می‌شوند. گزارش سالانه ۲۰۲۳ سازمان ANPD در صفحه ۴۱ اشاره می‌کند که ۱۷ مورد از پرونده‌های اجرایی پیشین، دقیقاً مربوط به افشای CPFهای ماسک‌نشده در محیط‌های تست بوده است.

برای توسعه‌دهندگان، این تغییر به معنای انتقال از رویکرد «ماسک در پایان» به «ماسک در دروازه» (Mask-at-the-gateway) است. با اعمال ماسک در لایه استنتاج (Inference Gateway)، شرکت‌ها می‌توانند «حالت LGPD» را فعال کنند تا اطلاعات حساس پیش از رسیدن به پنجره زمینه (Context Window) مدل، به‌طور خودکار پاک‌سازی شوند.

این تحول ثابت می‌کند که عصر ورود کورکورانه داده‌ها به مدل‌ها (Black Box Ingestion) به پایان رسیده است. شرکت‌ها اکنون باید طبق ماده ۴۸ قانون LGPD، تبار داده‌های خود را از طریق لاگ‌های قابل حسابرسی اثبات کنند. روش‌های غیرقطعی، مانند تولید توکن‌های تصادفی، توصیه نمی‌شوند زیرا تبار داده را از بین برده و اصل مسئولیت‌پذیری ذکر شده در ماده ۴۷ را نقض می‌کنند.

گام بعدی شما

  • پایگاه‌های داده برداری و خطوط لوله‌ی استیجینگ خود را برای شناسه‌های مالیاتی خام بازرسی کنید تا پیش از چرخه بعدی حسابرسی ANPD، هرگونه داده باقی‌مانده را پاک کنید.
  • لایه‌ی Gateway استنتاج خود را به جای ماسک‌های تصادفی، به روش‌های هشینگ قطعی مجهز کنید.
  • مستندات انطباق داده‌های آموزشی خود را برای اثبات رعایت محدودیت‌های محیطی آماده کنید.

اما تأثیر این قوانین بر مدل‌های متن‌باز و توزیع جهانی آن‌ها حتی پیچیده‌تر است — به تحلیل ما درباره‌ی حاکمیت داده‌ها در مدل‌های لاما مراجعه کنید.

چرا این موضوع مهم است؟

این اقدام IBM نشان‌دهنده اعتبار بخشیدن به استانداردهای محلی در معماری‌های جهانی AI است. شرکت‌هایی که بتوانند انطباق قانونی را در لایه‌ی Gateway پیاده کنند، ریسک جریمه‌های میلیونی را حذف و اعتماد سازمانی را جلب می‌کنند.

تأثیر برای ایران

در حال حاضر اثر مستقیمی بر کاربران ایرانی ندارد، اما برای توسعه‌دهندگانی که برای بازار آمریکای لاتین محصول می‌سازند، پیاده‌سازی این استانداردها حیاتی است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی ماسک‌های تصادفی با هشینگ قطعی نشان می‌دهد که صنعت از «حریم خصوصی مطلق» به سمت «حریم خصوصی قابل حسابرسی» حرکت می‌کند. این رویکرد اجازه می‌دهد مدل‌ها بدون دیدن داده حساس، همچنان در چارچوب‌های نظارتی قابل ردیابی باشند. در واقع، لایه‌ی Guardrails اکنون به بخشی از معماری زیرساختی تبدیل شده، نه فقط یک فیلتر ساده در لایه‌ی کاربر.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.