اگر توسعهدهندهای هستید که از دادههای کاربران برزیلی در محیطهای تست استفاده میکنید، افشای شناسههای مالیاتی بدون ماسک اکنون شما را با جریمههای سنگین قانونی مواجه میکند. طبق قطعنامه شماره ۱/۲۰۲۳ ANPD، هرگونه دسترسی غیرمجاز به این شناسهها در سیستمهای غیرتولیدی، مسئولیتهای حقوقی شدیدی ایجاد میکند. برای حل این چالش، IBM قابلیت ماسک کردن شناسههای CPF (برای افراد) و CNPJ (برای شرکتها) را در نسخه ۲.۱ چارچوب حفاظتی گرانیت (Granite Guardrails Framework) که در سهماهه دوم ۲۰۲۴ منتشر شد، ادغام کرد.
این اقدام در حالی صورت میگیرد که قانون حفاظت از دادههای عمومی برزیل (LGPD) فشار را بر هوش مصنوعی زاینده (Generative AI) — که شبیه نویسندهای است که میلیاردها متن را خوانده و حالا بر اساس الگوها تولید میکند — افزایش داده است. بر اساس ماده ۶، بند III این قانون، اصل «حداقلسازی دادهها» ایجاب میکند که شناسههای حساس در لاگها و خطوط لولههای تست ماسک شوند. علاوه بر این، ماده ۴۶ تعهدات سختگیرانهای را در زمینه محرمانگی بر عهده کنترلکنندگان داده میگذارد. برای بسیاری از توسعهدهندگان، چالش اصلی ایجاد تعادل بین حفظ حریم خصوصی و نیاز به ردیابی دادهها در سیستمهای مختلف، بدون ذخیره شناسههای خام است. این ضرورت برای کنترل دقیق جریان دادهها، با مفاهیم گستردهتری از حاکمیت داده بر زیرساخت همسو است که پیششرط استقرار هوش مصنوعی در صنایع حساس محسوب میشود.
زمینه قانونی و نظارتی
طبق ماده ۵، بند X قانون LGPD، شناسههای ۱۱ رقمی CPF و ۱۴ رقمی CNPJ به عنوان دادههای شخصی طبقهبندی میشوند. سازمان ملی حفاظت از دادههای برزیل (ANPD) در پیوست قطعنامه شماره ۱/۲۰۲۳، این شناسهها را در «فهرست دادههای شخصی با ریسک بالا» (Lista de Dados Pessoais de Alto Risco) قرار داده است. افشای کامل و بدون ماسک این شناسهها، نقض مستقیم ماده ۴۷ قانون LGPD محسوب میشود.
به نقل از مستندات IBM Cloud که در ۱۲ ژوئن ۲۰۲۴ بهروزرسانی شد، استقرار مدل گرانیت از ترکیبی از regexهای قابل تنظیم و هشینگ HMAC-SHA256 با کلیدهای چرخان استفاده میکند. این روش باعث میشود ماسک کردن «قطعی» (Deterministic) باشد؛ یعنی یک شناسه همیشه به یک ماسک یکسان تبدیل میشود. این سازوکار به کنترلکنندگان مجاز اجازه میدهد تا برای مقاصد حسابرسی، دادهها را بدون افشای آنها به مدل زبانی (LLM) بازشناسی کنند. این رویکرد دقیقاً با توصیه شماره ۰۲/۲۰۲۳ سازمان ANPD در مورد حفظ «یکپارچگی ارجاعی» (Referential Integrity) مطابقت دارد.
استانداردهای فنی انطباق
- هشینگ در برابر بریدن: سازمان ANPD در «راهنمای پردازش دادههای شخصی در محیطهای هوش مصنوعی» (May 2024)، صراحتاً از HMAC-SHA256 کلیددار و توکنسازی بازگشتپذیر حمایت کرده است. بریدن ساده دادهها (مثلاً نمایش دو رقم آخر مانند ..***-XX) طبق پیوست II قطعنامه شماره ۱/۲۰۲۳ برای پردازشهای پرریسک ناکافی است، زیرا در تستهای آنتروپی و مقاومت در برابر تصادم (Collision-resistance) شکست میخورد. این رویکرد فنی در واقع نوعی لایه حذف دادههای حساس است که از نشت اطلاعات شخصی (PII) در عاملهای هوش مصنوعی جلوگیری میکند.
- دامنه دادهها: اگرچه CNPJ یک شناسه شرکتی است، اما طبق یادداشت راهنمای شماره ۰۵/۲۰۲۲ سازمان ANPD، زمانی که این شناسه به اشخاص حقیقی (مانند مالکان انفرادی یا شرکا) مرتبط باشد، به عنوان داده شخصی تلقی میشود.
- محدودیتهای آموزش: طبق بند ۲.۳ بخشنامه BCB ۴۱۹۸/۲۰۲۳ و قطعنامه شماره ۳/۲۰۲۴ سازمان ANPD، مؤسسات مالی و سایر نهادها از استفاده از CPF/CNPJ ماسکنشده در هرگونه داده آموزشی هوش مصنوعی زاینده، حتی در محیطهای داخلی و ایزوله LLM، منع شدهاند.
- الزامات محیطی: تمام محیطهای غیرتولیدی شامل توسعه، تست، استیجینگ و خطوط لوله لاگگیری باید پیش از ورود داده به پایگاهداده برداری (Vector Database) — که مثل یک کتابخانه دیجیتال است که مفاهیم را به جای کلمات ذخیره میکند — شناسهها را ماسک کنند. قطعنامه شماره ۳/۲۰۲۴ تصریح میکند که تولید دادههای مصنوعی (Synthetic Data) با استفاده از شناسههای واقعی، نیازمند گواهینامه پیش-ناشناسسازی است.
عدم اجرای این موارد هزینههای سنگینی دارد. طبق ماده ۵۲ قانون LGPD، APIهایی که این شناسهها را بدون رضایت صریح و محدودیت هدف افشا کنند، با جریمههای اداری تا ۲٪ از درآمد سالانه در برزیل (حداکثر ۵۰ میلیون رئال) به ازای هر تخلف مواجه میشوند. گزارش سالانه ۲۰۲۳ سازمان ANPD در صفحه ۴۱ اشاره میکند که ۱۷ مورد از پروندههای اجرایی پیشین، دقیقاً مربوط به افشای CPFهای ماسکنشده در محیطهای تست بوده است.
برای توسعهدهندگان، این تغییر به معنای انتقال از رویکرد «ماسک در پایان» به «ماسک در دروازه» (Mask-at-the-gateway) است. با اعمال ماسک در لایه استنتاج (Inference Gateway)، شرکتها میتوانند «حالت LGPD» را فعال کنند تا اطلاعات حساس پیش از رسیدن به پنجره زمینه (Context Window) مدل، بهطور خودکار پاکسازی شوند.
این تحول ثابت میکند که عصر ورود کورکورانه دادهها به مدلها (Black Box Ingestion) به پایان رسیده است. شرکتها اکنون باید طبق ماده ۴۸ قانون LGPD، تبار دادههای خود را از طریق لاگهای قابل حسابرسی اثبات کنند. روشهای غیرقطعی، مانند تولید توکنهای تصادفی، توصیه نمیشوند زیرا تبار داده را از بین برده و اصل مسئولیتپذیری ذکر شده در ماده ۴۷ را نقض میکنند.
گام بعدی شما
- پایگاههای داده برداری و خطوط لولهی استیجینگ خود را برای شناسههای مالیاتی خام بازرسی کنید تا پیش از چرخه بعدی حسابرسی ANPD، هرگونه داده باقیمانده را پاک کنید.
- لایهی Gateway استنتاج خود را به جای ماسکهای تصادفی، به روشهای هشینگ قطعی مجهز کنید.
- مستندات انطباق دادههای آموزشی خود را برای اثبات رعایت محدودیتهای محیطی آماده کنید.
اما تأثیر این قوانین بر مدلهای متنباز و توزیع جهانی آنها حتی پیچیدهتر است — به تحلیل ما دربارهی حاکمیت دادهها در مدلهای لاما مراجعه کنید.




گفتگو