پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه گیت‌های Regex از ورود کلیدهای حساس به مدل‌های زبانی می‌جلو‌گیری می‌کنند؟

·۲۲ شهریور ۱۴۰۵۹ دقیقه مطالعه
راهنما
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex
نوار ابزار ویندوز با دکمه‌های میکروفون و کیبورد، نشان‌دهنده فعال‌سازی صوتی Codex
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک گیت سانسور (Redaction Gate) مبتنی بر پایتون که به جای اعتماد به کاربر، از طریق اجبار فنی (Non-zero exit code) مانع از ورود لاگ‌های CI به پنجره متنی مدل‌های AI می‌شود.

یک خط ساده برای عیب‌یابی مثل echo DEPLOY_TOKEN=$DEPLOY_TOKEN می‌تواند در لحظه‌ای که یک مهندس لاگ‌های CI را در چت‌باکس یک مدل هوش مصنوعی می‌چسباند، کل زیرساخت ابری شرکت را به خطر بیندازد. در ۱۳ سپتامبر ۲۰۲۶، یک راهنمای فنی در dev.to به یک شکست بحرانی در مرزهای اعتماد اشاره کرد: این فرض غلط که مدل‌های هوش مصنوعی — چه نسخه‌های ابری (SaaS) و چه میزبانی شخصی (Self-hosted) — مقصدی امن برای ردپاهای اجرایی حساس هستند.

تصور کنید ساعت ۲ صبح است و یک استقرار (Deploy) روی دستور docker push متوقف شده است. در کانال اتفاقات، همکارتان پیشنهاد می‌دهد: «لاگ CI را در مدل بریز؛ سریع‌تر از ما خطای رجیستری را پیدا می‌کند.» اما بررسی دستی نشان می‌دهد خط ۱۸۴ خطای رجیستری نیست، بلکه یک مرحله عیب‌یابی است که هرگز حذف نشده و مقدار توکن هنوز فعال است. مشکل اینجا یک ترس کلی از هوش مصنوعی نیست؛ بلکه این است که مرز اعتماد جابه‌جا شده اما هیچ گیت یا دروازه‌ای برای کنترل آن تعبیه نشده است.

بسیاری از توسعه‌دهندگان با لاگ‌های CI مثل ردپاهای ساده خطا برخورد می‌کنند. در واقع، این لاگ‌ها ردپاهای اجرایی سریال‌شده‌ای هستند که از محیط‌های دارای دسترسی بالا (Privileged Runners) می‌آیند؛ محیط‌هایی که پیش از این رمزهای عبور رجیستری، ادعاهای OIDC ابری و کلیدهای بلندمدت را دیده‌اند. این موضوع یادآور این نکته است که چگونه لاگ‌های CI می‌توانند به نقشه‌های مخفی زیرساخت شما برای مهاجمان تبدیل شوند و نقاط ضعف امنیتی را برملا کنند. مسیر داده معمولاً سه گام است: از محیط CI به بک‌اند لاگ (مثل گیت‌هاب، گیت‌لب یا جنکینز)، سپس به کلیپ‌بورد مهندس یا فایل‌خوان یک عامل (Agent)، و در نهایت به پنجره متنی (Context Window) — مثل میز کاری که جا برای چند ورق دارد، نه برای کل کتابخانه — در مدل هوش مصنوعی (چه از راه دور و چه میزبانی شخصی).

برای حل این مشکل، این راهنما یک «گیت سانسور» (Redaction Gate) پیشنهاد می‌دهد؛ یک متغیر تغییرناپذیر مبتنی بر پایتون که اگر فایلی با الگوهای شناخته‌شده‌ی اسرار تطابق داشت، اجازه نمی‌دهد به کلیپ‌بورد یا یک عامل (Agent) — شبیه دستیاری که کارهای تکراری را برای شما انجام می‌دهد — برسد. این رویکرد مدل امنیتی را از «اعتماد به انسان» به «اجبار به خروجی غیرصفر» تغییر می‌دهد.

مکانیسم گیت سانسور

راهکار پیشنهادی از یک اسکریپت سبک پایتون ۳.۱۲ به نام gate.py استفاده می‌کند که برای جلوگیری از وابستگی‌های جدید، فقط از کتابخانه‌های استاندارد (re, sys, pathlib) بهره می‌برد. این اسکریپت به هیچ بسته اضافی و دسترسی به شبکه نیاز ندارد. این گیت بر اساس اصل «بسته‌شدن در صورت خطا» (Fail-closed) عمل می‌کند؛ یعنی هرگونه تطابق، بلافاصله منجر به مسدودسازی می‌شود.

به نقل از گزارش dev.to، این گیت با لاگ‌های CI به عنوان «ورودی خصمانه» برخورد می‌کند. «خصمانه» به معنای بدافزار نیست، بلکه یعنی فایل توسط جوبی تولید شده که اجازه دیدن اسراری را داشته که کاربر اجازه بازنشر آن‌ها را ندارد. این گیت با استفاده از عبارت‌های منظم (Regex) محافظه‌کارانه، چندین کلاس حساس را هدف قرار می‌دهد:

  • اسرار استقرار و رجیستری: الگوهایی که با DEPLOY_TOKEN=, docker login, _PASSWORD=, npm_, ghp_ و github_pat_ مطابقت دارند.
  • کلیدهای زیرساخت ابری: شناسایی کلیدهای دسترسی AWS که با AKIA یا ASIA شروع می‌شوند، aws_secret_access_key و بلوک‌های شبیه به STS.
  • هدرهای احراز هویت: شناسایی توکن‌های Authorization: Bearer, ghs_ و JSONهای توکن شناسایی GitHub Actions.
  • اعتبارنامه‌های جاسازی‌شده: URLهایی با فرمت user:pass@ یا هدرهای x-access-token:.
  • شکست‌های ماسک‌گذاری: مقادیری که در یک خط به صورت *** ظاهر می‌شوند اما در خط بعد به دلیل اجرای دیرهنگام تابع add-mask به صورت متن ساده می‌آیند.

منطق دقیق قوانین

اسکریپت gate.py این بررسی‌ها را از طریق لیستی از تاپل‌ها به نام RULES شامل نام قانون و الگوی کامپایل‌شده اجرا می‌کند. برای مثال، این ابزار به‌طور خاص ترکیب docker login با --password-stdin را برای شکار تلاش‌های احراز هویت رجیستری جست‌وجو می‌کند و توکن‌های npm_ با طول ۲۰ کاراکتر یا بیشتر را رصد می‌کند.

اگر خطی علامت‌گذاری شود، اسکریپت نام قانون، شماره خط و بخشی از متن متخلف (تا ۲۰۰ کاراکتر) را برمی‌گرداند. این کار باعث می‌شود مهندس دقیقاً بداند چرا عملیات Paste مسدود شده، بدون اینکه خودِ اسکریپت به منبع جدیدی برای نشت داده تبدیل شود.

پیاده‌سازی چارچوب رگرسیون

برای اینکه این گیت به یک «نمایش امنیتی» (Security Theater) تبدیل نشود، چارچوب مذکور یک ساختار سخت‌گیرانه برای تست‌ها (Fixtures) می‌طلبد. گیت‌هایی که فقط یک دموی ساده را پاس می‌کنند، «نمایش» محسوب می‌شوند؛ یک سیستم مستحکم به یک گیت رگرسیون نیاز دارد که بتواند روی لپ‌تاپ یا در CI با استفاده از توکن‌های قناری (Canary) به جای توکن‌های واقعی اجرا شود.

  • تست‌های مثبت (Positive Fixtures): لاگ‌های خطای واقعی بدون هیچ سری اسراری (مثلاً یک خطای استاندارد npm compile که شامل npm error code ELIFECYCLE و npm error errno 1 و error TS2339: Property 'exp' does not exist on type 'unknown' باشد) که باید با کد خروجی ۰ پاس شوند.
  • تست‌های منفی (Negative Fixtures): توکن‌های قناری (مثل canary-rotate-me-not-real یا ghp_CANARY_NOT_A_REAL_TOKEN_0000) که باید حتماً باعث شکست و خروجی ۱ شوند.

استفاده از دو نوع تست منفی به این دلیل است که مثلاً رگکسی که فقط DEPLOY_TOKEN= را می‌گیرد، توکن‌های ghp_ را از دست می‌دهد. یک تست ممکن است تخصیص DEPLOY_TOKEN را شبیه‌سازی کند و دیگری توکن ghp_ را در یک خطای احراز هویت git. اگر یک تست منفی پاس شود، سیستم فرض می‌کند متغیر تغییرناپذیر (Invariant) از بین رفته و هرگونه ادغام (Merge) در کد گیت را مسدود می‌کند. این کار یک مرز رگرسیون ایجاد می‌کند تا منطق امنیتی در طول زمان دست‌نخورده بماند.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، جابه‌جایی مرزهای اعتماد بدون ابزارهای کنترلی، بزرگ‌ترین ریسک در زنجیره DevOps است.

نقاط ادغام و مرزهای اعتماد

این راهنما تأکید می‌کند که گیت باید قبل از عملیات Paste قرار بگیرد، نه بعد از آنکه مدل متن را پردازش کرد. حافظه یک ابزار کنترلی نیست. برای انسان‌ها، این به معنای یک Wrapper شل (مثل redact_or_die()) است که اگر gate.py شکست بخورد، اجازه کپی فایل در کلیپ‌بورد را نمی‌دهد. برای عامل‌های هوش مصنوعی یا ابزارهای پروتکل زمینهٔ مدل (MCP)، گیت باید در خودِ Wrapper ابزار ادغام شود تا عامل نتواند فایل‌های **/*.log را بخواند مگر اینکه اسکن پاس شود. این رویکرد در واقع پاسخی به چالش‌های عیب‌یابی است؛ جایی که تغییر رویکرد از Log Stream به Run Card می‌تواند به مدیریت بهتر جریان داده‌ها در عامل‌ها کمک کند.

برای کاربران GitHub CLI، نویسنده یک خط لوله «بسته در صورت خطا» پیشنهاد می‌دهد: هدایت خروجی gh run view --log به یک فایل موقت، اجرای gate.py روی آن و حذف فوری فایل در صورت خروجی غیرصفر.

در مورد مقصد داده‌ها، نویسنده اشاره می‌کند که استفاده از سرورهای میزبانی شخصی — مانند پلتفرم متن‌باز MonkeyCode — شعاع تخریب ارائه‌دهنده را کاهش می‌دهد اما ریسک را حذف نمی‌کند. MonkeyCode دسترسی رایگان به مدل و سرور را فراهم می‌کند تا کاربران بدون ارسال لاگ‌های خام به چت‌باکس‌های عمومی، مدل را تست کنند.

با این حال، سری رازی که وارد پنجره متنی می‌شود، همچنان در ترنسکریپت‌ها، فایل‌های Swap و دامپ‌های دیسک باقی می‌ماند. همان‌طور که نویسنده بیان می‌کند: «میزبانی شخصی یک دامنه اعتماد متفاوت است، اما فیزیک متفاوتی ندارد.» بنابراین، سانسور داده‌ها فارغ از اینکه مدل ابری باشد یا شخصی، اجباری است. یک سرور رایگان برای پاک کردن یک دامنه مفید است، اما جایگزینی برای سانسور نیست.

دفاع در عمق: پیشگیری، شناسایی، بازیابی

برای حفظ یک خط لوله امن، راهنما یک رویکرد لایه‌ای را پیشنهاد می‌دهد:

  • لایه Runner: پیشگیری از نشت با حذف echoهای عیب‌یابی اسرار، ماسک‌گذاری پیش از اولین چاپ و ترجیح OIDC بر PATهای بلندمدت. بررسی Diffهای جوب برای دستورات set -x در نزدیکی دستورات لاگین یا فراخوانی‌های curl -H Authorization.
  • لایه ذخیره لاگ: اجرای کنترل‌های دسترسی و زمان نگهداری (Retention). غیرفعال کردن استفاده عمومی از آرتیفکت‌های اجراهای شکست‌خورده. هشدار در صورت برخورد لاگ‌های داخلی با gate.py در باکت‌های داخلی و پاکسازی آرتیفکت‌ها.
  • لایه Paste انسانی: استفاده از Wrapperهایی که در خروجی ۱، کپی در کلیپ‌بورد را رد می‌کنند. استفاده از توکن‌های قناری منحصر به هر کانال اتفاقات برای شناسایی نشت. اگر یک قناری در ترنسکریپت ظاهر شد، راز را Rotate کنید و فرض کنید Prompt-cache لو رفته است.
  • لایه ابزار Agent/MCP: استفاده از لیست‌های مجاز (Allowlists) که عملیات cat روی لاگ‌ها را تا زمان تایید گیت ممنوع می‌کند. پیاده‌سازی اسکنرهای نتیجه-ابزار با استفاده از همان RULES. در صورت یافتن نشت، نشست (Session) را قطع و ترنسکریپت‌های محلی را پاک کنید.

محدودیت‌ها و بازیابی

این رویکرد مبتنی بر Regex یک «حصار» است، نه یک مجموعه کامل جلوگیری از نشت داده (DLP). این سیستم لاگ‌های باینری، آرشیوهای gzip، اسرار کدگذاری‌شده با base64 یا بلوک‌های PEM چندخطی که هر ۶۴ کاراکتر شکسته شده‌اند را از دست می‌دهد. همچنین ممکن است در مستنداتی که درباره docker login --password-stdin بحث می‌کنند، مثبت کاذب (False Positive) بدهد. در محیط‌های تحت نظارت (Regulated)، این ابزار باید مکمل محصولات DLP سازمانی باشد، نه جایگزین آن‌ها.

کاربران هشدار یافته‌اند که از رشته‌های قناری که شبیه پیشوندهای توکن‌های واقعی هستند در مخازن عمومی استفاده نکنند و هرگز توکن‌های واقعی ghp_ را برای «واقع‌گرایانه شدن» در تست‌های منفی قرار ندهند. واقع‌گرایانه بودن همان مسیری است که توکن‌ها از آن فرار می‌کنند.

وقتی نشت داده از طریق یک توکن قناری در ترنسکریپت مدل شناسایی می‌شود، فرآیند بازیابی مطلق است: چرخش (Rotate) فوری راز و فرض بر این است که کل حافظه موقت پرامپت (Prompt Cache) لو رفته است. هدف، تغییر فرهنگ از «لطفاً اسرار را نخوانید» به یک متغیر فنی است که در آن مدل اساساً هرگز آن خط را نمی‌بیند.

این تغییر در عمل، فرض بنیادی عیب‌یابی با کمک AI را عوض می‌کند و می‌پذیرد که «مسیر Paste» ضعیف‌ترین حلقه در زنجیره DevOps است. با اجبار بر دو متغیر — اینکه هیچ لاگی که با RULES مطابقت دارد مجاز به خواندن نباشد (مرز زمان اجرا) و اینکه گیت هرگز یک تست منفی را پاس نکند (مرز رگرسیون) — تیم‌ها می‌توانند یک مرز امنیتی برنامه‌ریزی‌شده را حفظ کنند.

گام بعدی شما

  • اسکریپت‌های ساده‌ای برای شناسایی الگوهای AKIA یا ghp_ در لاگ‌های محلی خود پیاده کنید.
  • اگر از ابزارهای MCP استفاده می‌کنید، یک لایه بررسی (Validation) قبل از خواندن فایل‌های لاگ اضافه کنید.
  • توکن‌های قناری را در محیط‌های تست خود جایگزین توکن‌های واقعی کنید تا نشت‌ها را سریع‌تر شناسایی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این متدولوژی با ایجاد یک مرز سخت بین محیط‌های اجرای حساس و مدل‌های زبانی، ریسک نشت اعتبارنامه‌ها را به شدت کاهش می‌دهد. اعتبار این روش در استفاده از اصل Fail-closed است که اجازه نمی‌دهد خطای انسانی منجر به فاجعه زیرساختی شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که در پروژه‌های Open Source یا ابری فعالیت می‌کنند، پیاده‌سازی این گیت‌های محلی راهکاری رایگان و مستقل از تحریم‌ها برای جلوگیری از لو رفتن کلیدهای API است.

·نگاه ما
تحریریه دات‌هوش

این رویکرد نشان می‌دهد که امنیت در عصر AI دیگر با آموزش کاربر یا سیاست‌های شرکتی حل نمی‌شود، بلکه باید به لایه‌ی کد (Code-level invariant) منتقل شود. تبدیل «اعتماد به انسان» به «کد خروجی صفر» در لایه‌ی کلیپ‌بورد، یک چرخش راهبردی از امنیت واکنشی به امنیت پیش‌گیرانه است. در واقع، ما شاهد تبدیل شدن ابزارهای ساده‌ی Regex به گیت‌های حیاتی در مسیر داده‌های حساس هستیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.