پرش به محتوای اصلی
پرش به محتوای مقاله

چگونه Noisegate با اعمال نویز، امنیت داده‌های عامل‌های هوشمند را تضمین می‌کند؟

·۸ مرداد ۱۴۰۵۲۰ دقیقه مطالعه۱ بازدید
درگاه حریم خصوصی تفاضلی برای جلوگیری از افشای داده‌های حساس در پرس‌وجوی عامل‌های LLM غیرقابل اعتماد از طریق پروتکل MCP.
درگاه حریم خصوصی تفاضلی برای جلوگیری از افشای داده‌های حساس در پرس‌وجوی عامل‌های LLM غیرقابل اعتماد از طریق پروتکل MCP.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

انتقال مکانیسم حریم خصوصی از لایه مدل (LLM) به یک درگاه قطعی (Deterministic Gateway) که با بودجهٔ ریاضی مدیریت می‌شود و حتی در برابر مدل‌های خصمانه نفوذناپذیر است.

تصور کنید یک عامل هوش مصنوعی را به داده‌های حساس شرکت دسترسی داده‌اید، اما یک کاربر با مهندسی معکوس، حقوق دقیق مدیرعامل شما را از دل مدل بیرون می‌کشد. Noisegate تضمین می‌کند که حتی اگر مدل دستکاری شود یا عمداً خصمانه عمل کند، هیچ‌گاه یک رکورد خصوصی تک‌نفره فاش نشود.

طبق اعلام توسعه‌دهندگان در ۳۰ ژوئیه ۲۰۲۶، این سامانه مسئولیت حفظ حریم خصوصی را از دوش مدل زبانی بزرگ (LLM) — که شبیه کتابخانه‌داری است که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — برداشته و به یک درگاه (Gateway) قطعی و قابل اعتماد منتقل کرده است.

بیشتر عامل‌های امروزی بر پایهٔ «اعتماد» کار می‌کنند؛ یعنی توسعه‌دهنده امیدوار است مدل از دستورات ایمنی پیروی کند. اما همان‌طور که در تحلیل قبلی ما درباره‌ی آسیب‌پذیری مدل‌ها در برابر جعل زنجیره تفکر اشاره کردیم، استدلال‌های داخلی مدل‌ها را می‌توان دور زد. این چالش‌ها در موارد شدیدتر منجر به نشت داده‌های حساس می‌شوند، همان‌طور که اخیراً در رویداد افشای داده‌های مخازن خصوصی گیت‌هاب توسط GitLost مشاهده شد. Noisegate با این دیدگاه طراحی شده که LLM را صرفاً ابزاری برای پیشنهاد پرس‌وجو بداند، نه نگهبانی برای اجرای قوانین حریم خصوصی.

معماری مرز اعتماد

این سامانه به عنوان یک سرور پروتکل زمینهٔ مدل (MCP) برای ابزارهایی مثل Claude Desktop عمل می‌کند. نوآوری اصلی آن، یک خط لوله سه مرحله‌ای است که در آن هوش مدل از اجرای قانون جدا شده است:

  • کامپایلر LLM (غیرقابل اعتماد): عامل، سؤال زبان طبیعی را به یک درخت نحو مجزای پرس‌وجو (Query AST) تبدیل می‌کند. مدل اجازه ندارد SQL آزاد بنویسد تا سطح حمله کاهش یابد.
  • لایه اعتبارسنجی (قابل اعتماد): این لایه بررسی می‌کند که فقط ستون‌های مجاز فراخوانی شوند و تعداد اعضای گروه از حد نصاب باشد. اگر پرس‌وجو بیش از حد محدود باشد، درگاه آن را بدون مصرف بودجه رد می‌کند. برای مدیریت دقیق‌تر این سطح از دسترسی‌ها، می‌توان از رویکردهایی مشابه سیستم RBAC یکپارچه در پروژه Bifrost استفاده کرد تا دسترسی مدل‌ها به منابع سازمانی کنترل شود.
  • موتور حریم خصوصی (قابل اعتماد): این موتور با استفاده از مکانیزم لاپلاس، نویز کالیبره شده‌ای را به نتیجه اضافه می‌کند و بودجهٔ حریم خصوصی هر کاربر را مدیریت می‌کند.

درگاه حریم خصوصی تفاضلی برای جلوگیری از افشای داده‌های حساس در پرس‌وجوی مدل‌های زبانی بزرگ

شکست دادن «گالری حملات»

برای اثبات کارایی، این پروژه یک گالری حمله شامل سه اکسپلویت کلاسیک را اجرا کرده است. بر اساس مستندات پروژه، وقتی حریم خصوصی غیرفعال است این حملات موفق می‌شوند، اما با Noisegate به‌طور سیستماتیک شکست می‌خورند:

۱. حمله تفاضلی: مهاجم مجموع درآمد ۱۰۰ نفر و سپس ۹۹ نفر (بدون حضور «آلیس») را می‌پرسد تا با تفریق این دو، حقوق دقیق آلیس را به دست آورد. Noisegate با افزودن نویز به هر دو پاسخ و کسر بودجه از هر دو پرس‌وجو، این تفریق را بی‌فایده می‌کند.

۲. استنتاج عضویت: این حمله تلاش می‌کند بفهمد آیا فرد خاصی در مجموعه داده هست یا خیر. سیستم نشان می‌دهد که با سخت‌گیرانه‌تر شدن حریم خصوصی، نرخ موفقیت مهاجم به شانس ۵۰-۵۰ (پرتاب سکه) می‌رسد.

نوایزگیت: دروازه حریم‌خصوصی تفاضلی برای پرس‌وجوی ایمن داده‌های حساس توسط عامل LLM غیرقابل‌اعتماد با تضمین عدم افشای رکورد افر

۳. شناسایی تک‌نفره: بر اساس پژوهش لیتانیا سوینی در سال ۲۰۰۲، این حمله از ترکیب کد پستی و تاریخ تولد برای یافتن یک فرد استفاده می‌کند. در دموی Noisegate، پرس‌وجویی برای «زنان ۷۰ تا ۷۴ سال» در یک مجموعه داده کوچک، توسط فیلتر رد می‌شود چون گروه کوچک‌تر از آن است که خصوصی بماند.

ریاضیات بودجهٔ حریم خصوصی

حریم خصوصی رایگان نیست و از طریق یک دفتر کل محدود مدیریت می‌شود. هر پاسخ بخشی از بودجه کل (معمولاً ۰.۰۵ اپسیلون در هر پرس‌وجو) را مصرف می‌کند. وقتی بودجه تمام شود، درگاه به‌جای پاسخ نویزی، «عدم پذیرش» را برمی‌گرداند تا مهاجم نتواند با هزاران تکرار، نویز را میانگین‌گیری کرده و حذف کند.

برای افزایش کاربردی بودن، Noisegate از یک سیستم حسابداری ترکیبی استفاده می‌کند که مجموع اپسیلون خالص را با حریم خصوصی تفاضلی با تمرکز صفر (zCDP) می‌آمیزد. بر اساس بررسی داده‌های مجموعه UCI Adult، این رویکرد اجازه داد ۳۰۸ پرس‌وجو اجرا شود، در حالی که حسابداری ساده بعد از ۱۰۰ مورد متوقف می‌شد؛ یعنی ۳ برابر کاربرد بیشتر با همان تضمین ریاضی.

درگاه حریم خصوصی تفاضلی برای جلوگیری از افشای داده‌های حساس در پرس‌وجوی عامل‌های LLM غیرقابل اعتماد از طریق پروتکل MCP.

اعتبارسنجی صنعتی و مقیاس

توسعه‌دهندگان برای اطمینان از صحت پیاده‌سازی، مکانیزم نویز خود را با OpenDP (مرجع صنعتی) تطبیق دادند. طبق گزارش گیت‌هاب، خروجی این سیستم تا ۹ رقم اعشار (1e-9) با OpenDP مطابقت دارد.

در مقیاس واقعی، سیستم ارزش خود را نشان می‌دهد. در یک مجموعه داده ۲۰ نفره از بیماران، نویز (±۱۲.۰) بر سیگنال غلبه می‌کند که رفتار صحیحی برای نمونه‌های کوچک است. اما در مجموعه داده ۳۲,۵۶۱ نفرهٔ سرشماری، پرس‌وجویی برای جمعیت کل، عدد ۳۲,۵۰۰ با خطای ۶۰± را برمی‌گرداند؛ یعنی خطایی تنها ۰.۲ درصد در حالی که تضمین می‌شود هیچ فردی شناسایی نشود.

استقرار و یکپارچگی

این ابزار با پشته‌ای مدرن شامل Python، DuckDB، FastAPI و Docker ساخته شده و از طریق SDK پروتکل MCP مستقیماً به اکوسیستم عامل‌ها متصل می‌شود. کاربران می‌توانند آن را در فایل تنظیمات claude_desktop_config.json ثبت کرده و از ابزارهای ساختاریافته مثل count و sum استفاده کنند.

این تغییر معماری، فرض دسترسی عامل‌ها به داده را عوض می‌کند. به‌جای تلاش برای «همراستاسازی» مدل برای خصوصی بودن، توسعه‌دهندگان لایه‌ای قطعی مستقر می‌کنند که با مدل مانند یک مهاجم احتمالی برخورد می‌کند. این رویکرد اجازه می‌دهد عامل‌های قدرتمند در محیط‌های تحت نظارت (Regulated) استفاده شوند، جایی که نشت حتی یک سطر داده می‌تواند منجر به شکست‌های فاجعه‌بار در رعایت قوانین شود.

گام بعدی شما

  • اگر از عامل‌های هوش مصنوعی برای تحلیل داده‌های حساس استفاده می‌کنید، معماری Gateway را جایگزین دستورات سیستمی (System Prompt) کنید.
  • فایل DESIGN.md در مخزن پروژه را برای درک دقیق‌تر لایه‌های اعتبارسنجی مطالعه کنید.
  • اسکریپت‌های حمله پایتون موجود در پروژه را اجرا کنید تا قدرت دفاع در برابر حملات تفاضلی را به‌صورت زنده ببینید.

اما تأمین سخت‌افزاری برای اجرای این لایه‌های امنیتی در مقیاس میلیونی چالش‌های جدیدی ایجاد می‌کند — به تحلیل ما درباره‌ی بهینه‌سازی استنتاج در لبه مراجعه کنید.

چرا این موضوع مهم است؟

این سامانه با تکیه بر اعتبار ریاضی حریم خصوصی تفاضلی، امکان استفاده از AI Agents را در صنایع حساس مثل بهداشت و مالی فراهم می‌کند. این تغییر پارادایم، ریسک نشت داده‌های فردی را از سطح «احتمالی» به «ناممکن» تبدیل می‌کند.

تأثیر برای ایران

برنامه‌نویسان ایرانی که در حوزه‌های FinTech یا HealthTech فعالیت می‌کنند، می‌توانند از این معماری Open-source برای استقرار ایمن عامل‌های هوش مصنوعی در محیط‌های درون‌سازمانی استفاده کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «اعتماد به مدل» با «تضمین ریاضی» در لایه Gateway، نقطه پایان تلاش‌های بی‌ثمر برای ایمن‌سازی LLMها از طریق پرامپت است. این رویکرد ثابت می‌کند که امنیت داده در سیستم‌های عامل‌محور نباید یک ویژگی نرم‌افزاری باشد، بلکه باید یک محدودیت سخت‌افزاری یا معماری در مسیر داده باشد. در واقع، Noisegate مدل را از جایگاه «ناظر» به جایگاه «درخواست‌کننده» تنزل می‌دهد تا کنترل واقعی در دست ریاضیات باقی بماند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.