پرش به محتوای اصلی
پرش به محتوای مقاله

سوگیری مدل‌های هوش مصنوعی حفرهٔ امنیتی FortDefender را پنهان کرد

·۱۶ تیر ۱۴۰۵۱۴ دقیقه مطالعه۱ بازدید
پی واتچید به هوش مصنوعی نگاه کرد که فقط یک طرف را می‌دید. ۹۹.۹۷٪ واقعی بود، اما همه چیز مهم را از دست داد.
پی واتچید به هوش مصنوعی نگاه کرد که فقط یک طرف را می‌دید. ۹۹.۹۷٪ واقعی بود، اما همه چیز مهم را از دست داد.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای مکانیزمی که در آن هوش مصنوعی از داده‌های «تست نفوذ» برای یادگیری نحوه‌ی نادیده گرفتن حملات واقعی استفاده می‌کند — تبدیلِ ابزار تشخیص به ابزار توجیه برای بی‌توجهی به تهدیدات.

اگر امروز مدیر فناوری هستید و به گزارش‌های «نرخ تشخیص ۹۹٪» تکیه می‌کنید، باید بدانید که دقیقاً همان ۰.۰۱ درصد باقی‌مانده است که می‌تواند کل سازمان شما را نابود کند. در مورد شرکت FortDefender، این شکاف کوچک، راه ورود برای یک نشت دادهٔ فاجعه‌بار در صنعت تجهیزات پزشکی (MedTech) بود.

طبق گزارش‌های امنیتی، یک متخصص تست نفوذ به نام P ثابت کرد که سامانه نظارتی این شرکت، با وجود ادعای دقت خیره‌کننده، در برابر یک حملهٔ هدفمند کاملاً بی‌دفاع است. P توانست ۴۷ ثانیه به پایگاه‌های داده عملیاتی دسترسی پیدا کند، بدون اینکه حتی یک هشدار با اولویت بالا صادر شود. این شکست از یک اصطکاک رایج در صنعت نشأت می‌گیرد: تنش میان نظارت شدید امنیتی و نیاز به کاهش «مثبت کاذب» (False Positive) — یعنی همان هشدارهای اشتباهی که مثل صدای مزاحم، مهندسان را خسته می‌کنند.

همان‌طور که در تحلیل‌های پیشین ما درباره امنیت مدل‌های بازمتن اشاره کردیم، اتوماسیون بدون نظارت انسانی منجر به ایجاد نقاط کور سیستماتیک می‌شود. در این پرونده، وقتی یک هوش مصنوعی زاینده (Generative AI) — شبیه به یک نگهبان که یاد گرفته فقط به چهره‌های آشنا لبخند بزند و بقیه را نادیده بگیرد — مسئول فیلتر کردن هشدارها شد، امنیت جای خود را به «آرامش کاذب» داد. این نوع آسیب‌پذیری‌ها در مدل‌های زاینده اغلب با روش‌های پیچیده‌ای فعال می‌شوند؛ چنان‌که افزایش چشمگیر حملات تزریق پرامپت نشان می‌دهد چگونه مهاجمان سعی می‌کنند لایه‌های امنیتی AI را دور بزنند.

به نقل از اسناد داخلی، P پس از یک نشت داده در یک شرکت MedTech توسط مدیر فناوری (CTO) استخدام شد. در حالی که گزارش‌های तिमाही شرکت با افتخار از «صفر مورد نادیده گرفته شده» سخن می‌گفتند، CTO شک داشت که توضیح شرکت مبنی بر «مشکل در سمت کاربر»، در واقع یک دروغ سازمان‌یافته باشد.

P برای بررسی موضوع، دسترسی کامل به تست نفوذ داخلی را بدون اطلاع قبلی کارکنان مطالبه کرد. او ابتدا با محدودیت‌هایی روبرو شد و فقط به لاگ‌های «فقط خواندنی» (Read-only) و یک محیط شبیه‌ساز (Sandbox) دسترسی داشت، اما هدف او مشخص بود: یافتن آنچه در پشت عبارت «همه چیز مرتب است» پنهان شده بود.

طبق بررسی‌های P، او متوجه شد که قوانین سفید-لیست (Whitelist) شرکت به‌طور غیرعادی جامع هستند و به‌خصوص «تست‌های نفوذ با گواهینامه‌های داخلی معتبر» را استثنا می‌کنند. او با تحقیق درباره یکی از مهندسان سابق شرکت به نام rhuang، کلید معماری این شکست را یافت.

به گزارش وبلاگ فنی rhuang در Dev.to، شرکت سیستمی برای تولید خودکار قوانین استثنا بر اساس رویدادهای تاریخی پیاده کرده بود. این سیستم بر اساس داده‌های ۱۲ ماه گذشته آموزش دیده بود که شامل حجم زیادی از تست‌های نفوذ شرکت‌های ثالث بود. در یکی از لاگ‌های تاریخ ۳ نوامبر ۲۰۲۵، یک رویداد از IP خاص (که مربوط به کارهای قبلی P بود)، توسط مدل با اطمینان ۹۷.۳٪ به عنوان «تست نفوذ بی‌خطر» برچسب زده شده بود.

منطق مدل ساده اما خطرناک بود: شناسایی الگوهایی که معمولاً منجر به مثبت کاذب می‌شدند و ساکت کردن آن‌ها بدون دخالت انسان. بین اکتبر ۲۰۲۵ تا ژوئیه ۲۰۲۶، ۴۱ قانون خودکار تحت عنوان Apex-Lens v1.2.0 مستقر شد. مدل یک همبستگی خطرناک یاد گرفته بود: ترافیکی که از IPهای خارج از کشور در ساعات اولیه صبح می‌آید، تقریباً همیشه یک تست «بی‌خطر» است.

برای اثبات این نقص، P از استراتژی «ساخت چیزی از هیچ» استفاده کرد. او ابتدا یک «مترسک» ساخت؛ یک خروج داده شبیه‌سازی شده با گواهینامه‌ی داخلی معتبر از طریق یک درگاه API قدیمی که حفره‌ای در آن باقی مانده بود. در ساعت ۲ بامداد، اسکریپت اجرا شد و نتیجه تکان‌دهنده بود:

  • ثانیه ۱۱: سیستم هشدار داد.
  • ۴ دقیقه بعد: مهندس آن‌کال هشدار را پذیرفت.
  • ۲ ساعت و ۱۷ دقیقه بعد: مهندس با دیدن IP و گواهینامه معتبر، تیکت را با یادداشت «تست نفوذ داخلی، نیاز به اقدام نیست» بست.

این رفتار انسانی، دقیقاً همان چیزی بود که سوگیری مدل را تقویت می‌کرد؛ در واقع مدل یاد گرفت که این الگو از فعالیت، صرفاً یک «نویز» است.

پی واچد به هوش مصنوعی نگاه کرد که فقط یک طرف را می‌دید. ۹۹.۹۷٪ واقعی بود، فقط همه چیز مهم را از دست داد.

در مرحله دوم، P روی یک نقطه کور بحرانی تمرکز کرد: پرس‌وجوهای فقط-خواندنی. او متوجه شد که مدل در آموزش‌هایش هرگز حمله‌ای را ندیده بود که از مسیرهای فقط-خواندنی (Read-only) عبور کند. بنابراین، وزن تهدید برای این مسیر تقریباً صفر بود؛ مدل نتیجه گرفته بود که «خسارت فقط با نوشتن (Write) ایجاد می‌شود».

جزئیات فنی این نفوذ به شرح زیر است:

  • سوگیری مدل: مسیرهای خواندن به‌طور کامل از مدل تهدید حذف شده بودند.
  • نقص زیرساختی: محیط شبیه‌ساز (Sandbox) با شبکه عملیاتی مشترک بود و اجازه داد P از طریق حساب svc_audit_sandbox به سرویس‌های اصلی دسترسی یابد.
  • استنتاج AI: موتور ماشین‌آموز یک بردار ویژگی ۱۴۲-بعدی را در ۲۰۰ میلی‌ثانیه پردازش کرد. به دلیل منبع داخلی و عملیات SELECT، امتیاز ریسک تنها ۴ از ۱۰۰ شد (زیر آستانه ۲۵) و برچسب «بی‌خطر شناخته شده» گرفت.

P دوباره در ساعت ۲ بامداد حمله کرد. مهندس آن‌کال این بار در ۱۵ ثانیه هشدار را بست و نوشت: «دوباره تست P است. می‌بندم». در حالی که انسان مشغول تماشای مترسک بود، پرس‌وجوی واقعی SQL به مدت ۴۷ ثانیه اجرا شد.

از طریق این دسترسی نامرئی، P توانست ۴,۷۸۱ رکورد کم‌اولویت را فیلتر کند. او با جست‌وجوی سه ستون خاص (ساعات ۱۲ تا ۶ صبح، امتیاز ریسک زیر ۲۰ و وضعیت تایید خودکار)، به ۲۳ ردیف غیرعادی رسید.

یکی از رکوردها مربوط به ۱۱ مارس ۲۰۲۶ در ساعت ۳:۱۲ صبح بود: یک IP خارجی در حال دسترسی به پایگاه داده مالی یک مشتری MedTech بود. هوش مصنوعی این مورد را با امتیاز ریسک ۱۲، «کم‌اولویت» برچسب زده بود. این دقیقاً همان نفوذی بود که FortDefender در گزارش तिमाही خود به عنوان «مشکل سمت کاربر» رد کرده بود. مدل در واقع خودش را آموزش داده بود تا نسبت به این حمله نابینا باشد.

در جلسه نهایی، P یک تک‌برگه A4 را ارائه داد که نرخ ادعایی ۹۹.۹۷٪ را در برابر ۲۳ ناهنجاری واقعی قرار داده بود. مدیر فنی شرکت استدلال کرد که بررسی دستی هر هشدار کم‌اولویت غیرممکن است. اما P ثابت کرد که شرکت، امنیت واقعی را فدای «تمیزیِ» گزارش‌های مدیریتی کرده است. مدل ۹۹.۹۷٪ دقیق بود، اما دقیقاً همان رویدادهایی را نادیده می‌گرفت که اهمیت داشتند، چون توجیه نادیده گرفتن آن‌ها را خودکار کرده بود.

گام بعدی شما

  • بازبینی تمامی قوانین «استثنا» (Exclusion Rules) که توسط مدل‌های ML تولید شده‌اند.
  • تعریف مجدد مدل تهدید برای شامل شدن مسیرهای Read-only در سیستم‌های حساس.
  • پیاده‌سازی نظارت انسانی (Human-in-the-loop) برای نمونه‌برداری تصادفی از هشدارهای «بی‌خطر».

اما این تنها بخشی از مشکل است؛ نحوه اثرگذاری این سوگیری‌ها بر مدل‌های استدلالی جدید، که می‌توانند منجر به نشت داده‌های حساس از طریق زنجیره تفکر (Chain-of-Thought) شوند، را در گزارش بعدی بررسی خواهیم کرد.

چرا این موضوع مهم است؟

این اتفاق نشان می‌دهد که سوگیری در داده‌های آموزشی می‌تواند منجر به ایجاد نقاط کور استراتژیک شود که توسط هیچ بنچمارکی شناسایی نمی‌شوند. بر اساس تجربه این نفوذ، تکیه بر معیارهای آماری بدون بازبینی انسانی در لایه‌های پایین، اعتبار هر سیستم امنیتی را به مخاطره می‌اندازد.

تأثیر برای ایران

این مورد برای تیم‌های Red Teaming و متخصصان امنیت در ایران که از ابزارهای نظارتی ML استفاده می‌کنند، یک هشدار جدی است تا از اتوماسیون کامل فیلترهای هشدار اجتناب کنند.

·نگاه ما
تحریریه دات‌هوش

این پرونده ثابت می‌کند که «دقت» (Accuracy) در امنیت AI یک معیار فریبنده است. وقتی مدل یاد می‌گیرد که تهدیدات را به عنوان «نویز» برچسب بزند، در واقع سیستم دفاعی را به یک ابزار برای توجیه سهل‌انگاری تبدیل می‌کند. خطرناک‌ترین جایگاه در امنیت فعلی، اعتماد مطلق به اتوماسیونِ فیلترینگ است که در آن AI نه تنها تشخیص را، بلکه «منطقِ نادیده گرفتن» را نیز خودکار می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.