تصور کنید کلید انبار تجهیزات ۱۰۰ میلیون دلاری شما برای هر کسی که آدرس آن را بداند، باز باشد. این دقیقاً وضعیتی است که اکنون بسیاری از مراکز دادهای که از سختافزارهای انویدیا استفاده میکنند، با آن روبروستند.
بیش از ۱۲,۰۰۰ واحد پردازش گرافیکی (GPU) — شبیه موتورهای قدرتمندی که تمام محاسبات سنگین هوش مصنوعی را به دوش میکشند — به دلیل پیکربندی اشتباه نقاط انتهایی نظارتی، برای هر کسی با یک اتصال اینترنت قابل مشاهده هستند. این افشا فقط یک لیست از سختافزارها نیست؛ بلکه دری است برای مهاجمانی که میتوانند سیستمهای مدیریت محاسبات گرانقیمت هوش مصنوعی را به طور کامل متوقف کنند.
بیشتر تمرکزهای امنیتی در حوزه هوش مصنوعی روی وزنهای مدل یا فیلترهای API است. اما زیرساختی که مدل را اندازهگیری میکند — یعنی «لایه مشاهده» — اغلب کاملاً باز رها شده است. شرکت Lava، یک مؤسسه پژوهشی امنیتی، شکاف عظیمی را در نحوه حفاظت شرکتها از تلهمتری سختافزاری خود پیدا کرده است.
به نقل از گزارش Lava که در ۸ اکتبر ۲۰۲۶ منتشر شد، این شرکت چهار مرحله اسکن را بین مارس و می ۲۰۲۶ انجام داده است. پژوهشگران حدود ۲,۱۰۰ میزبان NVIDIA DCGM Exporter را شناسایی کردند که بدون نیاز به هیچگونه احراز هویتی، تلهمتری بیش از ۱۲,۰۰۰ GPU را گزارش میکردند.
مقیاس افشا شده
سرمایه در معرض خطر در این افشا تکاندهنده است. طبق برآورد Lava، ارزش سختافزارهای مشاهده شده بیش از ۱۰۰ میلیون دلار است. این رقم ارزش بازار تجهیزات است، نه لزوماً خسارت ناشی از یک حمله. این موجودی شامل شتابدهندههای سطح بالای مرکز داده بود، از جمله:
- مدلهای H100 و H200
- مدلهای Blackwell Ultra B300
- سیستمهای مصرفکننده RTX 4090 و 5090
علاوه بر این، پژوهشگران ۱۲,۰۹۶ میزبان Node Exporter را یافتند که جزئیات سرور و سیستمعامل را فاش میکردند. در حالی که DCGM بر روی GPU تمرکز دارد، Node Exporter جزئیات گستردهتری از سرور و سیستمعامل را برملا میکند. این دو آمار باید مجزا نگه داشته شوند، زیرا مشاهدات Node Exporter نشاندهنده یک افشای زیرساختی گستردهتر است و لزوماً به معنای آسیبپذیری میزبانها در برابر نقص خاص DCGM نیست.
در مجموع، این نشتها یک نقشه کامل از زیرساخت هوش مصنوعی یک شرکت را در اختیار هر ناظر خارجی قرار میدهد. این موضوع ثابت میکند که یک سازمان میتواند API استنتاج خود را ایمن کند، اما همزمان سایر سرویسهای موجود در همان زیرساخت را در برابر اینترنت باز بگذارد.
درک DCGM و تلهمتری
سرویس DCGM یا همان مدیر GPU مرکز داده (Data Center GPU Manager) است. بر اساس مستندات انویدیا، DCGM Exporter دادههای تلهمتری منتخب GPU را جمعآوری کرده و در قالبی ارائه میدهد که سیستم Prometheus بتواند آنها را مصرف کند. این نقطه انتهایی معیارها (metrics endpoint) معمولاً توسط اپراتورها برای ردیابی وضعیت و فعالیت گرههای GPU استفاده میشود.
دادههای مفیدی که برای اپراتورها حیاتی است اما برای مهاجمان جذاب است، عبارتند از:
- دما و میزان مصرف برق
- میزان بهرهبرداری از GPU و استفاده از حافظه
- رویدادهای خطا
وقتی این اطلاعات در دسترس غریبهها باشد، به یک منبع شناسایی (Reconnaissance) تبدیل میشود. خواندن تلهمتری را با خواندن وزنهای مدل، دادههای آموزشی یا پرامپتها اشتباه نگیرید؛ اما مهاجمی که بداند چه قطعات و چه نسخههایی در سیستم حضور دارند، نقطه شروع بسیار دقیقتری نسبت به کسی دارد که با یک سرور مبهم و ناشناخته روبروست.
یک آسیبپذیری با شدت بالا
شرکت Lava فراتر از افشای لیستها، یک سلاح کاربردی در NVIDIA DCGM Exporter پیدا کرد. این آسیبپذیری که اکنون با کد CVE-2026-47483 و امتیاز ۸.۲ (CVSS) ردیابی میشود، در نقاط انتهایی /debug/pprof قرار دارد که برای پروفایلینگ (Profiling) استفاده میشوند.
قابلیت Profiling — شبیه به یک ذرهبین که توسعهدهنده با آن رفتار CPU و حافظه را در لحظه داخل یک اپلیکیشن میبیند — یک ابزار تشخیصی قانونی است. مشکل امنیتی زمانی رخ میدهد که این تابع داخلی و سنگین، بدون هیچگونه کنترلی در دسترس یک فراخواننده غیرقابل اعتماد قرار بگیرد.
در یک محیط کنترلشده، Lava با استفاده از کانتینر رسمی انویدیا نشان داد که اگر یک مهاجم غیرمجاز، درخواستهای همزمان Profiling ارسال کند، میتواند باعث مصرف بیرویه و کنترلنشده منابع شده و کل سرویس Exporter را به طور کامل کرش دهد (متوقف کند).
ریسکهای عملیاتی و اثرات
متوقف کردن سرویس نظارتی، یک «نقطه کور» برای اپراتورها ایجاد میکند. اگر یک بار کاری (Workload) کند شود و همزمان سیستم نظارت از کار بیفتد، مهندسان ممکن است یک حمله مخرب را با یک اختلال ساده در ابزار اندازهگیری اشتباه بگیرند. این موضوع میتواند شناسایی یک حادثه مصرف منابع را به تأخیر بیندازد.
علاوه بر این، فشار ایجاد شده روی CPU و حافظه میتواند به بارهای کاری واقعی آموزش یا استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند — که در همان سرور هستند، سرایت کند. البته باید توجه داشت که کرش کردن Exporter لزوماً باعث توقف اجرای مدل روی GPU نمیشود؛ اثر آن به نحوه استقرار و جداسازی منابع بستگی دارد. این یک آسیبپذیری در سطح سرویس نرمافزاری است و نه نقصی در سیلیکون GPU. این موضوع در کنار تلاشهای انویدیا برای ایجاد سدهای سختافزاری جهت جلوگیری از فرار عاملهای هوش مصنوعی نشان میدهد که امنیت در لایههای مختلف، از سیلیکون تا نرمافزار، به طور همزمان حیاتی است.
شرکت Lava همچنین اشاره کرد که حدود یک چهارم از میزبانهای DCGM افشا شده، نقاط انتهایی پروفایلینگ داخلی Go را در دسترس قرار داده بودند. این زیرمجموعه با نقطه انتهایی کلی معیارها متفاوت است و گمراهکننده خواهد بود اگر بگوییم تمام ۱۲,۰۰۰ GPU قربانی تایید شده این آسیبپذیری خاص هستند.
ریسک شناسایی و نقشهبرداری
یک فرد خارجی با نظارت بر دما، میزان بهرهبرداری و مصرف برق، میتواند دورههای شلوغ کاری و فعالیتهای تکراری یک شرکت را نقشهبرداری کند. اگرچه این سرنخها مدرکی قطعی برای آموزش یا ارائه یک مدل خاص نیستند، اما به مهاجم کمک میکنند تا محدوده محتویات محیط و زمان فعال بودن آن را محدود و دقیقتر کند.
راهکارهای اصلاحی و وصلهها
شرکت NVIDIA پیش از این بهروزرسانیهایی را برای رفع این مشکل ارائه کرده است. نسخههای DCGM Exporter 4.8.2 و DCGM 4.5.3 به عنوان نسخههای اصلاحشده معرفی شدهاند. اپراتورها باید برای یافتن جفتنسخه پشتیبانی شده متناسب با استقرار خاص خود به توصیهنامه فعلی مراجعه کنند، زیرا این شماره نسخهها به طور متقابل قابل جایگزینی نیستند.
با این حال، نصب وصله، خطای پیکربندی (باز گذاشتن نقطه انتهایی برای عموم) را حل نمیکند. یک Exporter وصلهشده همچنان اگر عمومی باشد، تلهمتری را فاش میکند. مدل امنیتی Prometheus صراحتاً هشدار میدهد که نقاط انتهایی HTTP اجزا نباید در شبکههای عمومی باز باشند.
شرکت Lava این توالی را به تیمهای هوش مصنوعی توصیه میکند:
- سیاهه سازی (Inventory): شناسایی اینکه کدام Exporterها، سرورهای Prometheus و رابطهای تشخیصی در حال اجرا هستند، مالک آنها کیست و چگونه قابل دسترسی هستند.
- بهروزرسانی: اعمال وصلههای امنیتی سازنده. به جای تکیه بر فایل پیکربندی، نسخه واقعی نرمافزار یا کانتینر مستقر شده را بررسی کنید.
- محدودسازی: استفاده از شبکههای خصوصی، فایروالها و گروههای امنیتی (Security Groups) تا تلهمتری فقط برای زیرساختهای نظارتی ضروری در دسترس باشد.
- غیرفعالسازی Profiling: غیرفعال نگه داشتن پرچم
--enable-pprofمگر در موارد ضروری؛ در نسخههای فعلی، این قابلیت به صورت اختیاری (Opt-in) است. - تأیید: اطمینان از اینکه جمعآوری مجاز دادهها همچنان کار میکند و خرابیهای غیرمنتظره Exporter شناسایی میشوند.
این حادثه یک فرض خطرناک در استقرار هوش مصنوعی را به چالش میکشد: این تصور که securing کردن API مدل کافی است. در واقعیت، لایه مدیریت اغلب ضعیفترین حلقه زنجیر است. این چالشها با بحثهای جاری درباره قابلیت همراستاسازی امنیتی مدلهای خودمختار همسو است، جایی که امنیت باید فراتر از لایههای سطحی تعریف شود.
برای بسیاری از سازمانها، سرویس نظارت در یک منطقه خاکستری بین تیم زیرساخت و تیم هوش مصنوعی قرار دارد. بدون داشتن یک مالک امنیتی مشخص برای لایه محاسباتی، این نقاط انتهایی مدتها پس از قفل شدن خود مدل، باز میمانند. حفاظت از محاسبات هوش مصنوعی باید شامل حفاظت از سیستمهایی باشد که آن را اندازهگیری و مدیریت میکنند.
گام بعدی شما
- اگر مدیر زیرساخت هستید، فوراً دسترسیهای HTTP نقاط انتهایی نظارتی خود را بررسی کنید تا از باز بودن در شبکه عمومی مطمئن شوید.
- نسخههای DCGM خود را با آخرین توصیههای انویدیا تطبیق داده و وصلههای امنیتی را اعمال کنید.
- دسترسی به قابلیت Profiling را در محیطهای عملیاتی (Production) به طور کامل ببندید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو