پرش به محتوای اصلی
پرش به محتوای مقاله

افشای ۱۲ هزار GPU انویدیا؛ ریسک ۱۰۰ میلیون دلاری در لایه‌ی نظارتی

·۱۷ مهر ۱۴۰۵۶ دقیقه مطالعه
هزاران سرور GPU در معرض خطر و آسیب‌پذیری بحرانی در ابزار نظارت NVIDIA
هزاران سرور GPU در معرض خطر و آسیب‌پذیری بحرانی در ابزار نظارت NVIDIA
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شناسایی یک آسیب‌پذیری با شدت بالا (CVE-2026-47483) در ابزار نظارتی انویدیا که اجازه می‌دهد مهاجمان بدون احراز هویت، سرویس‌های مدیریت GPU را متوقف کنند.

تصور کنید کلید انبار تجهیزات ۱۰۰ میلیون دلاری شما برای هر کسی که آدرس آن را بداند، باز باشد. این دقیقاً وضعیتی است که اکنون بسیاری از مراکز داده‌ای که از سخت‌افزارهای انویدیا استفاده می‌کنند، با آن روبروستند.

بیش از ۱۲,۰۰۰ واحد پردازش گرافیکی (GPU) — شبیه موتورهای قدرتمندی که تمام محاسبات سنگین هوش مصنوعی را به دوش می‌کشند — به دلیل پیکربندی اشتباه نقاط انتهایی نظارتی، برای هر کسی با یک اتصال اینترنت قابل مشاهده هستند. این افشا فقط یک لیست از سخت‌افزارها نیست؛ بلکه دری است برای مهاجمانی که می‌توانند سیستم‌های مدیریت محاسبات گران‌قیمت هوش مصنوعی را به طور کامل متوقف کنند.

بیشتر تمرکزهای امنیتی در حوزه هوش مصنوعی روی وزن‌های مدل یا فیلترهای API است. اما زیرساختی که مدل را اندازه‌گیری می‌کند — یعنی «لایه مشاهده» — اغلب کاملاً باز رها شده است. شرکت Lava، یک مؤسسه پژوهشی امنیتی، شکاف عظیمی را در نحوه حفاظت شرکت‌ها از تله‌متری سخت‌افزاری خود پیدا کرده است.

به نقل از گزارش Lava که در ۸ اکتبر ۲۰۲۶ منتشر شد، این شرکت چهار مرحله اسکن را بین مارس و می ۲۰۲۶ انجام داده است. پژوهشگران حدود ۲,۱۰۰ میزبان NVIDIA DCGM Exporter را شناسایی کردند که بدون نیاز به هیچ‌گونه احراز هویتی، تله‌متری بیش از ۱۲,۰۰۰ GPU را گزارش می‌کردند.

مقیاس افشا شده

سرمایه در معرض خطر در این افشا تکان‌دهنده است. طبق برآورد Lava، ارزش سخت‌افزارهای مشاهده شده بیش از ۱۰۰ میلیون دلار است. این رقم ارزش بازار تجهیزات است، نه لزوماً خسارت ناشی از یک حمله. این موجودی شامل شتاب‌دهنده‌های سطح بالای مرکز داده بود، از جمله:

  • مدل‌های H100 و H200
  • مدل‌های Blackwell Ultra B300
  • سیستم‌های مصرف‌کننده RTX 4090 و 5090

علاوه بر این، پژوهشگران ۱۲,۰۹۶ میزبان Node Exporter را یافتند که جزئیات سرور و سیستم‌عامل را فاش می‌کردند. در حالی که DCGM بر روی GPU تمرکز دارد، Node Exporter جزئیات گسترده‌تری از سرور و سیستم‌عامل را برملا می‌کند. این دو آمار باید مجزا نگه داشته شوند، زیرا مشاهدات Node Exporter نشان‌دهنده یک افشای زیرساختی گسترده‌تر است و لزوماً به معنای آسیب‌پذیری میزبان‌ها در برابر نقص خاص DCGM نیست.

در مجموع، این نشت‌ها یک نقشه کامل از زیرساخت هوش مصنوعی یک شرکت را در اختیار هر ناظر خارجی قرار می‌دهد. این موضوع ثابت می‌کند که یک سازمان می‌تواند API استنتاج خود را ایمن کند، اما هم‌زمان سایر سرویس‌های موجود در همان زیرساخت را در برابر اینترنت باز بگذارد.

درک DCGM و تله‌متری

سرویس DCGM یا همان مدیر GPU مرکز داده (Data Center GPU Manager) است. بر اساس مستندات انویدیا، DCGM Exporter داده‌های تله‌متری منتخب GPU را جمع‌آوری کرده و در قالبی ارائه می‌دهد که سیستم Prometheus بتواند آن‌ها را مصرف کند. این نقطه انتهایی معیارها (metrics endpoint) معمولاً توسط اپراتورها برای ردیابی وضعیت و فعالیت گره‌های GPU استفاده می‌شود.

داده‌های مفیدی که برای اپراتورها حیاتی است اما برای مهاجمان جذاب است، عبارتند از:

  • دما و میزان مصرف برق
  • میزان بهره‌برداری از GPU و استفاده از حافظه
  • رویدادهای خطا

وقتی این اطلاعات در دسترس غریبه‌ها باشد، به یک منبع شناسایی (Reconnaissance) تبدیل می‌شود. خواندن تله‌متری را با خواندن وزن‌های مدل، داده‌های آموزشی یا پرامپت‌ها اشتباه نگیرید؛ اما مهاجمی که بداند چه قطعات و چه نسخه‌هایی در سیستم حضور دارند، نقطه شروع بسیار دقیق‌تری نسبت به کسی دارد که با یک سرور مبهم و ناشناخته روبروست.

یک آسیب‌پذیری با شدت بالا

شرکت Lava فراتر از افشای لیست‌ها، یک سلاح کاربردی در NVIDIA DCGM Exporter پیدا کرد. این آسیب‌پذیری که اکنون با کد CVE-2026-47483 و امتیاز ۸.۲ (CVSS) ردیابی می‌شود، در نقاط انتهایی /debug/pprof قرار دارد که برای پروفایلینگ (Profiling) استفاده می‌شوند.

قابلیت Profiling — شبیه به یک ذره‌بین که توسعه‌دهنده با آن رفتار CPU و حافظه را در لحظه داخل یک اپلیکیشن می‌بیند — یک ابزار تشخیصی قانونی است. مشکل امنیتی زمانی رخ می‌دهد که این تابع داخلی و سنگین، بدون هیچ‌گونه کنترلی در دسترس یک فراخواننده غیرقابل اعتماد قرار بگیرد.

در یک محیط کنترل‌شده، Lava با استفاده از کانتینر رسمی انویدیا نشان داد که اگر یک مهاجم غیرمجاز، درخواست‌های هم‌زمان Profiling ارسال کند، می‌تواند باعث مصرف بی‌رویه و کنترل‌نشده منابع شده و کل سرویس Exporter را به طور کامل کرش دهد (متوقف کند).

ریسک‌های عملیاتی و اثرات

متوقف کردن سرویس نظارتی، یک «نقطه کور» برای اپراتورها ایجاد می‌کند. اگر یک بار کاری (Workload) کند شود و هم‌زمان سیستم نظارت از کار بیفتد، مهندسان ممکن است یک حمله مخرب را با یک اختلال ساده در ابزار اندازه‌گیری اشتباه بگیرند. این موضوع می‌تواند شناسایی یک حادثه مصرف منابع را به تأخیر بیندازد.

علاوه بر این، فشار ایجاد شده روی CPU و حافظه می‌تواند به بارهای کاری واقعی آموزش یا استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند — که در همان سرور هستند، سرایت کند. البته باید توجه داشت که کرش کردن Exporter لزوماً باعث توقف اجرای مدل روی GPU نمی‌شود؛ اثر آن به نحوه استقرار و جداسازی منابع بستگی دارد. این یک آسیب‌پذیری در سطح سرویس نرم‌افزاری است و نه نقصی در سیلیکون GPU. این موضوع در کنار تلاش‌های انویدیا برای ایجاد سدهای سخت‌افزاری جهت جلوگیری از فرار عامل‌های هوش مصنوعی نشان می‌دهد که امنیت در لایه‌های مختلف، از سیلیکون تا نرم‌افزار، به طور هم‌زمان حیاتی است.

شرکت Lava همچنین اشاره کرد که حدود یک چهارم از میزبان‌های DCGM افشا شده، نقاط انتهایی پروفایلینگ داخلی Go را در دسترس قرار داده بودند. این زیرمجموعه با نقطه انتهایی کلی معیارها متفاوت است و گمراه‌کننده خواهد بود اگر بگوییم تمام ۱۲,۰۰۰ GPU قربانی تایید شده این آسیب‌پذیری خاص هستند.

ریسک شناسایی و نقشه‌برداری

یک فرد خارجی با نظارت بر دما، میزان بهره‌برداری و مصرف برق، می‌تواند دوره‌های شلوغ کاری و فعالیت‌های تکراری یک شرکت را نقشه‌برداری کند. اگرچه این سرنخ‌ها مدرکی قطعی برای آموزش یا ارائه یک مدل خاص نیستند، اما به مهاجم کمک می‌کنند تا محدوده محتویات محیط و زمان فعال بودن آن را محدود و دقیق‌تر کند.

راهکارهای اصلاحی و وصله‌ها

شرکت NVIDIA پیش از این به‌روزرسانی‌هایی را برای رفع این مشکل ارائه کرده است. نسخه‌های DCGM Exporter 4.8.2 و DCGM 4.5.3 به عنوان نسخه‌های اصلاح‌شده معرفی شده‌اند. اپراتورها باید برای یافتن جفت‌نسخه پشتیبانی شده متناسب با استقرار خاص خود به توصیه‌نامه فعلی مراجعه کنند، زیرا این شماره نسخه‌ها به طور متقابل قابل جایگزینی نیستند.

با این حال، نصب وصله، خطای پیکربندی (باز گذاشتن نقطه انتهایی برای عموم) را حل نمی‌کند. یک Exporter وصله‌شده همچنان اگر عمومی باشد، تله‌متری را فاش می‌کند. مدل امنیتی Prometheus صراحتاً هشدار می‌دهد که نقاط انتهایی HTTP اجزا نباید در شبکه‌های عمومی باز باشند.

شرکت Lava این توالی را به تیم‌های هوش مصنوعی توصیه می‌کند:

  • سیاهه سازی (Inventory): شناسایی اینکه کدام Exporterها، سرورهای Prometheus و رابط‌های تشخیصی در حال اجرا هستند، مالک آن‌ها کیست و چگونه قابل دسترسی هستند.
  • به‌روزرسانی: اعمال وصله‌های امنیتی سازنده. به جای تکیه بر فایل پیکربندی، نسخه واقعی نرم‌افزار یا کانتینر مستقر شده را بررسی کنید.
  • محدودسازی: استفاده از شبکه‌های خصوصی، فایروال‌ها و گروه‌های امنیتی (Security Groups) تا تله‌متری فقط برای زیرساخت‌های نظارتی ضروری در دسترس باشد.
  • غیرفعال‌سازی Profiling: غیرفعال نگه داشتن پرچم --enable-pprof مگر در موارد ضروری؛ در نسخه‌های فعلی، این قابلیت به صورت اختیاری (Opt-in) است.
  • تأیید: اطمینان از اینکه جمع‌آوری مجاز داده‌ها همچنان کار می‌کند و خرابی‌های غیرمنتظره Exporter شناسایی می‌شوند.

این حادثه یک فرض خطرناک در استقرار هوش مصنوعی را به چالش می‌کشد: این تصور که securing کردن API مدل کافی است. در واقعیت، لایه مدیریت اغلب ضعیف‌ترین حلقه زنجیر است. این چالش‌ها با بحث‌های جاری درباره قابلیت همراستاسازی امنیتی مدل‌های خودمختار همسو است، جایی که امنیت باید فراتر از لایه‌های سطحی تعریف شود.

برای بسیاری از سازمان‌ها، سرویس نظارت در یک منطقه خاکستری بین تیم زیرساخت و تیم هوش مصنوعی قرار دارد. بدون داشتن یک مالک امنیتی مشخص برای لایه محاسباتی، این نقاط انتهایی مدت‌ها پس از قفل شدن خود مدل، باز می‌مانند. حفاظت از محاسبات هوش مصنوعی باید شامل حفاظت از سیستم‌هایی باشد که آن را اندازه‌گیری و مدیریت می‌کنند.

گام بعدی شما

  • اگر مدیر زیرساخت هستید، فوراً دسترسی‌های HTTP نقاط انتهایی نظارتی خود را بررسی کنید تا از باز بودن در شبکه عمومی مطمئن شوید.
  • نسخه‌های DCGM خود را با آخرین توصیه‌های انویدیا تطبیق داده و وصله‌های امنیتی را اعمال کنید.
  • دسترسی به قابلیت Profiling را در محیط‌های عملیاتی (Production) به طور کامل ببندید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این افشا نشان می‌دهد که اعتبار امنیتی یک سیستم هوش مصنوعی تنها به اندازه ضعیف‌ترین ابزار نظارتی آن است. بر اساس استانداردهای E-E-A-T، تخصص در مدیریت زیرساخت به اندازه تخصص در معماری مدل برای حفظ اعتماد کاربران حیاتی است.

تأثیر برای ایران

این خبر برای تیم‌های DevOps و زیرساخت در ایران که از خوشه‌های GPU برای آموزش مدل‌های محلی استفاده می‌کنند، یک هشدار جدی برای بازبینی فایروال‌ها و پیکربندی Exporterها است.

·نگاه ما
تحریریه دات‌هوش

تمرکز بیش از حد بر امنیت لایه‌ی نرم‌افزاری و مدل‌ها، یک «نقطه کور» استراتژیک در سازمان‌ها ایجاد کرده است. این اتفاق نشان می‌دهد که مهاجمان دیگر به دنبال شکستن مدل‌ها نیستند، بلکه از طریق ابزارهای مدیریتی ساده، زیرساخت را هدف قرار می‌دهند. در واقع، تله‌متری که برای بهینه‌سازی ساخته شده، اکنون به ابزاری برای شناسایی (Reconnaissance) تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.