AHORA
Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM

Nvidia parchea falla en monitor de GPU que expuso US$100 millones en infraestructura de IA

Más de 2.000 servidores dejaron accesibles sin autenticación endpoints de telemetría que revelan configuración de hardware y carga de trabajo en tiempo real
Alerta

Más de 2.000 servidores dejaron accesibles sin autenticación endpoints de telemetría que revelan configuración de hardware y carga de trabajo en tiempo real

Nvidia distribuyó en mayo de 2024 un parche para una vulnerabilidad de agotamiento de recursos en DCGM Exporter, el componente de software que las empresas usan para monitorear GPUs en infraestructura de entrenamiento e inferencia de IA. La falla, identificada como CVE-2026-47483 con puntuación CVSS 8.2, permite que un atacante remoto sin credenciales sature el servicio de monitoreo con solicitudes concurrentes a endpoints de profiling, llevando el consumo de memoria hasta el punto de colapso. Investigadores de Lava Security reportaron el hallazgo después de encontrar más de 2.000 servidores GPU exponiendo DCGM Exporter directamente a internet sin ninguna capa de autenticación — esos sistemas, rastreados en cuatro escaneos sucesivos, reportaron más de 12.000 GPUs únicas, equivalentes a aproximadamente US$100 millones en hardware.

Cómo endpoints de debug sin protección se convirtieron en vector de ataque

El problema reside en la forma en que versiones no parcheadas de DCGM Exporter manejan solicitudes concurrentes no autenticadas a sus endpoints «/debug/pprof/». Estos endpoints, diseñados para profiling de rendimiento durante desarrollo, procesan cada solicitud sin validar la identidad del cliente ni limitar la cantidad de peticiones simultáneas. Un volumen suficiente de solicitudes concurrentes eleva el consumo de memoria hasta agotar los recursos disponibles del host, provocando el cierre abrupto del proceso de monitoreo.

La consecuencia inmediata es la pérdida de visibilidad sobre el estado y la actividad de las GPUs — métricas como utilización, uso de memoria, consumo de energía y eventos de error dejan de estar disponibles para los sistemas de observabilidad. Pero el impacto no se limita al plano de monitoreo: DCGM Exporter comparte host con las cargas de trabajo de GPU, y la presión sobre CPU y memoria generada por el ataque puede afectar procesos de entrenamiento o inferencia que corren en paralelo. Investigadores de Lava Security señalaron que esta característica de profiling puede estar habilitada por defecto en instalaciones sin actualizar, ampliando la superficie de exposición en despliegues que no revisaron la configuración inicial.

Qué revela la telemetría expuesta sobre la infraestructura de IA de una organización

DCGM Exporter recolecta telemetría de GPU — utilización, uso de memoria, consumo de energía, eventos de error — y la expone vía HTTP para que plataformas como Prometheus la consuman. Cuando estos endpoints quedan accesibles desde internet sin autenticación, cualquier observador externo puede consultar qué hardware está corriendo una organización, cuán intensamente se está usando y detalles sobre la arquitectura de infraestructura de IA circundante.

Los sistemas que Lava Security encontró expuestos incluyen GPUs Nvidia Blackwell Ultra B300, H200 y H100 — modelos usados para cargas de trabajo de IA a gran escala — además de sistemas de consumo RTX 5090 y RTX 4090. Michael Katchinskiy, investigador de Lava Security que reportó el hallazgo, advirtió que aunque esta información no proporciona acceso a pesos de modelos, datos de entrenamiento u otros activos protegidos, sí permite a un atacante perfilar un objetivo e identificar componentes más débiles o versiones de software desactualizadas. En un contexto donde la capacidad de cómputo es un activo estratégico, saber qué hardware tiene un competidor o un objetivo de espionaje industrial — y cuánto lo está usando — es inteligencia operacional valiosa.

Por qué Argentina y Brasil quedan expuestos por su dependencia de proveedores cloud globales

Aunque el reporte de Lava Security no desglosa la distribución geográfica de los servidores expuestos, la dependencia estructural de América Latina de proveedores cloud globales y de integradores locales que replican configuraciones de referencia sin ajustes de seguridad amplifica el riesgo. En Argentina y Brasil, donde universidades, startups de IA y centros de investigación arriendan capacidad GPU en proveedores regionales o despliegan clusters on-premise con configuraciones heredadas de documentación upstream, la probabilidad de que DCGM Exporter quede expuesto sin autenticación es alta — especialmente en entornos donde el foco está en poner la infraestructura operativa rápido, no en endurecer cada componente auxiliar.

Publicidad728×90 — In-Article

El patrón se repite: componentes de observabilidad y telemetría, percibidos como «internos» o «de soporte», quedan fuera del perímetro de seguridad formal y terminan accesibles desde internet porque nadie los consideró parte de la superficie de ataque. En un contexto regional donde la madurez en gestión de configuración de infraestructura cloud es despareja, la exposición de endpoints de monitoreo sin autenticación no es una anomalía — es un riesgo sistémico que afecta tanto a despliegues corporativos como a iniciativas académicas con presupuesto limitado para revisión de seguridad.

Qué hacer con instalaciones de DCGM Exporter ya desplegadas

Nvidia publicó DCGM Exporter versión 4.8.2 como la versión actualizada que aborda CVE-2026-47483. La actualización es el primer paso, pero no el único: Lava Security recomienda restringir el acceso público a DCGM Exporter y Prometheus a menos que el acceso externo sea estrictamente necesario, vincular los exporters a interfaces de loopback o privadas, y aplicar controles de acceso mediante firewalls, security groups u otras medidas de red. Después de actualizar, es necesario verificar que la opción «–enable–pprof» esté deshabilitada — esta característica de profiling puede estar activa por defecto en software sin parchear, dejando los endpoints vulnerables accesibles incluso si no se usan activamente.

Para organizaciones que operan infraestructura GPU en América Latina, el caso refuerza la necesidad de auditar no solo los servicios principales sino también los componentes de telemetría y observabilidad que corren en el mismo host. La telemetría expuesta no compromete directamente los datos de entrenamiento, pero revela suficiente información sobre capacidad, uso y configuración como para convertirse en un vector de reconocimiento previo a ataques más dirigidos.

Nuestro análisis

CVE-2026-47483 es un recordatorio de que la superficie de ataque en infraestructura de IA no se limita a los modelos o los datos — incluye cada componente auxiliar que corre en el mismo host y que puede quedar expuesto por configuración por defecto insegura. El hecho de que más de 2.000 servidores hayan quedado accesibles desde internet sin autenticación, representando US$100 millones en hardware, no es un problema de Nvidia — es un problema de práctica de despliegue. DCGM Exporter es un componente legítimo de observabilidad; el error está en exponerlo sin controles de acceso, asumiendo que «es solo monitoreo» y que por lo tanto no requiere el mismo nivel de protección que un servicio de producción.

El patrón se repite en otros componentes de telemetría y profiling: Prometheus exporters, agentes de métricas, dashboards de observabilidad — todos diseñados para correr en redes internas, todos frecuentemente expuestos a internet por configuración descuidada o por falta de revisión de seguridad en la fase de despliegue. En América Latina, donde la presión por poner infraestructura operativa rápido suele superar la capacidad de revisión de seguridad, este tipo de exposición no es una excepción — es la norma en entornos que priorizan velocidad sobre endurecimiento. ¿Cuántos otros componentes de observabilidad están corriendo ahora mismo sin autenticación, esperando que alguien los encuentre en el próximo escaneo masivo?

Publicidad728×90 — In-Article
Publicidad300×250 — Medium Rectangle

El briefing semanal

Seguridad, privacidad e IA en LATAM. Curado por expertos, gratis cada semana.

Publicidad300×600 — Half Page
Publicidad970×90 — Leaderboard