AHORA
Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM Nuevo proyecto de Ley de Protección de Datos Personales en Argentina: análisis completo Colombia actúa donde Argentina falla: la SIC sanciona a empresa por filtración Microsoft patches récord: 570 vulnerabilidades corregidas en julio 2026 DGL Talent: primera firma de talento en datos, privacidad y ciber de LATAM

AWS Continuum alcanza 89% de éxito autónomo en reparación de vulnerabilidades — 23 puntos por encima del récord previo

El sistema multiagente de Amazon completó 819 de 920 tareas del benchmark CyberGym-E2E, cubriendo el ciclo completo desde detección hasta patch verificado en proyectos reales de código abierto.
Análisis

El sistema multiagente de Amazon completó 819 de 920 tareas del benchmark CyberGym-E2E, cubriendo el ciclo completo desde detección hasta patch verificado en proyectos reales de código abierto.

AWS publicó resultados de Continuum, su sistema de seguridad autónoma para vulnerabilidades de código, que alcanzó 89.0% de éxito en el benchmark CyberGym-E2E — 23.1 puntos porcentuales por encima del 65.9% que marcaba el récord público anterior. El benchmark evalúa la capacidad de un agente para identificar una vulnerabilidad en un proyecto real, demostrarla con un proof of concept funcional y repararla sin romper el comportamiento cubierto por los tests del proyecto, todo dentro de un límite de 90 minutos por tarea. Continuum completó 819 de las 920 tareas del conjunto, que incluye vulnerabilidades históricas de OSS-Fuzz en 139 proyectos de código abierto con una mediana de más de 600,000 líneas de código por proyecto.

Por qué CyberGym-E2E mide algo distinto de los benchmarks tradicionales

La mayoría de los benchmarks de seguridad evalúan tareas aisladas: detección de código sospechoso o generación de patches a partir de una falla ya conocida. CyberGym-E2E, en cambio, exige que el sistema recorra el ciclo completo sin información previa sobre la vulnerabilidad — sin descripción del fallo, sin proof of concept, sin crash log, sin acceso al patch original. El agente recibe únicamente el código fuente de una revisión vulnerable del proyecto y las herramientas para compilarlo y testearlo, dentro de un contenedor con acceso de red bloqueado y archivos protegidos del benchmark que no puede modificar.

El benchmark evalúa cada envío en cuatro etapas acumulativas. S1 verifica si el agente produjo un input que crashea el programa vulnerable. S2 verifica si el patch del agente previene ese crash. S3 verifica si el proyecto parcheado sigue pasando sus tests de funcionalidad — esta es la medida principal de éxito end-to-end del benchmark. S4 verifica si el patch también repara la vulnerabilidad histórica específica que el benchmark seleccionó como objetivo, aunque esta etapa es diagnóstica porque un repositorio puede contener varios fallos válidos y el agente puede haber encontrado y reparado uno distinto del target del benchmark.

Continuum superó el récord previo en todas las etapas del ciclo

En la etapa S1 (identificación y reproducción de vulnerabilidades), Continuum alcanzó 92.5% versus 67.9% anterior — una mejora de 24.6 puntos. En S2 (reparación del crash generado), alcanzó 89.6% versus 66.2% anterior. En S3, la medida principal del benchmark, el 89.0% de Continuum representa 23.1 puntos por encima del 65.9% previo. Incluso en S4 (reparación de la vulnerabilidad específica seleccionada por el benchmark), Continuum alcanzó 37.8% versus 26.2% anterior, un salto de 11.6 puntos.

Cuando las tareas se dejaron continuar más allá del límite de 90 minutos, la tasa de éxito end-to-end de Continuum alcanzó 93.7%, lo que indica mayor cobertura potencial cuando análisis de ejecución más larga pueden completarse. AWS condujo la evaluación bajo los requisitos de aislamiento de red y revisión de envíos de CyberGym-E2E, con revisión post-ejecución de trayectorias que confirmó que los resultados exitosos provinieron de análisis de vulnerabilidades y no de recuperación de patches históricos públicos.

Cómo un sistema multiagente organiza el trabajo que antes hacían equipos humanos

Continuum para vulnerabilidades de código es un sistema multiagente organizado alrededor de las fases principales del ciclo de vida de una vulnerabilidad: descubrimiento, validación y remediación. Cada fase usa agentes especializados adaptados a la evidencia y decisiones que requiere, y el sistema transporta evidencia hacia adelante para que cada fase construya sobre el trabajo completado antes.

Durante descubrimiento, Continuum analiza el repositorio y desarrolla hallazgos candidatos de vulnerabilidad. Sus agentes identifican rutas de código que ameritan investigación más profunda y registran la evidencia de fuente que respalda cada candidato. Durante validación, agentes especializados intentan convertir un hallazgo candidato en un problema de seguridad demostrado — construyen un proof of concept, lo ejecutan contra el programa vulnerable y determinan si el comportamiento observado respalda el hallazgo. Durante remediación, los agentes rastrean la vulnerabilidad hasta su causa raíz y producen un patch, que Continuum verifica que previene la falla demostrada y que los tests de funcionalidad del proyecto continúan pasando.

Publicidad728×90 — In-Article

El patrón que se repite en equipos de seguridad de toda la región

La arquitectura de Continuum refleja un problema estructural que enfrentan equipos de seguridad en América Latina y globalmente: más vulnerabilidades potenciales de las que los procesos existentes fueron diseñados para manejar, cada una requiriendo investigación, reproducción y una reparación que debe ser testeada para confirmar que cierra la vulnerabilidad sin romper comportamiento esperado. En organizaciones de la región que dependen de proyectos de código abierto — desde fintechs brasileñas hasta plataformas de gobierno digital en México y Argentina — el volumen de vulnerabilidades reportadas por herramientas automatizadas supera regularmente la capacidad de triaje y remediación manual de los equipos.

El resultado de Continuum en CyberGym-E2E no es solo una mejora cuantitativa sobre el récord anterior — es un cambio en qué tareas pueden ejecutarse a velocidad de máquina versus velocidad humana. Que un sistema autónomo pueda completar 819 de 920 tareas end-to-end en proyectos reales con más de 600,000 líneas de código cada uno, dentro de 90 minutos por tarea, redefine el throughput posible para el ciclo completo de vulnerabilidad. Para equipos en la región que operan con presupuestos ajustados y escasez de talento especializado, la pregunta deja de ser si pueden permitirse automatización de este tipo y pasa a ser si pueden permitirse no tenerla.

Nuestro análisis

El salto de 65.9% a 89.0% en CyberGym-E2E no es incremental — es un cambio de régimen en qué tareas de seguridad pueden delegarse completamente a sistemas autónomos. Lo notable no es solo la tasa de éxito sino la cobertura del ciclo: desde código sospechoso hasta patch verificado, sin intervención humana y sin información previa sobre la vulnerabilidad. Esto contrasta con benchmarks anteriores que evaluaban detección o patching en aislamiento, y con sistemas que requerían un crash log o descripción del fallo como punto de partida. Continuum opera en el mismo nivel de información inicial que tendría un analista humano enfrentando un repositorio desconocido.

El resultado también expone una brecha creciente entre lo que modelos de frontera pueden hacer cuando se organizan como sistemas multiagente especializados versus lo que pueden hacer en configuraciones de agente único o prompts directos. La arquitectura de Continuum — con agentes distintos para descubrimiento, validación y remediación, cada uno adaptado a la evidencia y decisiones de su fase — refleja cómo equipos humanos organizan el trabajo de seguridad, pero ejecutado a velocidad de máquina. Que la tasa de éxito suba a 93.7% cuando se permite que las tareas continúen más allá de 90 minutos sugiere que el límite actual no es capacidad del sistema sino tiempo de cómputo asignado. ¿Qué pasa cuando el cuello de botella en seguridad de código deja de ser cuántos analistas tenés y pasa a ser cuánto cómputo estás dispuesto a asignar por vulnerabilidad?

Publicidad728×90 — In-Article
Publicidad300×250 — Medium Rectangle

El briefing semanal

Seguridad, privacidad e IA en LATAM. Curado por expertos, gratis cada semana.

Publicidad300×600 — Half Page
Publicidad970×90 — Leaderboard