
Resumen: El mercado del pentesting con IA se consolidó con fuerza en 2026. Horizon3.ai levantó $250M con una valoración superior a $2.000M en agosto, XBOW cerró una Serie C de $120M por encima de $1.000M en marzo, y Pentera, Terra Security, RunSybil y Hadrian lanzaron productos agénticos en una ventana de nueve meses. Bajo la financiación solo existen seis arquitecturas genuinamente distintas, y todas resuelven cuatro problemas de ingeniería compartidos: gestión de contexto, planificación, validación de hallazgos y control del radio de impacto. Este desmontaje cubre las diez plataformas líderes a nivel de arquitectura, la evidencia publicada de cada una y la brecha entre laboratorio y realidad que el marketing omite sistemáticamente: los agentes que explotan el 87% de los CVE de un día cuando se les entrega el aviso caen a cerca del 13% en la misma clase de objetivo cuando tienen que encontrar el fallo por sí mismos.
ThreatExploit publica este blog y construye una de las plataformas evaluadas más abajo, donde aparece en primer lugar. Los criterios de clasificación se declaran íntegramente antes de la lista, cada afirmación sobre un competidor procede de su propio material publicado o de benchmarks revisados por pares, y las limitaciones de nuestra propia plataforma se exponen en el mismo formato que las de los demás. Léalo como un argumento informado de una parte interesada, no como una auditoría independiente, y ejecute la prueba comparativa descrita al final contra su propio entorno.
Dos números definen el estado del pentesting con IA en 2026, y apuntan en direcciones opuestas.
El primero es $665M y subiendo: la financiación de riesgo total divulgada en la categoría de seguridad ofensiva autónoma, concentrada en un puñado de empresas que hoy son unicornios. Horizon3.ai cerró una Serie E de $250M en agosto de 2026 con una valoración reportada por encima de $2.000M. XBOW cerró una Serie C de $120M en marzo de 2026, llevando su financiación total a $237M con una valoración superior a $1.000M. Pentera superó los $1.000M antes. Terra Security, RunSybil y Hadrian lanzaron o ampliaron ofertas agénticas en la misma ventana.
El segundo número es 13%. Esa es la tasa de éxito de explotación que alcanzan los mejores frameworks de agentes evaluados públicamente en CVE-Bench, un benchmark revisado por pares con 40 CVE de severidad crítica de aplicaciones web reales, cuando el agente tiene que encontrar la vulnerabilidad sin que le digan cuál es. Suministre la descripción de la vulnerabilidad y el mismo benchmark sube a aproximadamente 25%.
Ambos números son ciertos. La capacidad es real y mejora rápido, y también es mucho más estrecha de lo que implica el marketing de la categoría. Este artículo es un desmontaje técnico de las diez plataformas que importan, escrito para quienes deben tomar una decisión de compra y necesitan saber qué se ejecuta realmente bajo la etiqueta.
- ✓Existen seis arquitecturas distintas en este mercado: modelos entrenados a propósito dentro de marcos gobernados, motores deterministas con capa de IA, hackers agénticos autónomos, agentes de razonamiento sobre código, red teamers dirigidos a IA y frameworks de agentes de código abierto. Comparar entre clases es un error de categoría.
- ✓Todos estos sistemas resuelven los mismos cuatro problemas de ingeniería: gestión de contexto, planificación, validación de hallazgos y control del radio de impacto. Cómo responde un proveedor a esos cuatro predice sus resultados reales mejor que cualquier puntuación de benchmark.
- ✓La brecha entre laboratorio y realidad es la cifra más importante de la categoría: 87% de éxito en CVE de un día con el aviso suministrado se derrumba a aproximadamente 7-13% cuando el agente debe descubrir el fallo por sí mismo.
- ✓La arquitectura de validación separa las plataformas reales de las demostraciones. Busque descubrimiento y validación separados en software, con la reproducibilidad como criterio de promoción: los escáneres automáticos arrastran un rango documentado de 10-40% de falsos positivos.
- ✓El alcance impuesto en código en la frontera de herramientas es estructuralmente distinto del alcance escrito en un prompt. Uno es una compuerta; el otro es una petición con la que se puede discutir al modelo.
- ✓Cerca del 70% de las vulnerabilidades web críticas son fallos de lógica de negocio, que ninguna plataforma de esta lista detecta de forma fiable. Todos los resultados destacados de 2026 mantuvieron revisión humana antes de su publicación.
Las Seis Arquitecturas Detrás de Todo Producto en Este Mercado
La mayoría de las comparativas de proveedores listan funcionalidades. Aquí eso resulta casi inútil, porque dos plataformas con listas de funciones idénticas pueden tener modos de fallo completamente distintos según cómo estén construidas. Hay seis clases de arquitectura en este mercado, y el primer trabajo de cualquier evaluación es determinar cuál tiene delante.
La primera clase es la más reciente y la más difícil de construir, porque exige poseer tanto el modelo como el andamiaje que lo rodea. El resto del mercado o bien envuelve un modelo general o bien construye a mano la lógica de ataque. Un motor determinista con capa de IA nunca le sorprenderá, y precisamente por eso es la arquitectura que se ejecuta contra un Active Directory en producción. Un hacker agéntico autónomo encadenará ocasionalmente algo que ningún humano habría intentado (XBOW documentó una cadena de 48 pasos que escaló un SSRF ciego hasta el compromiso total) y ocasionalmente quemará una hora convenciéndose de que logró algo que nunca ejecutó. Son perfiles de riesgo distintos, no listas de funciones distintas.
Los Cuatro Problemas Que Todo Pentester con IA Debe Resolver
Bajo las clases de arquitectura, todo sistema de esta categoría resuelve los mismos cuatro problemas de ingeniería. Leer la respuesta de un proveedor a estos cuatro es la forma más rápida de evaluar su seriedad técnica.
Problema 1: Gestión de Contexto
Un encargo real genera mucha más salida de la que cabe en cualquier ventana de contexto. Un solo barrido de nmap sobre un /16, una enumeración de directorios y unas horas de tráfico HTTP desbordan incluso un contexto muy grande. Los agentes ingenuos truncan, pierden hallazgos previos y vuelven a probar objetivos que ya cubrieron.
Las respuestas serias desacoplan la memoria a largo plazo de la ventana de contexto. PentAGI, el proyecto de código abierto más popular de la categoría, usa PostgreSQL con embeddings de pgvector para que el agente recuerde hallazgos previos semánticamente en lugar de releer la salida bruta. VulnBot introdujo un Grafo de Tareas de Penetración: un grafo dirigido de dependencias que persiste a lo largo de sesiones de varias horas y lanza automáticamente la explotación posterior cuando aparece un hallazgo previo. Las plataformas comerciales rara vez publican su diseño de memoria, lo cual es en sí mismo una señal útil durante una evaluación técnica. Pregunte.
Problema 2: Planificación
La investigación publicada ha convergido en una clasificación clara de arquitecturas de planificación, y las diferencias son grandes.
El bucle ReAct de agente único (pensar, llamar a una herramienta, observar, repetir) es donde se sitúa la mayoría de las herramientas de primera generación, y ronda el 21% en tareas de pentesting autónomo antes de que el desbordamiento de contexto lo degrade aún más. Separar la planificación de la ejecución ayuda de forma sustancial: la investigación de planificador-ejecutor HPTSA reportó una mejora de 4,3x sobre las líneas base de agente único en explotación de día cero, alcanzando 42% pass@5 y 18% pass@1 sobre 14 vulnerabilidades reales. Los enjambres dinámicos que reescriben sus propias instrucciones al detectar patrones de fallo llegaron más lejos: D-CIPHER cubrió un 65% más de técnicas de MITRE ATT&CK que las líneas base de agente único y obtuvo 44,0% en desafíos de HackTheBox.
El resultado más interesante es el último. xOffense, construido sobre un Qwen3-32B afinado, alcanzó 79,17% de finalización de subtareas y superó a las líneas base de GPT-4 y Llama 3. La adaptación al dominio está superando a la escala bruta del modelo en esta familia de tareas. Un enfoque híbrido llamado CHECKMATE, donde el LLM escribe una descripción formal de planificación en PDDL y un planificador clásico halla la secuencia óptima, reportó una mejora de éxito superior al 20% junto con una reducción de coste superior al 50% frente a la planificación puramente con LLM.
Problema 3: Validación
Aquí es donde se separan las plataformas, y es la pregunta que más compradores olvidan hacer.
Documentado en múltiples evaluaciones de agentes de código abierto: el agente imagina la salida exitosa de un comando en lugar de ejecutarlo, y luego razona con confianza sobre esa ficción. Todo hallazgo derivado de esa alucinación es inválido. Cualquier plataforma sin validación programática, ajena al modelo, de sus propios hallazgos producirá este fallo en alguna proporción, y no sabrá que lo hizo.
El diseño publicado de XBOW es el mejor contraejemplo. Los hallazgos pasan por validadores: revisores automáticos que combinan revisión por LLM con comprobaciones programáticas propias. Para cross-site scripting, un navegador headless visita el objetivo y confirma que el payload de JavaScript se ejecutó realmente. Eso es una comprobación determinista, no un modelo afirmando éxito. XBOW también usa SimHash para similitud de contenido y hashing de imágenes para similitud visual, deduplicando hallazgos entre entornos clonados, que es lo que evita que un sistema autónomo de alto volumen ahogue a sus operadores en duplicados.
NodeZero de Horizon3.ai lleva el mismo principio en otra dirección: prueba la explotabilidad ejecutando la cadena contra el entorno real y reportando lo que efectivamente logró (compromiso de host, control de dominio, exposición de datos) en lugar de lo que infirió. Esta es la diferencia entre un hallazgo real y un resultado de escáner con prosa segura adjunta, algo que tratamos con más detalle en falsos positivos: escáneres frente a pentesting real.
Problema 4: Radio de Impacto
La explotación autónoma contra producción es un problema de ingeniería de seguridad antes que un problema de IA. Los dos enfoques creíbles son un núcleo determinista que solo ejecuta lógica de ataque verificada (la arquitectura de Pentera, donde la capa de IA adapta la selección de objetivos pero el motor de explotación sigue siendo construido a mano y auditable) o un motor seguro para producción endurecido por volumen (Horizon3.ai afirma que NodeZero se construyó ejecutando cientos de miles de pruebas seguras contra redes grandes y sensibles).
La distinción que importa: el alcance validado en la ruta de ejecución, después de que el modelo emita una instrucción y antes de que llegue a la red. Una acción fuera de alcance no se desaconseja: es imposible.
Si un proveedor no puede explicar concretamente qué está su agente estructuralmente impedido de hacer, no ha resuelto esto. Escribimos sobre las compensaciones operativas en pentesting automatizado seguro frente a agresivo.
La Verificación de Realidad de los Benchmarks
Antes del desglose plataforma por plataforma conviene encuadrar la base de evidencia, porque en esta categoría las cifras de benchmark se citan rutinariamente sin las condiciones que las produjeron.
De esa tabla se desprenden tres cosas.
El contexto determina el resultado, por un factor de seis. La misma clase de objetivo pasa del 87% a aproximadamente 7% según se suministre o no el aviso de la vulnerabilidad. CVE-Bench pasa de ~25% a 13% en el mismo eje. Cuando un proveedor cita una tasa de éxito, la única pregunta que importa es si al sistema se le dijo qué buscar.
La dificultad es un precipicio, no una pendiente. Los modelos de frontera rinden razonablemente en máquinas fáciles y muy fáciles de HackTheBox y puntúan aproximadamente cero en el nivel difícil. No hay degradación suave, lo que significa que el rendimiento en objetivos fáciles no predice nada sobre los difíciles.
La evaluación independiente escasea. Los resultados de benchmark de XBOW son autoreportados, como la mayoría de las cifras de proveedores de esta lista. Los benchmarks revisados por pares (Cybench, CVE-Bench, NYU CTF Bench) evalúan agentes de investigación, no productos comerciales en el mercado. Nadie ha publicado una evaluación rigurosa, independiente y directa entre las plataformas comerciales. Hasta que alguien lo haga, su propia prueba comparativa es la única evidencia aplicable a su entorno.
Lo más parecido a una comparación en el mundo real es el estudio ARTEMIS de diciembre de 2025: un agente de IA probado contra una red empresarial real de unos 8.000 hosts en 12 subredes junto a pentesters humanos. El agente encontró 9 vulnerabilidades válidas con una tasa de validez del 82%, quedó segundo en general y superó a 9 de los 10 evaluadores humanos. El mejor humano encontró 13 mediante encadenamiento creativo de exploits. El agente también generó más falsos positivos que todos los participantes humanos, y el estudio señaló que cerca del 70% de las vulnerabilidades web críticas son fallos de lógica de negocio que la IA no detecta de forma fiable. El coste operativo rondó los $18/hora frente a unos $60/hora de los evaluadores humanos.
Ese es el estado honesto del arte: competitivo en amplitud y coste, segundo lugar en techo y más ruidoso por el camino.
Las 10 Mejores, Clasificadas
Criterios de clasificación, declarados por adelantado y en el orden en que pesan: arquitectura de validación (¿puede la plataforma probar que un hallazgo es real sin que un modelo de lenguaje lo afirme?), control y auditabilidad (¿se impone el alcance estructuralmente y puede reproducirse el trabajo ante un auditor?), arquitectura de modelo y de encargo (construida a propósito para trabajo adversario de varios días, o un modelo general en un bucle), cobertura de superficie de ataque y encaje operativo para los equipos que deben operarla. La evidencia publicada pesa en todo el proceso, y las cifras autoreportadas se etiquetan como tales, incluidas las nuestras.
Las plataformas que resuelven problemas genuinamente distintos se clasifican por lo bien que resuelven el suyo. Un agente de razonamiento sobre código y un motor de explotación de red interna no compiten por el mismo puesto, y fingir lo contrario haría inútil la lista.
1. ThreatExploit (Sylas)
Clase: Modelo entrenado a propósito dentro de una arquitectura de encargo gobernada
Arquitectura. La afirmación distintiva es que Sylas es un modelo distinto, no un prompt distinto. Es un modelo de lenguaje especializado de dominio de aproximadamente 400.000 millones de parámetros, entrenado internamente durante unos seis meses sobre infraestructura de GPU propia en lugar de adaptado de un asistente general. Usa activación dispersa: solo se activa el subconjunto de parámetros relevante para una inferencia dada, del orden de 80.000 millones en cada momento. Eso es lo que hace asequibles las pruebas continuas, porque el coste de inferencia de operar un modelo de frontera a cadencia de encargo es la razón por la que los competidores empujan hacia encargos infrecuentes y de precio alto.
La activación dispersa es el mecanismo económico. Capacidad de frontera a una fracción del coste de inferencia que exigiría una activación densa con el mismo número de parámetros.
El corpus de entrenamiento importa más que el número de parámetros. Sylas se entrena sobre aproximadamente seis años de telemetría de ataques reales recogida en operaciones en vivo: cadenas de ataque completas, desde el compromiso inicial en un dispositivo perimetral hasta el movimiento lateral hacia sistemas internos. Son datos longitudinales a nivel de cadena, no escenarios sintéticos ni eventos aislados extraídos de bases públicas de vulnerabilidades. Un modelo entrenado con artículos puede describir una técnica. Un modelo entrenado con cadenas ha visto qué hace un operador cuando fallan los tres primeros intentos.
El modelo se sitúa dentro de un grafo de estados que conduce cada encargo por seis fases en un orden fijo que no puede saltarse.
Reconocimiento, enumeración y análisis se ejecutan de forma autónoma. La transición a explotación activa, el punto en el que el encargo deja de observar y empieza a actuar, requiere aprobación humana explícita.
El estado del encargo (alcance autorizado, inventario de hosts, servicios descubiertos, credenciales recuperadas, hallazgos y evidencias) se mantiene en un objeto estructurado y consultable en lugar de en una transcripción conversacional. Esta es la respuesta directa al problema de gestión de contexto descrito antes: al tercer día de una prueba grande el sistema lee de una base de datos, no de un registro de chat cada vez más inmanejable. El estado se persiste de forma continua, así que un encargo interrumpido se reanuda en lugar de reiniciarse, lo que significa que los hosts ya cubiertos no se vuelven a escanear y el entorno objetivo no absorbe tráfico duplicado. La enumeración y el análisis se reparten a subagentes aislados que trabajan por host o por servicio, cada uno con su propio contexto limpio, y los resultados se fusionan de forma centralizada.
Control y evidencia. Aquí es donde la plataforma está construida para ser cuestionada. Cada llamada a herramienta que toca un objetivo se valida en código contra un objeto de Reglas de Compromiso firmado y se rechaza si el objetivo cae fuera del alcance autorizado. El alcance no es una instrucción que se pide al modelo respetar; es una compuerta en la ruta de ejecución que el modelo no tiene forma de sortear hablando. Una acción fuera de alcance no se desaconseja, es imposible, y el intento aparece en la traza.
Los hallazgos están sujetos a una separación deliberada de funciones en software: el componente que descubre un hallazgo candidato no decide si es real. Un paso de validación distinto reexamina la evidencia capturada (pares de petición y respuesta, payloads, artefactos de respuesta, captura de sesión) y un candidato solo se promueve al informe cuando la ruta de explotación se reproduce contra el objetivo. Un comportamiento observado una vez y no reproducible se trata como no probado y se conserva como informativo en lugar de descartarse en silencio. Esa arquitectura de validación es lo que produce la tasa de verificación de hallazgos del 94%, frente a un rango documentado de 10-40% de falsos positivos en escáneres automáticos de vulnerabilidades. Cada decisión y cada invocación de herramienta se traza, produciendo un registro reproducible y con marca de tiempo: la columna vertebral probatoria que un auditor o una aseguradora pide cuando se cuestiona un hallazgo.
Cada encargo se ejecuta en su propio contenedor endurecido y dedicado, aprovisionado al inicio y destruido al terminar, sin estado compartido entre clientes. La inferencia corre sobre infraestructura propia; los datos del encargo no transitan por un proveedor de modelos de terceros y los datos de cliente no se usan para entrenar el modelo. Para compradores regulados esa suele ser la primera pregunta y la que decide si la conversación continúa.
En qué se diferencia del resto de esta lista. En tres cosas. Es la única plataforma aquí cuyo modelo fue entrenado a propósito sobre telemetría de ataques a nivel de cadena en lugar de adaptado de un modelo general. Dispone de inteligencia propia disponible para el modelo durante el encargo en lugar de añadida después: búsqueda en la dark web de credenciales expuestas, detección de dominios similares y de typosquatting, y escaneo continuo de la superficie de ataque externa, de modo que una prueba empieza sabiendo ya qué se ha expuesto sobre ese negocio en lugar de descubrir el perímetro en frío. Y está construida para la entrega por proveedores de servicios: informes con marca blanca en PDF, JSON y formatos estructurados, vistas ejecutiva y técnica, servidores dedicados de un solo inquilino con despliegue en América, Europa y Asia, y permisos por rol con claves API para CI/CD.
Los informes se mapean a los marcos con los que realmente se evalúa a los clientes: ISO 27001 (incluidos el Anexo A 8.8 y 8.29), SOC 2 (CC4.1 y CC7.1), PCI DSS v4.0 Requisito 11.4 y Cyber Essentials, siguiendo la metodología de la OWASP Testing Guide, el OWASP Top 10, NIST SP 800-115 y PTES.
Dónde falla. Expuesto en los mismos términos que el de los demás. No encuentra de forma fiable los fallos de lógica de negocio que constituyen cerca del 70% de las vulnerabilidades web críticas, y no sustituye el juicio de un evaluador sénior sobre el impacto de negocio, razón por la cual la validación humana antes de publicar el informe es obligatoria y no opcional en la arquitectura. La compuerta de aprobación humana antes de la explotación es un control genuino y también una restricción genuina de rendimiento: un encargo esperará a una persona. No existe una puntuación de benchmark de terceros publicada para Sylas, así que la tasa de verificación del 94% es una medición propia y debe tratarse igual que las cifras autoreportadas de XBOW: como una afirmación que hay que poner a prueba, no como un resultado auditado. Y la plataforma está orientada a proveedores de servicios y sus clientes; una empresa única que solo prueba su propio entorno puede encontrar irrelevante la maquinaria de entrega multiinquilino.
Mejor encaje. MSSP, telecos, proveedores de hosting y firmas de cumplimiento que entregan pruebas de penetración a muchas organizaciones cliente bajo su propia marca, y organizaciones reguladas que necesitan pruebas autónomas defendibles ante un auditor, una aseguradora o un cliente.
2. XBOW
Clase: Hacker agéntico autónomo (web y API)
Arquitectura. Agentes totalmente autónomos ejecutándose en paralelo contra un objetivo, manejando herramientas en bucles de planificar-actuar-observar, sin intervención humana durante la ejecución. Los textos de XBOW describen aleaciones de modelos: invocar dinámicamente distintos modelos dentro de un mismo hilo de conversación, sin que los modelos se conozcan entre sí, lo que permite aplicar fortalezas especializadas a distintas fases de un ataque sin fragmentar el contexto. Los hallazgos pasan por validadores: revisores automáticos que combinan revisión por LLM con verificación programática, como un navegador headless que confirma que un payload realmente se ejecutó. La puntuación de dominios selecciona objetivos usando presencia de WAF, códigos de respuesta HTTP, superficie de autenticación, número de endpoints y tecnologías detectadas. SimHash y hashing de imágenes deduplican objetivos casi idénticos.
Evidencia publicada. La más sólida de la categoría. En una ventana de 90 días finalizada en junio de 2025: 1.060 reportes de vulnerabilidades en HackerOne, de los cuales 54 críticos, 242 altos, 524 medios y 65 bajos, con 130 resueltos y 303 triados en el momento de la publicación, más 208 duplicados y 209 informativos. Ese último par es la parte honesta de la divulgación: cerca del 40% de los envíos no convirtió. El agente alcanzó el puesto #1 del ranking estadounidense de HackerOne en junio de 2025. Fundada por Oege de Moor, creador de GitHub Copilot y fundador de Semmle/CodeQL. $237M levantados, Serie C de $120M en marzo de 2026 por encima de $1.000M.
Dónde falla. Centrada en web y API; no es una herramienta para redes internas ni Active Directory. El alto volumen de envíos implica tasas de duplicados e informativos que un equipo de entrega debe absorber. Los resultados son autoreportados y el conjunto de benchmarks es propio de XBOW.
Mejor encaje. Pruebas ofensivas continuas de grandes patrimonios externos de web y API, y descubrimiento a volumen al estilo bug bounty.
3. Horizon3.ai NodeZero
Clase: Explotación autónoma contra infraestructura en producción
Arquitectura. NodeZero encadena credenciales débiles, malas configuraciones y brechas de identidad en rutas de ataque funcionales contra redes de producción reales, y reporta lo que efectivamente logró en lugar de lo que infirió. Horizon3.ai describe la plataforma como una combinación de aprendizaje por refuerzo, razonamiento sobre grafos y un corpus en expansión continua de datos adversarios reales recogidos en ejecuciones de producción. El motor seguro para producción es la afirmación central de ingeniería: la empresa declara que NodeZero se construyó ejecutando cientos de miles de pruebas seguras contra redes grandes y sensibles. En julio de 2026 la plataforma añadió pruebas autónomas de aplicaciones web que encadenan vulnerabilidades de aplicación con infraestructura, demostrando cómo una inyección SQL o un control de acceso roto escala hasta compromiso de host, control de dominio o exposición de datos. La cobertura abarca el OWASP Top 10, fallos complejos de control de acceso y técnicas basadas en credenciales.
Evidencia publicada. Serie E de $250M en agosto de 2026 co-liderada por NightDragon y NEA con una valoración reportada por encima de $2.000M; Serie D de $100M en junio de 2025. Participante del programa CAPT de la NSA. Las cifras de escala operativa de cientos de miles de pruebas en producción son declaradas por la propia empresa.
Dónde falla. La profundidad en la capa de aplicación es más reciente que su herencia en redes. La salida de rutas de ataque requiere un operador capaz de leerla; la plataforma presupone madurez de seguridad interna.
Mejor encaje. Validación de rutas de ataque en red interna, Active Directory, identidad y nube a escala empresarial, y organizaciones que necesitan prueba de explotabilidad contra producción sin provocar una caída.
4. Pentera
Clase: Motor determinista con capa de IA agéntica
Arquitectura. La arquitectura dual es el punto clave. Un motor de ataque determinista mantiene las pruebas repetibles, auditables y seguras en producción, mientras una capa de IA agéntica adapta los flujos de prueba e investigación a medida que cambian identidades, permisos y configuraciones. La plataforma es sin agente (no requiere instalación en endpoints) y orquesta ataques de cadena completa desde activos externos hasta la infraestructura central. División de producto: Pentera Core (redes internas), Surface (activos externos), Cloud (nube e híbrido) y Resolve (remediación, con hallazgos validados priorizados, asignados, seguidos y reprobados para confirmar que la corrección funcionó). Pentera 8, anunciado el 19 de marzo de 2026 con disponibilidad general en el segundo trimestre de 2026, introdujo Pentera Peer, una interfaz agéntica integrada para guiar pruebas adversarias e investigar hallazgos en lenguaje natural.
Evidencia publicada. Valoración por encima de $1.000M, aproximadamente $100M de ingresos recurrentes anuales y más de 1.200 clientes reportados. Larga presencia en Gartner Peer Insights. No publica tasas de éxito por técnica de ataque.
Dónde falla. El núcleo determinista que la hace segura también limita su techo: no inventará una cadena novedosa como sí hace ocasionalmente un agente sin restricciones. La capacidad agéntica es más nueva y más estrecha de lo que sugiere el marketing: Pentera Peer es principalmente una interfaz en lenguaje natural sobre un motor existente, no un hacker autónomo.
Mejor encaje. Empresas que necesitan validación repetible y auditable de forma programada, con seguimiento de remediación y reprueba integrados en la misma plataforma.
5. Terra Security
Clase: Agéntica, con humano en el bucle, continua
Arquitectura. Pentesting con IA agéntica construido explícitamente en torno a un modelo con humano en el bucle en lugar de autonomía total, con agentes que construyen y retienen contexto por objetivo a lo largo de ciclos de prueba continuos en vez de empezar de cero en cada ejecución. Durante 2026 Terra se extendió desde aplicaciones web hacia fuera, anunciando pentesting agéntico continuo de red interna en vista previa con socios de diseño, posicionándose como cobertura continua de las cuatro superficies de ataque principales.
Evidencia publicada. Serie A de $30M en septiembre de 2025 liderada por Felicis con Dell Technologies Capital, SYN Ventures, LAMA Partners y Underscore VC; $38M en total. Clientes Fortune 500 reportados. Sin resultados de benchmark publicados.
Dónde falla. Es la plataforma más joven de esta lista a escala, con cobertura de red interna todavía en vista previa al momento de escribir. El diseño con humano en el bucle es una fortaleza genuina para la calidad de hallazgos y una restricción genuina para el rendimiento.
Mejor encaje. Equipos de seguridad que quieren cobertura agéntica continua pero no aceptan hallazgos autónomos sin revisar.
6. RunSybil
Clase: Hacker agéntico autónomo (continuo, aplicaciones en vivo)
Arquitectura. Sybil ejecuta pruebas de penetración autónomas continuas contra aplicaciones en vivo, encontrando, explotando y documentando vulnerabilidades sin humano en el bucle. La procedencia del equipo es el diferenciador a señalar: fundada por el primer contratado de seguridad de OpenAI, con antiguos miembros del red team de Meta. Esa combinación de ingeniería de agentes de laboratorio de frontera y práctica de seguridad ofensiva es rara, y se nota en el énfasis en la explotación autónoma frente al flujo de trabajo asistido.
Evidencia publicada. $40M levantados, liderados por Khosla Ventures. Sin resultados de benchmark publicados ni evaluación independiente disponible al momento de escribir.
Dónde falla. Es la empresa en fase más temprana de esta lista. La postura de autonomía total significa que la arquitectura de validación es todo el riesgo del producto, y no ha sido documentada públicamente como la de XBOW. Pídala directamente en una evaluación.
Mejor encaje. Equipos cómodos con adoptar temprano, que quieren pruebas autónomas continuas de aplicaciones en vivo y pueden validar la salida por sí mismos.
7. Hadrian Nova
Clase: Pentesting agéntico sobre gestión de superficie de ataque externa
Arquitectura. Nova, lanzado en RSAC 2026 en marzo, extiende la plataforma de gestión de exposición externa de Hadrian con pruebas de penetración autónomas bajo demanda. La apuesta arquitectónica es que la capa de descubrimiento alimenta la capa de explotación: los activos y su contexto ya están enumerados y monitorizados de forma continua, así que el agente arranca con una imagen rica en contexto en lugar de reconocimiento en frío. Nova ejecuta pruebas de alcance completo (reconocimiento, explotación, hallazgos validados) en horas, con alcance controlado por el cliente, repetibilidad, ejecución transparente y colaboración entre humanos e IA para revisión experta. Incluye soporte de cumplimiento para organizaciones con requisitos de auditoría.
Evidencia publicada. Líder de ASM según GigaOm durante tres años consecutivos para la plataforma subyacente. Nova es nuevo; sin resultados de benchmark publicados.
Dónde falla. Orientado al exterior por diseño; no es una herramienta para red interna. La capa agéntica es la parte más nueva de un producto de ASM maduro, así que evalúe ambas por separado.
Mejor encaje. Organizaciones que ya operan gestión continua de superficie de ataque externa y quieren explotación validada sobre el mismo inventario de activos en vez de un encargo separado.
8. OpenAI Aardvark (ahora Codex Security)
Clase: Agente de razonamiento sobre código
Arquitectura. Un enfoque fundamentalmente distinto a todo lo anterior. Aardvark analiza continuamente repositorios de código fuente para identificar vulnerabilidades, evaluar explotabilidad, priorizar severidad y proponer parches concretos. Lee el código en lugar de sondear el sistema en ejecución, lo que significa que alcanza clases de fallo que las pruebas de caja negra no pueden alcanzar estructuralmente, y pierde todo lo que solo se manifiesta en tiempo de ejecución o en la configuración desplegada. Anunciado en octubre de 2025 como investigador de seguridad agéntico impulsado por GPT-5; desde marzo de 2026 se llama Codex Security, disponible como vista previa de investigación para clientes de ChatGPT Enterprise, Business y Edu.
Evidencia publicada. OpenAI ha publicado descripciones de capacidades y detalles de acceso anticipado en lugar de resultados comparativos de benchmark.
Dónde falla. Requiere acceso al código fuente, así que es inútil para probar terceros o alcances de caja negra. No es una prueba de penetración en sentido de cumplimiento: produce hallazgos de código y parches, no explotación demostrada de un sistema desplegado. El acceso está limitado a vista previa de investigación.
Mejor encaje. Organizaciones de ingeniería que quieren revisión de seguridad continua dentro del ciclo de desarrollo, ejecutándose junto a una plataforma de caja negra y no en su lugar.
Big Sleep es una colaboración de DeepMind y Project Zero centrada en fallos de seguridad de memoria en bases de código de producción. No se clasifica aquí porque no se puede comprar, pero define el techo de la clase de caja blanca. En noviembre de 2024 encontró un buffer underflow en SQLite que tanto OSS-Fuzz como la propia suite de pruebas de SQLite habían pasado por alto, el primer día cero creíble descubierto por IA en software de producción. Para agosto de 2025 había reportado 20 vulnerabilidades en proyectos de código abierto muy usados, incluidos FFmpeg e ImageMagick, y posteriormente encontró CVE-2025-6965 en SQLite. En las pruebas de buffer overflow de CyberSecEval2 el enfoque subyacente reportó una mejora de 20x sobre la línea base.
Su evidencia es la más sólida de este artículo y no está cerca: son CVE reales en software real con rastro público de divulgación, un estándar materialmente más alto que cualquier benchmark autoreportado por un proveedor. También es estrecho por diseño: clases de fallos de seguridad de memoria, no lógica de negocio, no autorización en aplicaciones web, no rutas de ataque de identidad. Úselo como vara de medir de lo que puede lograr el descubrimiento agéntico riguroso y acotado, y sea escéptico con cualquier plataforma comercial que afirme una calidad de evidencia comparable.
9. Mindgard
Clase: Red teamer dirigido a IA
Arquitectura. Mindgard prueba sistemas de IA en lugar de usar IA para probar sistemas convencionales: red teaming automatizado y pruebas de seguridad continuas para LLM, agentes de IA y modelos multimodales, posicionado como DAST para IA. En marzo de 2026 añadió un módulo de reconocimiento que descubre barreras de IA, prompts de sistema, herramientas, integraciones y servicios externos antes de probarlos. Las pruebas son continuas en lugar de puntuales, con hallazgos mapeados a MITRE ATLAS y a las categorías OWASP LLM para reportes.
Evidencia publicada. Plataforma comercial con precios de suscripción anual de cinco cifras y pruebas adversarias gestionadas disponibles. Las alternativas de código abierto en esta clase están bien establecidas: Garak de NVIDIA (más de 50 sondas), PyRIT de Microsoft (orquestación de ataques multi-turno) y Promptfoo (red teaming definido en YAML dentro de CI).
Dónde falla. Trabajo completamente distinto: no probará su red ni sus aplicaciones web. Si su única exposición a IA es un chatbot en un sitio de marketing, Garak o Promptfoo en CI probablemente le cubran gratis.
Mejor encaje. Organizaciones que envían funcionalidades con LLM o agentes a clientes, especialmente donde se necesita mapeo a MITRE ATLAS o al OWASP LLM Top 10 para gobernanza. HackerOne reportó un aumento interanual del 540% en reportes de inyección de prompts, así que esta superficie está siendo sondeada la pruebe usted o no. Cubrimos las clases de ataque en pentesting de aplicaciones de IA agéntica y seguridad de LLM.
10. El Nivel de Código Abierto
Clase: Frameworks de agentes autoalojados
Tratar esto como una sola entrada es deliberado: estos proyectos se mueven demasiado rápido para que una clasificación individual se sostenga, y la decisión relevante es si autoalojar o no.
PentAGI es el proyecto más popular de la categoría (más de 14.700 estrellas), escrito en Go con frontend en React. Cuatro subagentes (Searcher, Coder, Installer, Pentester), ejecución en sandbox Docker, PostgreSQL y pgvector para memoria semántica, soporte de LiteLLM con más de 12 proveedores, licencia MIT. Strix (Apache 2.0) aporta manipulación de proxy HTTP, automatización de navegador, sesiones de terminal, un entorno Python de explotación e integración con CI/CD. CAI de Alias Robotics soporta más de 300 backends de modelos, incluidos modelos autoalojados para entornos aislados, la única opción realista cuando los datos no pueden salir de su red. PentestGPT (más de 12.500 estrellas, Premio a Artefacto Distinguido en USENIX Security 2024) usa tres módulos que interactúan entre sí y sigue con humano en el bucle: aconseja, usted ejecuta. Shannon reportó 96,15% (100/104) en una versión depurada del benchmark de XBOW, el mayor resultado de benchmark divulgado públicamente en código abierto.
También conviene saber: los finalistas de DARPA AIxCC liberaron sus sistemas de razonamiento cibernético. Atlantis del Team Atlanta ganó $4M con aprendizaje por refuerzo multiagente combinado con análisis simbólico; Buttercup de Trail of Bits quedó segundo con un sistema de cuatro partes que cubre 20 de los 25 CWE más peligrosos de DARPA, diseñado para ejecutarse en un portátil; Theori quedó tercero y liberó su sistema completo. En las finales, la detección subió del 37% en semifinales al 86%, a aproximadamente $152 por tarea.
Dónde falla. Usted asume la orquestación, los costes de modelo, el perímetro de seguridad y el triaje de falsos positivos. No hay proveedor al que llamar, ni plantilla de informe lista para cumplimiento, ni responsabilidad profesional. El tiempo de ingeniería para operar esto bien contra entornos de clientes suele superar el coste de licencia de una plataforma comercial.
Mejor encaje. Investigación, red teams internos con capacidad de ingeniería, entornos aislados (CAI) y cualquiera que necesite entender estos sistemas desde dentro antes de comprar uno.
Comparación Resumida
Ocho Preguntas Técnicas Que Separan Plataformas Reales de Demostraciones
Las listas de funcionalidades no discriminan aquí. Estas ocho preguntas sí, porque un proveedor o tiene una respuesta concreta o no tiene la capacidad.
La pregunta 4 merece énfasis. Es la de mayor apalancamiento en toda la evaluación, y casi nadie la hace. La distancia entre "encontró el fallo" y "explotó el fallo que le describimos" es la distancia entre una prueba de penetración y una herramienta automática de verificación de parches.
Categorías Que Se Clasifican Mal Como Pentesting con IA
Tres categorías adyacentes aparecen rutinariamente en comparativas de pentesting con IA. Son productos útiles que responden preguntas distintas, y comprar uno esperando el otro es un error común y caro.
Categorías Adyacentes
Simulación de brechas y ataques (Picus, Cymulate, SafeBreach, AttackIQ). Reproducen comportamientos de ataque conocidos contra sus controles y responden ¿mis defensas detectan y bloquean esto? No responden ¿puede un atacante comprometer este sistema? Los marcos de cumplimiento que exigen pruebas de penetración generalmente no aceptan la salida de simulación en su lugar. La distinción importa lo suficiente como para dedicarle un artículo completo: escaneo de vulnerabilidades frente a pruebas de penetración.
PTaaS colaborativo e híbrido (Cobalt, Synack, Bugcrowd, HackerOne). Investigadores humanos con IA aplicada al triaje, la deduplicación y la gestión de plataforma en lugar de a la explotación. Excelente para pruebas creativas con mucha lógica de negocio, donde los humanos mantienen una ventaja decisiva, y con precio acorde. HackerOne reportó $81M en recompensas en 2025, un 13% más interanual, junto a más de 560 reportes válidos de agentes totalmente autónomos: los dos modelos están convergiendo en las mismas plataformas.
Gestión de superficie de ataque externa (Detectify, y la plataforma subyacente de Hadrian). Descubrimiento y monitorización continua de lo que usted expone. Es entrada necesaria para una prueba de penetración, no sustituto de una. Saber que un activo existe no es saber si puede ser comprometido.
Sobre Clasificarnos en Primer Lugar
Conviene abordarlo directamente, porque un lector debería descontar que un proveedor clasifique su propio producto en lo más alto de su propia lista, y preferimos defender el argumento a confiar en que nadie lo note.
El caso se apoya en cuatro cosas comprobables en lugar de afirmadas. Sylas es un modelo entrenado a propósito y no un modelo general tras un prompt de seguridad, y el corpus de entrenamiento (unos seis años de telemetría de ataques a nivel de cadena de operaciones en vivo) es la parte del proceso que no admite atajos. El alcance se impone en código en la frontera de herramientas contra un objeto de Reglas de Compromiso firmado, lo que es una garantía estructuralmente distinta de una instrucción en el prompt. El descubrimiento y la validación están separados en software, con la reproducibilidad como criterio de promoción, que es lo que debe significar una tasa de verificación del 94% si significa algo. Y cada decisión se traza en un registro reproducible, que es lo que realmente pide un auditor o una aseguradora cuando se disputa un hallazgo.
Lo que esa clasificación no afirma: que Sylas supere a XBOW explotando objetivos web externos, donde el historial de XBOW en HackerOne es la evidencia pública más sólida que ha producido cualquier plataforma de esta lista. Que iguale el historial operativo de NodeZero contra grandes redes de producción. Ni que tenga una puntuación de benchmark revisada por pares, que no la tiene. En explotación autónoma pura de un entorno web externo difícil, XBOW es la referencia a batir y así se lo diríamos a un cliente.
La clasificación refleja la combinación que decide encargos reales en entrega regulada: pruebas que puede ejecutar de forma continua y hallazgos que puede defender después. Si su problema es puramente encontrar el máximo número de fallos web en un entorno expuesto a internet y tiene capacidad interna para triarlos, pondere la lista de otra manera, y use las ocho preguntas anteriores en lugar del orden de nadie, incluido el nuestro.
Cómo Ejecutar la Prueba Comparativa
Nadie ha publicado una evaluación independiente y directa de estas plataformas, así que ejecute la suya. Lleva unas dos semanas y resuelve la cuestión de forma definitiva para su entorno.
Elija un objetivo que un humano competente haya probado recientemente, para tener una línea base conocida. Ejecute dos o tres plataformas preseleccionadas contra el mismo alcance y registre cuatro cosas de cada una: hallazgos que coinciden con la línea base humana, hallazgos que el humano pasó por alto, falsos positivos y reproducibilidad de las pruebas de concepto. Luego observe con más atención lo que cada plataforma no encontró. Pasar por alto fallos de lógica de negocio es esperable y perdonable. Pasar por alto una inyección estándar o un bypass de autorización dentro del alcance es un problema de capacidad, no una limitación de la categoría.
Corrija dos hallazgos y repruebe para ver si la plataforma identifica correctamente la corrección y detecta una incompleta. Envíe un informe real generado a quien firma su evidencia de cumplimiento y pregunte directamente si lo aceptaría. Después calcule el coste total de operar la plataforma durante un año, incluyendo las horas humanas dedicadas a triar falsos positivos: el estudio ARTEMIS encontró que los agentes de IA produjeron más falsos positivos que todos los participantes humanos, y ese tiempo de triaje es una partida real que ninguna cotización de proveedor incluye.
El Resumen Honesto
La categoría cruzó un umbral real en los últimos dieciocho meses. Un agente de IA ocupó el primer puesto del ranking estadounidense de HackerOne. Otro encontró un día cero en SQLite que la infraestructura profesional de fuzzing había pasado por alto. Un tercero superó a 9 de 10 pentesters humanos en una red empresarial real de 8.000 hosts a aproximadamente un tercio del coste por hora. Nada de eso era cierto hace dos años.
También es cierto que esos mismos sistemas puntúan aproximadamente cero en máquinas difíciles de HackTheBox, explotan alrededor del 13% de los CVE reales cuando tienen que encontrar el fallo por sí mismos, y pasan por alto la mayoría de los fallos de lógica de negocio, que son la mayoría de las vulnerabilidades web críticas. Todos los resultados destacados de este artículo mantuvieron revisión humana antes de su envío o publicación.
Hay además una brecha que las cifras de financiación ocultan. La mediana del sector para remediar un hallazgo es de 37 días frente a una mediana de permanencia del atacante de 14 días, y el 31% de los hallazgos altos y críticos del corpus de Cobalt de 2026, con más de 16.500 pruebas de penetración, quedó sin resolver. Descubrir más rápido no ayuda a una organización que no puede cerrar lo que ya conoce. Las plataformas que merecen comprarse son las que acortan todo el ciclo (encontrar, probar, corregir, reprobar), no solo la mitad del hallazgo.
Elija la plataforma cuya arquitectura coincida con la superficie de ataque que realmente necesita cubrir. Haga las ocho preguntas. Ejecute la prueba comparativa contra una línea base conocida. Y descuente con severidad a cualquier proveedor cuyas cifras de benchmark lleguen sin las condiciones que las produjeron, incluidos nosotros.
Para un marco más amplio de evaluación de esta categoría más allá de las plataformas concretas, consulte nuestra guía de evaluación de pentesting con IA, y para la razón de fondo por la que las pruebas con IA cubren terreno que los humanos no pueden, consulte la ventaja del paralelismo.
Preguntas Frecuentes
¿Cuál es la mejor plataforma de pentesting con IA en 2026?
Depende de lo que necesite que la plataforma demuestre. ThreatExploit ocupa el primer puesto de esta lista por la combinación que más importa en entrega regulada: un modelo entrenado a propósito de 400.000 millones de parámetros en lugar de un modelo general tras un prompt de seguridad, alcance impuesto en código en la frontera de herramientas en lugar de instruyendo al modelo, una compuerta explícita de aprobación humana antes de cualquier explotación activa, y una traza de ejecución completamente reproducible detrás de cada hallazgo. XBOW lidera en explotación autónoma pura de web y APIs con la evidencia pública más sólida en bug bounty. NodeZero de Horizon3.ai lidera en rutas de ataque sobre redes internas, Active Directory e identidad. Pentera lidera en validación determinista y auditable de forma calendarizada. Mindgard lidera en probar los propios sistemas de IA. Elija la clase de plataforma según la superficie de ataque que necesita cubrir y verifíquelo con una prueba comparativa contra una línea base conocida.
¿Qué tan precisas son las herramientas de pentesting con IA?
Depende por completo del contexto, y las cifras publicadas están muy separadas. En CVE-Bench, un benchmark revisado por pares con 40 CVE web críticos del mundo real, los mejores frameworks de agentes explotan alrededor del 13% de los objetivos sin descripción de la vulnerabilidad y cerca del 25% cuando se les proporciona la descripción. Investigaciones anteriores reportaron 87% de éxito en CVE de un día cuando se suministraba el texto del aviso, y aproximadamente 7% sin él. En el estudio ARTEMIS de diciembre de 2025 sobre una red real, un agente de IA encontró 9 vulnerabilidades válidas con una tasa de validez del 82% y superó a 9 de 10 evaluadores humanos, aunque generó más falsos positivos que todos los participantes humanos. Trate cualquier cifra aislada de precisión como carente de significado hasta saber si la vulnerabilidad fue descrita de antemano.
¿Puede el pentesting con IA reemplazar a los pentesters humanos en 2026?
No, y la brecha medida es específica, no general. Los agentes de IA ya son competitivos o mejores en amplitud, velocidad, clases de vulnerabilidad conocidas y descubrimiento de errores de seguridad de memoria. Siguen siendo débiles en fallos de lógica de negocio, que representan aproximadamente el 70% de las vulnerabilidades web críticas, en cadenas de explotación de más de unos cinco pasos, en flujos que dependen de interfaz gráfica y al juzgar el impacto de negocio. Todos los resultados destacados de XBOW, Google Big Sleep y el estudio ARTEMIS mantuvieron revisión humana antes de publicar o enviar los hallazgos.
¿Cuál es la diferencia entre pentesting autónomo y simulación de brechas y ataques?
Las plataformas de simulación de brechas y ataques como Picus, Cymulate y SafeBreach reproducen comportamientos de ataque conocidos contra sus controles para responder si sus defensas los detectan y bloquean. Las plataformas de pentesting autónomo intentan explotación real para responder si un atacante puede comprometer el objetivo. Responden preguntas distintas y producen evidencia distinta. Los marcos de cumplimiento que exigen pruebas de penetración generalmente no aceptan la salida de una simulación como sustituto de la explotación demostrada.
¿Hace falta un modelo construido a propósito, o basta un modelo general con un buen prompt?
Un modelo general con un prompt de seguridad falla por tres razones estructurales, no por conocimiento. Primero, una prueba de penetración corre durante horas o días contra un entorno que cambia por debajo, así que el estado del encargo debe vivir en un objeto estructurado y consultable, no en un historial de conversación que se degrada y desborda. Segundo, el alcance debe imponerse en código en la frontera de herramientas, porque una instrucción a nivel de prompt es algo con lo que se puede discutir al modelo. Tercero, cada hallazgo debe sobrevivir al escrutinio de un auditor o una aseguradora, lo que exige una traza reproducible de las llamadas exactas que lo produjeron. El modelo Sylas de ThreatExploit está entrenado sobre unos seis años de telemetría de ataques a nivel de cadena en lugar de sobre artículos, así que ha visto cómo se desarrollan los ataques de principio a fin en lugar de leer descripciones de ellos.
