El 75% dice que sus agentes son seguros de extremo a extremo. El 88% tuvo un incidente igualmente

12 de septiembre de 2026
12 min de lectura

12 de septiembre de 2026
12 min de lectura
Hay un tipo concreto de hallazgo de encuesta que vale más que el titular que recibe, y Harness publicó uno el 10 de septiembre de 2026.
Cuatro preguntas, planteadas de cuatro maneras, produjeron siempre la misma forma: una gran mayoría está segura y una pequeña minoría tiene el control que haría cierta esa seguridad. Eso es lo corriente. Lo que no es corriente es lo que ocurrió al comprobar los resultados reales del grupo confiado.
The State of Agent DLC 2026, realizada por Sapio Research para Harness en julio de 2026: 700 profesionales de tecnología, todos en organizaciones de más de 1.000 empleados, más de 100 desarrolladores y más de 100 millones de dólares de facturación anual, en Estados Unidos, Reino Unido, Francia, Alemania e India.
Una regla de filtrado hace casi todo el trabajo a la hora de leerla: se excluyó a quien no había adoptado agentes. Todos los encuestados ya tenían agentes en producción, en piloto o en prueba de concepto. Esto no es una encuesta sobre si las empresas adoptarán agentes. Es una encuesta a las que ya lo hicieron, y eso la convierte en la mejor aproximación pública a su comprador.
El marco que propone Harness resulta útil aunque usted no les compre nada: el Agent DLC, el ciclo de vida de construir, probar, asegurar, desplegar y gobernar un agente, distinto del ciclo de vida del software en el que ese agente participa. Existe, en sus palabras, porque "el comportamiento de un agente varía de una ejecución a otra, y las pruebas y comprobaciones de entrega estándar no se diseñaron para ese tipo de variabilidad".
La confianza y el control que hay debajo
Cada par es una pregunta sobre la creencia y otra sobre el mecanismo
Cada uno de esos pares es la distancia entre una afirmación y aquello que la haría comprobable. El del inventario es el más limpio: 33 puntos de la población creen saber qué está corriendo porque nadie les ha dicho lo contrario.
Cualquiera de esos pares admite una explicación benévola. Un equipo puede tener un inventario real sin herramientas de descubrimiento si el parque es lo bastante pequeño como para caber en la cabeza. La confianza puede ser merecida en lugar de supuesta.
Así que la pregunta útil es si al grupo confiado le va mejor. Harness informa de que el 75% afirma que sus agentes son seguros de extremo a extremo y de que ese grupo sufrió incidentes de seguridad en un 88%, frente al 87% de la muestra completa.
Creerse seguro movió la tasa de incidentes un punto, en la dirección equivocada. La confianza no es un indicador adelantado de nada.
Un punto sobre una muestra de 700 personas es ruido; la lectura honesta no es que la confianza haga daño, sino que no guarda relación con el resultado. Ese resultado es más fuerte y más incómodo que cualquiera de las brechas por separado, porque elimina la defensa evidente. Un equipo no puede mirar el 44% de descubrimiento y concluir que pertenece a la fracción competente basándose en sentirse competente. Sentirse competente es justo lo que no distingue a los dos grupos.
También fija la tasa base: el 87% de estas organizaciones tuvo un incidente de seguridad relacionado con agentes en el último año. No un riesgo. Un incidente, ya ocurrido, en casi siete de cada ocho.
La historia tranquilizadora es que se trata de una fase. Todo cambio de plataforma adelanta a sus controles y luego los controles alcanzan. Keith Mann, Field CTO y responsable de investigación de Harness, señala el motivo por el que aquí esa historia podría no sostenerse:
Keith Mann, Field CTO y responsable de investigación de Harness
La nube y el móvil pasaron por una fase en la que la confianza adelantó a la gobernanza, pero al final los controles alcanzaron porque los sistemas de abajo seguían siendo predecibles una vez construida la barrera. Los agentes no se están quietos del mismo modo.
Ese es todo el argumento técnico en una frase, y es correcto. Una barrera funciona cuando la misma entrada produce el mismo comportamiento, de modo que una prueba que pasó ayer significa algo hoy. El comportamiento de un agente varía de una ejecución a otra: el mismo prompt, distintas llamadas a herramientas, distinto camino y, a veces, distinto resultado. Una prueba que muestrea el comportamiento una vez y lo declara seguro está midiendo una extracción de una distribución y presentándola como un hecho.
Las cifras de proceso de la encuesta muestran la consecuencia. Solo el 53% pasa los cambios de sus agentes por pipelines estándar antes de producción, el 37% mete menos de la mitad de sus cambios por algún pipeline establecido, el 42% hace pasar las ediciones de prompts por pipelines de código y apenas el 34% tiene un sistema dedicado para la configuración de IA. Más del 40% decide caso por caso si un cambio es de fiar.
Esto último es el mecanismo que hay detrás de cada brecha de la sección 2. Una decisión caso por caso no se puede auditar, no se puede delegar y no se le puede enseñar a un comprador. Es también la razón de que el 58% registre más incidentes en producción por cada 100 cambios desde que despliega agentes: subió el volumen de cambios y la puerta no.
Esta es la parte sobre la que yo actuaría esta semana. Su comprador está entre esos 700. De ahí salen tres cosas.
Hay también una lectura comercial: el 76% dijo a Harness que ve valor alto o moderado en una plataforma unificada de control. La demanda de la capa de gobernanza es real. Y es exactamente lo que vende quien publica la encuesta, lo que nos lleva a cuánto de esto conviene creer.
La mayoría de fundadores que lean esto no son la empresa de 1.000 empleados. Son tres personas con cuatro agentes en producción, y la buena noticia sincera es que cada uno de estos controles es barato ahora y caro después. En el orden en que yo los construiría:
Ninguno de estos es una plataforma. Son una tarde cada uno, y son la diferencia entre un producto con agentes que puede vender a un comprador prudente y otro que solo puede demostrar.
Dicho sin rodeos, porque aquí la norma de la casa es que la procedencia de una cifra viaja con ella:
Cómo descontar la encuesta
Harness vende los controles que faltan. Es una encuesta encargada por un proveedor cuyos hallazgos apuntan todos a un plano de control unificado, que es el producto. Eso no hace que las cifras sean falsas —Sapio es una casa de campo independiente, la muestra es grande y el filtrado se declara—, pero sí significa que las preguntas las eligió alguien que ya tenía la respuesta. Léala como una buena descripción de una brecha, no como un juicio neutral sobre qué la cierra.
Tres advertencias más que conviene llevarse:
Todo es autodeclarado. Las dos mitades de cada par son lo que dijo un encuestado, incluidas las tasas de incidentes. La comparación del 88% frente al 87% resiste eso mejor que las cifras absolutas: el sesgo que lleva a exagerar los controles debería llevar también a minimizar los incidentes, en ambos grupos.
Julio queda lejos. El trabajo de campo es de julio de 2026 y el mercado de herramientas para agentes se ha movido dos veces desde entonces. Parte de ese 19% con puerta automática es simplemente que las puertas aún no existían.
Esas no son sus restricciones. Más de 1.000 empleados, más de 100 desarrolladores, más de 100 millones de facturación. Una empresa de doce personas no necesita el aparato de gobernanza que este informe vende de forma implícita. Necesita las cuatro cosas de la sección 6, y necesita que funcionen de verdad.
Una respuesta directa según el caso
La brecha es una oportunidad para exactamente uno de estos grupos
Las cuatro brechas de este informe son la historia que todo el mundo citará, y son reales: la mayoría de los equipos no puede enumerar sus agentes, no puede bloquear automáticamente una entrega defectuosa, no puede demostrar un camino de apagado y no puede decir cuánto cuesta un agente por unidad de trabajo.
Pero el hallazgo que hay que guardarse es el plano. La seguridad autoevaluada no predijo nada sobre los incidentes —88% frente a 87%, es decir, ninguna señal—. Todo lo que un comprador empresarial le cuente sobre sus controles, y todo lo que usted se cuente sobre los suyos, acaba de demostrarse poco informativo por sí solo.
Lo que deja un único movimiento duradero: sustituir la afirmación por el artefacto. No "tenemos un inventario", sino un registro que emite las credenciales. No "podríamos apagarlo", sino la lectura del cronómetro de la última vez que lo hizo. Los equipos que parecerán competentes en la edición del año que viene de esta encuesta son los que puedan enseñar, no decir, y a escala de fundador eso sigue siendo una semana de trabajo y no una migración de plataforma.
Fuentes: Harness, "The State of Agent DLC 2026" · PR Newswire, "New Harness Report Reveals Enterprise Confidence in AI Agents Isn't Backed by Real Controls", 10 de septiembre de 2026 · Encuesta realizada por Sapio Research en julio de 2026 entre 700 profesionales de tecnología de organizaciones con más de 1.000 empleados, más de 100 desarrolladores y más de 100 millones de dólares de facturación en Estados Unidos, Reino Unido, Francia, Alemania e India; se excluyó a quien no había adoptado agentes. Todas las estadísticas y las dos citas de directivos son las publicadas por Harness y proceden de las respuestas autodeclaradas. La lectura de la confianza como algo no relacionado con el resultado, el descuento de la sección 7 y todas las recomendaciones son míos. Para la misma brecha medida de otra manera, vea el 85,5% de los ingenieros confía en sus agentes y la mitad tiene problemas a diario.
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.