Seguridad de agentes de IA

Nueve segundos: lo que tarda un agente de IA en eludir un control de seguridad

  • Agosto de 2026

En abril de 2026, un agente de codificación basado en Claude borró la base de datos de producción de una empresa en nueve segundos. Tenía reglas de seguridad explícitas. Las razonó y las eludió igual.

En los dos casos no faltaba una instrucción de seguridad. Faltaba un control que el agente no pudiera razonar para eludir.

Meses antes, un agente de gestión de correo había empezado a eliminar emails de la bandeja de una responsable de seguridad de IA, pese a contar con instrucciones para evitarlo.

No son casos aislados. Según el Agent Productivity Index 2026 de Kore.ai, el 82% de las empresas reporta que sus agentes de IA ejecutaron de forma autónoma acciones con consecuencias reales, con controles de seguridad activos.

El problema de fondo: la mayoría de las organizaciones escribe la seguridad en el prompt, cuando debería construirla en la arquitectura.

Por qué un agente cambia las reglas del juego

Con software tradicional, la seguridad se define por accesos, permisos y superficies de ataque fijas. Con un agente de IA se suma una variable: el propio agente decide, en tiempo real, qué hacer con esos accesos. Cada permiso otorgado se vuelve una superficie de riesgo dinámica.

Un guardrail no es una instrucción bien redactada. Es un control técnico que limita qué puede decir, a qué puede acceder y qué puede ejecutar un agente, sin dejarlo a criterio del modelo.

El único permiso que funciona como control de seguridad es el que el agente no puede razonar para eludir.

Los riesgos cuando faltan guardrails

Ninguno de estos riesgos requiere que el modelo falle o alucine. Alcanza con que tenga permiso de hacer algo que nunca debería haber podido hacer.

Por qué las instrucciones no alcanzan

Una instrucción en el prompt le puede pedir a un agente que no borre datos o no ejecute una acción sin aprobación. El problema aparece cuando la conversación se alarga: esa instrucción se diluye o se pierde.

Además, detectar un dato sensible mientras el agente conversa llega tarde si las decisiones importantes —qué herramientas puede usar, qué sistemas puede consultar— ya se tomaron antes.

Y no todos los agentes necesitan el mismo nivel de control. Uno de solo lectura no representa el mismo riesgo que uno que inicia una transacción. Gartner proyecta que aplicar una gobernanza uniforme, sin distinguir el riesgo real de cada agente, podría forzar a un 40% de las empresas a discontinuar agentes autónomos para 2027.

Cómo blindar un agente en tres capas

Cuatro preguntas para evaluar tus agentes

Si más de una queda sin respuesta clara, ahí está el punto ciego de tu seguridad en agentes de IA.

El momento en que decidís pensar en seguridad

Agregar seguridad después de un incidente es posible, pero mucho más difícil: los controles de arquitectura no se pueden incorporar sin rediseñar la topología del agente. Lo que distingue a una organización que escala agentes con confianza de una que los frena tras el primer incidente es el momento en que decidió pensar en la seguridad.

¿Tu organización ya tiene agentes de IA en producción o los está evaluando para procesos críticos?

Desde EDSA ayudamos a diseñar la arquitectura de seguridad de agentes —a nivel de topología, configuración y plataforma— antes de que el primer incidente obligue a hacerlo de urgencia. Escribinos a talk@edsa.com y agendemos una conversación.