Inteligencia artificial · 10 min

Seguridad y observabilidad de agentes de IA

Qué necesita una empresa para operar agentes con control: permisos de mínimo privilegio, aprobaciones, logs y monitoreo de costos y fallos.

Resumen clave

Un agente es un sistema con permisos, no un chatPermisos de mínimo privilegio y aprobaciones por riesgoCada acción debe ser trazable y monitoreable

Un agente empresarial es un sistema con permisos, no un chat

Un agente de IA consulta herramientas, prepara respuestas y ejecuta acciones dentro de límites definidos. Esa capacidad de actuar es lo que lo hace útil y también lo que crea riesgo: cada acción necesita un permiso, un registro y, según el impacto, una aprobación humana.

El nivel de control no es opcional ni «de empresas grandes»: es lo que separa un agente operativo de una demostración. Un agente sin permisos, logs y límites no está listo para producción.

Capas de control de un agente

El control de un agente se diseña en capas. Cada capa limita lo que el agente puede ver, usar y ejecutar.

CapaQué controla
Identidad y alcanceQuién (qué usuario u organización) usa el agente y para qué proceso está autorizado.
HerramientasQué integraciones puede invocar y con qué credenciales (mínimo privilegio, no las del usuario humano).
AccionesQué puede ejecutar directamente y qué requiere aprobación previa.
DatosQué fuentes puede consultar según el perfil y qué puede escribir o modificar.
SalidaQué se muestra al usuario y qué queda registrado para revisión.

Permisos: mínimo privilegio y aprobaciones

El principio es simple: el agente debería tener el acceso mínimo para cumplir su tarea, no el acceso del sistema completo. Eso reduce el daño posible ante un error, una entrada maliciosa o una configuración incorrecta.

Las acciones se clasifican por reversibilidad e impacto. Las reversibles y de bajo impacto pueden ejecutarse con registro; las irreversibles o sensibles exigen aprobación humana con el contexto necesario para decidir.

Credenciales propias del agente, separadas de las de los usuariosAlcance por rol: cada agente consulta solo las fuentes de su procesoAcciones irreversibles (pagos, envíos, cambios masivos) con aprobación humanaEntornos aislados (sandbox) para probar herramientas antes de producciónLista de herramientas permitidas, no acceso abierto a todoRevisión periódica de permisos: los accesos viejos se revocan

Observabilidad: logs, tracing y métricas

Si no podés reconstruir qué hizo el agente, cuándo y con qué contexto, no podés operarlo con confianza. La observabilidad de agentes es la suma de registros y métricas que permiten explicar su comportamiento.

Cada acción registrada: qué herramienta, qué entrada, qué resultadoTrazabilidad de decisiones: qué fuente o regla sustentó la respuestaMétricas de costo por consulta y por tarea, con alertas de desvíoMétricas de latencia, fallos de herramientas y reintentosTasa de derivación a revisión humana y motivosRegistro de cambios de configuración, prompts y versiones del agente

Riesgos concretos y mitigaciones

Los riesgos de operar agentes son conocidos y se mitigan con diseño. La tabla resume los más comunes y sus controles básicos.

RiesgoMitigación básica
Prompt injection (entrada maliciosa que redirige al agente)Limitar instrucciones ejecutables, validar entradas, aislar herramientas y no confiar en contenido externo como comando.
Exfiltración de datosPermisos de lectura por perfil, minimización de datos y bloqueo de salidas no autorizadas.
Uso indebido de herramientasLista de herramientas permitidas, credenciales de mínimo privilegio y aprobación para acciones sensibles.
Bucles o reintentos infinitosLímites de pasos, timeouts y cortes de costo por tarea.
Costo descontroladoPresupuestos por tarea, alertas de consumo y revisión de métricas.

Cuándo NO usar agentes

Un agente no es la respuesta para todo. Si el proceso no está definido, las consecuencias de un error son irreversibles sin posibilidad de control, o la calidad de los datos no permite decisiones confiables, conviene primero ordenar la operación o usar flujos con reglas explícitas.

La pregunta correcta no es «¿podemos construir un agente?» sino «¿qué control necesitamos y podemos mantener?». Un workflow con reglas y aprobaciones suele ser más robusto y barato que un agente para procesos estables.

Preguntas frecuentes

¿Un agente necesita permisos de usuario?

No debería usar los permisos de una persona. Un agente opera con credenciales propias y de mínimo privilegio, limitadas a su proceso.

¿Qué pasa si el agente se equivoca?

Las acciones irreversibles requieren aprobación humana, y cada acción queda registrada para revisión y corrección.

¿Los logs son obligatorios?

En producción, sí: sin registro de acciones, decisiones y fallos no se puede operar con confianza ni mejorar el sistema.

¿Un agente puede reemplazar un flujo con reglas?

Depende del caso. Para procesos estables, un workflow con reglas suele ser más simple y barato; el agente agrega valor donde hay interpretación y variabilidad.

Relacionado

Nova LabsSoftware, automatización e IA aplicada en Paraguay.Sobre el equipo y el fundador