Inteligencia artificial · 10 min

Cómo evaluar sistemas de IA en producción

Métricas por tipo de tarea, datasets de evaluación, monitoreo y los límites honestos de medir IA en una operación real.

Resumen clave

Evaluar decisiones, no demosConstruir un dataset de evaluación con casos realesMedir en producción: costo, latencia, fallos y supervisión

Evaluar un sistema de IA es evaluar decisiones, no demos

Una demo muestra lo que el sistema hace bien. La evaluación real muestra qué ocurre cuando la entrada es ambigua, los datos cambian o el modelo se equivoca. Por eso la evaluación no es un paso previo a producción: es un proceso continuo que empieza antes de construir y sigue mientras el sistema opera.

La métrica correcta depende de la tarea. No existe un único «porcentaje de precisión» que sirva para todo: clasificar correos, extraer datos de facturas, resumir documentos y ejecutar tareas como agente se miden de maneras distintas.

Métricas según el tipo de tarea

Cada tipo de uso tiene métricas naturales. La tabla es un punto de partida para definir qué medir; los valores aceptables dependen del caso y del riesgo de cada error.

Tipo de tareaQué medir
Clasificación (correos, consultas, tickets)Precisión, recall y la matriz de errores: qué confunde y qué no debería perder.
Extracción (facturas, formularios, documentos)Exactitud por campo, tasa de campos críticos mal leídos y casos enviados a revisión.
Generación y resumenGroundedness (qué tan fiel al documento fuente), tasa de alucinación y citas correctas.
Recuperación con RAGCalidad de las fuentes recuperadas y de las citas, no solo la respuesta final.
AgentesTasa de tareas completadas con éxito, tasa de override humano y acciones revertidas.
Asistentes / copilotsTasa de aceptación, correcciones realizadas por el usuario y tareas abandonadas.

Construir un dataset de evaluación

El dataset de evaluación debe reflejar casos reales de tu operación, no solo ejemplos fáciles. Se arma antes de producir y se actualiza cuando aparecen patrones nuevos.

Preguntas o casos reales recolectados de la operación, con el resultado esperado definidoCasos donde el sistema debe abstenerse o escalar a una personaCasos límite: datos incompletos, ambiguos, contradictorios o fuera de formatoCasos adversos: intentos de manipulación o entradas malintencionadasRevisión humana de las respuestas del dataset antes de usarlo

Monitoreo en producción

Las métricas de un dataset estático no bastan: los datos cambian, los modelos se actualizan y el uso real difiere del esperado. El monitoreo observa el comportamiento en producción.

Latencia y costo por consulta o por tareaTasa de fallos de herramientas, integraciones y llamadas externasDerivaciones a revisión humana y motivosCambios en los tipos de entrada (drift) y en la calidad de las respuestasLogs que permitan reconstruir qué se preguntó y qué se respondióAlertas para métricas fuera de rango, no solo para caídas

Human-in-the-loop como medición

Cuando un humano revisa las respuestas, esa revisión es información: muestra dónde el sistema falla, qué confunde y qué necesita mejorar. Diseñar la revisión como parte del flujo —con registro del motivo— convierte la supervisión en una fuente continua de evaluación.

La tasa de override no es un fracaso del sistema: es una señal de qué tan cerca está de operar sin supervisión. Bajar la tasa de override sin bajar la calidad no es lo mismo que simplemente apagar la revisión.

Límites honestos de la evaluación

Las métricas de modelo no son métricas de negocio. Que un clasificador tenga 95% de precisión no dice cuántas horas ahorró ni cuántas ventas se perdieron por un error: eso requiere línea base operativa y medición de impacto.

Tampoco conviene comparar resultados entre sistemas con datasets distintos: sin el mismo conjunto de evaluación y el mismo caso de uso, los números no son comparables. Si alguien te muestra un benchmark, preguntá sobre qué datos se calculó y qué se está comparando.

Preguntas frecuentes

¿Qué es la groundedness?

Es la medida de qué tan fiel es una respuesta al documento o fuente que la respalda. Una respuesta puede ser coherente y aun así inventar datos: la groundedness detecta esa distancia.

¿Cuántos casos necesita un dataset de evaluación?

Depende de la variedad de la operación. Un conjunto pequeño con casos reales y adversos suele revelar más problemas que cientos de casos fáciles.

¿Puede la IA evaluarse a sí misma?

Los modelos pueden asistir la evaluación, pero la revisión de resultados críticos debe incluir criterio humano, especialmente en decisiones de alto impacto.

¿Cuándo se considera que un sistema está listo?

Cuando cumple la métrica acordada sobre el dataset de evaluación, los casos de abstención escalan correctamente y el monitoreo puede detectar fallos antes de que impacten.

Relacionado

Nova LabsSoftware, automatización e IA aplicada en Paraguay.Sobre el equipo y el fundador