Resumen clave
Evaluar un sistema de IA es evaluar decisiones, no demos
Una demo muestra lo que el sistema hace bien. La evaluación real muestra qué ocurre cuando la entrada es ambigua, los datos cambian o el modelo se equivoca. Por eso la evaluación no es un paso previo a producción: es un proceso continuo que empieza antes de construir y sigue mientras el sistema opera.
La métrica correcta depende de la tarea. No existe un único «porcentaje de precisión» que sirva para todo: clasificar correos, extraer datos de facturas, resumir documentos y ejecutar tareas como agente se miden de maneras distintas.
Métricas según el tipo de tarea
Cada tipo de uso tiene métricas naturales. La tabla es un punto de partida para definir qué medir; los valores aceptables dependen del caso y del riesgo de cada error.
Construir un dataset de evaluación
El dataset de evaluación debe reflejar casos reales de tu operación, no solo ejemplos fáciles. Se arma antes de producir y se actualiza cuando aparecen patrones nuevos.
Monitoreo en producción
Las métricas de un dataset estático no bastan: los datos cambian, los modelos se actualizan y el uso real difiere del esperado. El monitoreo observa el comportamiento en producción.
Human-in-the-loop como medición
Cuando un humano revisa las respuestas, esa revisión es información: muestra dónde el sistema falla, qué confunde y qué necesita mejorar. Diseñar la revisión como parte del flujo —con registro del motivo— convierte la supervisión en una fuente continua de evaluación.
La tasa de override no es un fracaso del sistema: es una señal de qué tan cerca está de operar sin supervisión. Bajar la tasa de override sin bajar la calidad no es lo mismo que simplemente apagar la revisión.
Límites honestos de la evaluación
Las métricas de modelo no son métricas de negocio. Que un clasificador tenga 95% de precisión no dice cuántas horas ahorró ni cuántas ventas se perdieron por un error: eso requiere línea base operativa y medición de impacto.
Tampoco conviene comparar resultados entre sistemas con datasets distintos: sin el mismo conjunto de evaluación y el mismo caso de uso, los números no son comparables. Si alguien te muestra un benchmark, preguntá sobre qué datos se calculó y qué se está comparando.
Preguntas frecuentes
¿Qué es la groundedness?
Es la medida de qué tan fiel es una respuesta al documento o fuente que la respalda. Una respuesta puede ser coherente y aun así inventar datos: la groundedness detecta esa distancia.
¿Cuántos casos necesita un dataset de evaluación?
Depende de la variedad de la operación. Un conjunto pequeño con casos reales y adversos suele revelar más problemas que cientos de casos fáciles.
¿Puede la IA evaluarse a sí misma?
Los modelos pueden asistir la evaluación, pero la revisión de resultados críticos debe incluir criterio humano, especialmente en decisiones de alto impacto.
¿Cuándo se considera que un sistema está listo?
Cuando cumple la métrica acordada sobre el dataset de evaluación, los casos de abstención escalan correctamente y el monitoreo puede detectar fallos antes de que impacten.