Automatizar documentos con IA: OCR, extracción, validación y revisión · Módulo 5: Evaluar y pilotar
Evaluar calidad, coste y riesgo
Evaluación del pipeline por etapa, campo y segmento, incluyendo cobertura automática, revisión, latencia, coste y errores críticos.
Objetivo de aprendizaje
Construir un informe reproducible que permita decidir despliegue o restricción según calidad, cobertura, coste, latencia y riesgo.
Una cifra global de «precisión» rara vez describe un sistema documental de forma suficiente. Puede promediar campos fáciles con campos críticos, ocultar que las fotografías fallan más que los PDFs digitales o ignorar que la mitad de los casos todavía termina en revisión humana.
La evaluación debe reflejar el pipeline completo y las condiciones reales de uso. NIST insiste en mediciones contextualizadas y conjuntos de prueba realistas; además, su AI RMF es un marco voluntario, no una obligación universal ni una métrica cerrada.
Mide cada etapa por separado
Entrada y digitalización
Observa archivos rechazados, páginas procesadas, ilegibles detectados, estructura preservada y latencia de lectura.
División y clasificación
Mide exactitud por clase, matriz de confusión, límites de documentos, páginas mal asignadas y comportamiento de la clase desconocida.
Extracción
Mide por campo: correcto, ausente, espurio, ambiguo y evidencia equivocada. Separa campos críticos de los secundarios.
Validación
Mide errores detectados, errores no detectados y falsas alertas. Una regla que bloquea demasiados casos correctos también genera coste.
Revisión humana
Mide cobertura, tiempo, correcciones, causas, reincidencia por plantilla y errores que escaparon después de la revisión.
Workflow
Mide casos completados, duplicados, fallos de integración, tiempo de extremo a extremo, reintentos, casos atascados y capacidad de recuperación.
Esta descomposición permite localizar qué componente limita el resultado. Cambiar de modelo no arregla un problema de archivo, una regla incorrecta o una integración que duplica efectos.
Reporta por campo y segmento
No promedies un identificador crítico con veinte campos descriptivos. Define qué errores tienen mayor consecuencia y presenta sus métricas por separado.
Segmenta además por clase, emisor, canal, calidad visual, idioma y cualquier condición que altere el comportamiento. Indica el número de ejemplos de cada segmento. Un 100 % sobre tres documentos no tiene el mismo significado que sobre trescientos.
Cuando el tamaño lo justifique, utiliza intervalos de incertidumbre o, como mínimo, muestra numerador y denominador. El objetivo es evitar que una tasa aparente una precisión que los datos no sostienen.
Incluye cobertura automática
Un sistema puede alcanzar una exactitud excelente aceptando automáticamente solo el 10 % de documentos y enviando el resto a revisión. Ese resultado puede ser útil, pero no debe presentarse como «97 % de automatización».
Separa:
- calidad de lo aceptado automáticamente;
- porcentaje de cobertura automática;
- porcentaje de revisión parcial;
- porcentaje de revisión completa;
- rechazo o imposibilidad de procesar.
La utilidad se encuentra en el equilibrio entre calidad y cobertura.
Calcula el coste completo
Incluye:
- consumo de OCR/extracción/modelos;
- almacenamiento y transferencia;
- infraestructura;
- tiempo de revisión;
- gestión de excepciones;
- mantenimiento de reglas y esquemas;
- monitorización;
- soporte e incidentes;
- trabajo de actualización ante nuevas plantillas.
Compara con la línea base manual medida al inicio. No contabilices «minutos ahorrados» si una persona vuelve a comprobar todo el documento más adelante.
Evalúa latencia y capacidad
El coste por documento no es suficiente. Comprueba si el sistema puede absorber picos, si cumple el tiempo que necesita el proceso y qué ocurre cuando un proveedor externo limita o degrada el servicio.
Mide percentiles de latencia o al menos distribución, no solo promedio. Un sistema rápido en media puede crear una cola operativa si una fracción de casos tarda demasiado.
Define criterios antes de mirar el resultado
Establece previamente:
- tratamiento de errores críticos;
- cobertura mínima;
- carga máxima de revisión;
- coste objetivo;
- tiempo objetivo;
- límites por segmento;
- fallos operativos que bloquean despliegue;
- condición de regresión.
No cambies estos criterios después de ver los resultados únicamente para declarar éxito. Si descubres que el criterio inicial era equivocado, regístralo y ejecuta una nueva evaluación con la nueva regla.
Ejemplo de lectura correcta
Supón que el sistema obtiene 97 % de campos correctos. En fotografías, sin embargo, falla 4 de 50 valores de total, un campo crítico. Además, el 45 % de fotografías termina en revisión completa.
La conclusión no es «97 % de precisión». Una decisión razonable puede ser desplegar en PDFs digitales y escaneos controlados, mantener fotografías fuera de alcance y trabajar después en ese segmento.
Ejercicio: informe de evaluación
Produce:
- versión del conjunto;
- configuración del sistema;
- métricas por etapa;
- resultados por campo y segmento;
- cobertura automática;
- carga y tiempo de revisión;
- errores críticos;
- latencia;
- coste completo;
- comparación con línea base;
- limitaciones;
- regresiones conocidas;
- decisión provisional.
Resultado de la lección
El informe debe permitir elegir entre avanzar, restringir, corregir, cambiar de técnica o detener. Si para defender el sistema necesitas enseñar la demo en lugar de los datos, la evaluación todavía no es suficiente. La última lección utilizará este informe para ejecutar un piloto controlado y entregar algo que otra persona pueda operar y revisar.

