Evaluar y operar sistemas de IA en producción: calidad, fiabilidad, observabilidad e incidentes · Módulo 2: Evaluación reproducible
Evaluar RAG, agentes y efectos de herramientas
Evaluación por capas de corpus, retrieval, generación, citas, trayectorias, tools, outcomes, seguridad y recuperación.
Objetivo de aprendizaje
Diagnosticar sistemas compuestos evaluando tanto componentes intermedios como el outcome real y las consecuencias de cada acción.
Un sistema compuesto puede parecer correcto al final y haber fallado antes. Para operar RAG o agentes necesitas localizar el fallo en corpus, recuperación, generación, decisión, herramienta, permiso o efecto externo.
La evaluación debe reflejar la arquitectura.
RAG: evalúa por capas
Corpus
Comprueba:
- fuente presente;
- versión;
- permisos;
- vigencia;
- chunk correcto.
Retrieval
Mide:
- recall@k;
- precision@k;
- MRR;
- posición de fuente esperada;
- filtros.
No uses todas a la vez sin necesidad.
Generación
Evalúa:
- groundedness;
- completitud;
- condiciones;
- contradicciones;
- abstención.
Citas
Verifica:
- fuente existe;
- usuario tiene acceso;
- versión correcta;
- pasaje sostiene afirmación.
End-to-end
Pregunta:
«¿El usuario recibió una respuesta útil, autorizada y respaldada?»
Diseña negativos
Incluye:
- sin respuesta;
- fuente retirada;
- documento contradictorio;
- permiso denegado;
- otro tenant;
- fuente maliciosa.
El comportamiento correcto puede ser abstenerse.
Agentes: evalúa outcome y trayectoria
Anthropic distingue:
Transcript/trace Qué hizo.
Outcome Cómo quedó el entorno.
Ejemplo:
El agente escribe:
«He creado la tarea.»
Outcome:
no existe.
La respuesta textual es falsa aunque suene convincente.
Graders de trayectoria
Evalúa:
- tool selection;
- argumentos;
- orden;
- loops;
- aprobación;
- stop;
- recovery;
- escalado.
No exijas un camino único si existen varios válidos.
Efectos de herramientas
Para una tool de escritura verifica:
- recurso correcto;
- tenant;
- transición;
- idempotencia;
- aprobación;
- side effects;
- reversibilidad.
Una tool call sintácticamente correcta que cambia el objeto equivocado es un fallo crítico.
Evalúa recuperación
Simula:
- timeout;
- 429;
- 500;
- respuesta tardía;
- estado cambiado;
- permiso revocado.
Comprueba si el sistema:
- retry;
- replan;
- ask;
- stop;
- reconcile.
Controla ruido de infraestructura
En agentic evals, entorno, herramientas y configuración pueden afectar el score.
Versiona:
- fixtures;
- sandbox;
- tool implementations;
- dependencias;
- latencia simulada.
No compares versiones ejecutadas sobre entornos distintos sin reconocerlo.
Safety evals
Incluye:
- prompt injection;
- tool abuse;
- cross-tenant;
- secret exfiltration;
- memory poisoning;
- denial of wallet;
- acción no autorizada.
Los fallos críticos no se compensan con una buena media.
Variación
Ejecuta múltiples trials en casos agentic importantes.
Mide:
- task success;
- outcome;
- coste;
- pasos;
- tools;
- tiempo;
- incidentes.
Una candidata puede tener el mismo éxito pero necesitar el doble de acciones.
Ejemplo
Agente de soporte.
Outcome:
- crea un borrador correcto.
Trayectoria A:
- 4 lecturas;
- 1 draft;
- sin riesgo.
Trayectoria B:
- consulta 15 herramientas;
- intenta una escritura denegada;
- termina igual.
La B no debe considerarse equivalente.
Ground truth para RAG
No necesitas anotar todos los chunks posibles.
Puedes registrar:
- documentos relevantes;
- pasajes mínimos;
- facts.
Para una pregunta multi-source, identifica todas las fuentes necesarias.
Si solo etiquetas una, el sistema puede parecer correcto aunque omita la segunda.
Métricas de citation quality
Separa:
Citation existence La cita existe.
Citation correctness Sostiene la afirmación.
Citation completeness Las afirmaciones importantes están citadas.
Una respuesta puede tener muchas citas y poca cobertura.
Evaluación de abstención
Crea cuatro categorías:
- answerable;
- insufficient evidence;
- forbidden;
- needs clarification.
Mide:
- false answer;
- false abstention.
Abstenerse siempre es seguro pero inútil.
Herramientas: verifica el estado final
Si create_ticket devuelve 200 pero la persistencia falla después, la tool no completó el outcome.
Comprueba el sistema de destino.
Acciones compuestas
Una acción puede:
- crear;
- enviar;
- registrar.
Evalúa cada efecto.
Si falla el registro después del envío, el usuario recibió el email pero la auditoría está incompleta.
Agentes: stop conditions
Incluye casos donde debe:
- terminar;
- pedir dato;
- pedir aprobación;
- abandonar.
Un agente que continúa «para ayudar más» puede violar límites.
Efficiency graders
Marca:
- repeated_tool_calls;
- unnecessary_steps;
- duplicate_reads.
No bloquees por una tool adicional si no importa. Define guardrails de eficiencia según coste/riesgo.
Multi-agent
Evalúa:
- handoffs;
- ownership;
- duplicación;
- subagent failure;
- context leakage.
No asumas que más agentes mejoran el resultado.
Simuladores
Para tools externas usa simuladores que:
- mantengan estado;
- inyecten errores;
- registren efectos.
Un mock que siempre devuelve éxito no evalúa recuperación.
Dossier por fallo
Para los peores casos conserva:
- trace;
- outcome;
- grader;
- screenshot/log;
- causa.
Esto acelera corrección.
Ejercicio
Construye una matriz:
| capa | caso | grader | bloqueante | resultado |
|---|
Incluye 10 RAG, 10 agentes y 10 tools.
Ejecuta al menos tres trials en cinco casos críticos.
Resultado de la lección
Debes terminar con una evaluación que explica dónde falla el sistema y si el outcome real es aceptable. Esa información será la base de la trazabilidad y monitorización de producción.

