Construir agentes de IA con herramientas, memoria y autonomía controlada · Módulo 4: Evaluación y entrega
Evaluar trayectorias, seguridad y autonomía
Evaluación específicamente agentic de task, trial, trayectoria, outcome, stop conditions, recovery, seguridad y autonomía incremental.
Objetivo de aprendizaje
Medir si un agente alcanza el outcome por trayectorias aceptables y decidir qué nivel de autonomía merece antes de entrar en el programa de producción de C06.
C06 enseñará a construir el programa general de evaluación, release y monitorización de producción. En C05 la evaluación tiene un propósito más estrecho: demostrar que la autonomía dinámica aporta valor sin introducir rutas, herramientas o efectos inaceptables.
Por eso la unidad de evaluación no es solo la respuesta final. Es el run completo.
Distingue task, trial, trajectory y outcome
Anthropic utiliza una terminología útil:
Task — caso con input y criterio de éxito. Trial — una ejecución concreta. Trajectory/trace — secuencia observable de decisiones y herramientas. Outcome — estado final real del entorno. Grader — mecanismo que evalúa una dimensión.
Ejecuta múltiples trials en casos críticos porque el mismo task puede producir caminos diferentes.
Puntúa el outcome primero
Siempre que puedas, comprueba el mundo:
- archivo creado;
- registro actualizado;
- incidencia correctamente clasificada;
- borrador presente;
- ausencia de efectos prohibidos.
Un agente que escribe «he creado la tarea» no supera la prueba si la tarea no existe.
Evalúa decisiones agentic observables
No necesitas puntuar razonamiento privado. Evalúa eventos:
- tool seleccionada;
- argumentos;
- orden;
- replanificación;
- petición de información;
- aprobación;
- stop condition;
- recuperación;
- repetición.
No exijas una trayectoria única si varias alcanzan el outcome de forma válida.
Mide progreso y eficiencia
Dos trials pueden terminar bien y tener calidad operacional distinta.
A:
- 5 tool calls;
- 30 s;
- 1 replanificación.
B:
- 22 tool calls;
- 4 min;
- varias lecturas duplicadas.
Registra:
- pasos;
- llamadas;
- tokens;
- coste;
- tiempo;
- acciones redundantes.
La eficiencia solo debe bloquear cuando el caso tenga límites explícitos de tiempo, coste o riesgo.
Evalúa stop conditions
Incluye tasks donde el resultado correcto sea:
SUCCEEDED;NEEDS_INPUT;NEEDS_APPROVAL;BLOCKED;OUT_OF_SCOPE;BUDGET_EXCEEDED.
Un agente que sigue actuando «para ayudar más» después de una condición de parada es un fallo, incluso si termina generando una respuesta razonable.
Evalúa recovery y cambios del entorno
Inyecta:
- tool 500;
- timeout;
- recurso modificado;
- permiso revocado;
- memoria obsoleta;
- resultado tardío.
Comprueba si el agente:
RETRY / REPLAN / ASK / ESCALATE / STOP
según la política permitida.
La recuperación forma parte de la competencia agentic, no es únicamente fiabilidad de API.
Prueba seguridad sobre la trayectoria
Casos adversariales:
- prompt injection en una observación;
- tool no autorizada;
- otro tenant;
- memoria contaminada;
- aprobación reutilizada;
- loop que consume presupuesto;
- acción de mayor impacto que el scope.
El grader debe comprobar el efecto real. «El agente dijo que no debía hacerlo» no sirve si la tool se ejecutó.
Compara niveles de autonomía
Utiliza una baseline escalonada:
A. workflow o llamada simple; B. agente read-only; C. agente que propone; D. escrituras aprobadas; E. autonomía limitada.
Compara:
- task success;
- outcome;
- intervención humana;
- acciones revertidas;
- coste;
- incidentes;
- pasos.
La pregunta no es qué versión tiene «más autonomía», sino cuál ofrece la mejor relación utilidad/riesgo para ese scope.
Controla el entorno del eval
Versiona:
- fixtures;
- sandbox;
- tools;
- permisos;
- datos iniciales;
- latencias simuladas cuando afecten al caso.
Anthropic ha mostrado que la infraestructura puede alterar benchmarks agentic. Si dos candidatas se prueban sobre entornos distintos, la comparación pierde fuerza.
Mantén fallos no negociables
Ejemplos:
BLOCK
- cross-tenant
- write sin aprobación cuando era obligatoria
- tool bloqueada
- loop por encima del budget
- outcome crítico incorrectoEstos fallos no se compensan con una media alta.
Ejercicio
Construye 20 tasks:
- 8 normales;
- 4 con cambio de entorno;
- 3 sin solución;
- 5 adversariales.
Para cada uno define outcome, stop esperado, tools permitidas, acciones prohibidas y graders. Ejecuta al menos tres trials en los casos críticos y compara read-only, propuesta y escritura aprobada.
Criterio de salida
Al finalizar, debes contar con evidencia de que el agente consigue outcomes aceptables por rutas aceptables y saber qué nivel de autonomía merece. La disciplina general de regression, canary, SLOs e incidentes se desarrolla después en C06.

