Construir agentes de IA con herramientas, memoria y autonomía controlada · Módulo 4: Evaluación y entrega

Entregar un agente con autonomía controlada

Proyecto final que valida el agente por fases y produce el dossier necesario para entrar en rollout controlado sin duplicar la operación transversal de C06.

Objetivo de aprendizaje

Entregar un candidato agentic con autonomía justificada, harness versionado, recovery, evals y kill switches probado, preparado para el proceso de producción de C06.

El proyecto final de C05 no pretende operar el agente a escala ni sustituir C06. Pretende entregar un candidato agentic validado cuyo poder pueda ampliarse por fases sin cambiar sus invariantes.

La autonomía es una variable del diseño, no un premio al finalizar el curso.

Fija el scope de validación

Elige una tarea con:

  • outcome verificable;
  • entorno controlado;
  • tools limitadas;
  • baseline;
  • datos de prueba;
  • efectos reversibles o aprobables.

Evita usar como primer candidato pagos, borrado, administración universal o cambios de seguridad crítica.

Fase 0 — simulación

Todas las tools son falsas o apuntan a fixtures.

Comprueba:

  • selección;
  • argumentos;
  • loops;
  • stop conditions;
  • budgets;
  • prompt injection;
  • recovery.

No existen efectos externos.

Fase 1 — lectura real

Conecta únicamente herramientas read-only y con scopes reales.

Comprueba:

  • autorización;
  • observaciones;
  • freshness;
  • aislamiento;
  • recuperación de errores.

El outcome todavía puede ser un dossier o propuesta.

Fase 2 — propuesta

Permite artifacts persistidos pero sin efectos externos:

  • borrador;
  • plan;
  • diff;
  • tarea pendiente.

Compara lo propuesto con la decisión humana y convierte los desacuerdos importantes en evals.

Fase 3 — escritura aprobada

Añade una única acción reversible o acotada y exige aprobación informada.

La aprobación debe estar ligada a:

  • actor;
  • argumentos;
  • recurso;
  • versión;
  • expiración.

Revalida antes de ejecutar.

Fase 4 — autonomía limitada

Solo considera automatizar acciones que ya hayan demostrado:

  • outcome estable;
  • límites efectivos;
  • reversibilidad o bajo impacto;
  • idempotencia;
  • recovery;
  • monitorización mínima;
  • kill switch.

Las acciones de alto impacto pueden seguir requiriendo aprobación indefinidamente.

Aísla ejecución cuando exista código o shell

Si el agente trabaja con archivos, comandos o paquetes, utiliza un sandbox con:

  • filesystem limitado;
  • red controlada;
  • credenciales mínimas;
  • timeout;
  • recursos;
  • snapshots cuando sean útiles.

La documentación de OpenAI sobre sandbox agents separa el harness como plano de control del entorno de ejecución. El concepto importante es esa frontera, no un SDK concreto.

Versiona el harness

El comportamiento depende de:

  • modelo;
  • instrucciones;
  • catálogo de tools;
  • políticas;
  • budgets;
  • contexto;
  • memoria;
  • runtime.

Agrupa esas decisiones en una versión reproducible. Un incidente no debe depender de recordar qué flags estaban activos.

Prepara controles de emergencia

Antes de conceder una escritura real, demuestra que puedes:

  • detener nuevos runs;
  • bloquear una tool;
  • convertir a read-only;
  • revocar credencial;
  • bajar budget;
  • cerrar jobs pendientes de forma conocida.

Prueba estos controles. Un kill switch no validado es una hipótesis.

Define el hand-off a producción

C05 termina cuando puedes entregar a C06:

  1. contrato de ejecución;
  2. baseline;
  3. catálogo de tools;
  4. permisos;
  5. memoria/estado;
  6. stop conditions;
  7. budgets;
  8. recovery policy;
  9. eval suite agentic;
  10. resultados por nivel de autonomía;
  11. threat model;
  12. harness version;
  13. fallos conocidos;
  14. kill switches probados.

C06 utilizará estos artefactos para SLOs, datasets de producción, tracing transversal, canarying, incident response y readiness.

No conviertas multi-agent en requisito

Si un solo agente no resuelve la tarea, analiza la causa antes de introducir otro.

Multi-agent añade:

  • handoffs;
  • coordinación;
  • duplicación de contexto;
  • ownership de errores.

Úsalo solo si especialización o paralelización mejoran un caso medido.

Ejercicio final

Construye un agente para investigar una incidencia y preparar una acción.

Empieza con:

  • get_ticket;
  • search_logs;
  • search_runbook;
  • create_resolution_draft.

Después añade una escritura reversible con aprobación.

Ejecuta los mismos tasks en simulación, lectura, propuesta y escritura aprobada. Documenta qué mejora y qué riesgo aparece en cada nivel.

Entregable

El resultado de C05 es un agente cuyo nivel de autonomía está justificado por evals y controles. No está «listo para toda producción» por completar el curso: está listo para entrar en un rollout controlado y en la disciplina operacional de C06.