Evaluar y operar sistemas de IA en producción: calidad, fiabilidad, observabilidad e incidentes
Curso avanzado para convertir un sistema de IA en un servicio operable: objetivos de servicio, datasets y rúbricas, evaluación offline y online, trazas, monitorización, control de cambios, canary releases, incidentes, rollback, feedback y readiness con criterios explícitos de calidad, seguridad, latencia y coste.
Recorrido: Construir sistemas de IA
Para quién
Equipos técnicos, de producto, datos, plataforma, seguridad y operaciones responsables de aplicaciones con LLM, RAG, agentes o automatizaciones con IA que ya funcionan en prototipo y deben sostenerse en producción
Antes de empezar
- Disponer de un sistema de IA implementado o de un prototipo suficientemente estable para ejecutar pruebas repetibles
- Poder identificar sus dependencias, modelos, prompts, herramientas, datos, índices, permisos y principales modos de fallo
- Tener acceso a ejemplos reales o representativos y capacidad para anonimizar, sintetizar o controlar los datos usados en evaluación
- Conocer fundamentos de aplicaciones LLM, RAG o agentes y prácticas básicas de observabilidad, seguridad y despliegue
Resultado de aprendizaje
Qué deberías poder hacer al terminar.
Definir SLIs, SLOs y presupuestos de fallo que conecten disponibilidad, calidad de tarea, seguridad, latencia y coste con el valor del servicio
Construir datasets de evaluación versionados y rúbricas con casos representativos, negativos, adversariales y de alto impacto
Crear una batería offline reproducible con pruebas deterministas, graders, revisión humana y puertas de regresión por segmento
Evaluar por capas sistemas RAG y agentes y comprobar outcomes y efectos reales, no solo la calidad textual de la respuesta
Trazar cada ejecución de extremo a extremo con versiones, dependencias, herramientas, uso y costes sin convertir la observabilidad en una fuga de datos
Monitorizar señales inmediatas y calidad diferida, distinguir deriva de degradación y diseñar alertas accionables basadas en impacto
Índice del curso
Sigue los módulos en orden si quieres hacer el recorrido completo. Si ya dominas una parte, puedes entrar directamente en la lección que necesites.
Módulo 1
Objetivos y evidencia
Define qué significa prestar un buen servicio y crea evidencia versionada que represente valor, riesgo y casos límite.
- 1. Definir objetivos de servicio y presupuesto de fallo →
Definir indicadores y objetivos que describan el servicio completo y establecer tolerancias y decisiones cuando se consumen los márgenes aceptables de fallo.
- 2. Construir un dataset de evaluación y rúbricas →
Construir un conjunto representativo y reproducible de casos y criterios que permita medir calidad, seguridad y riesgo por segmento.
Módulo 2
Evaluación reproducible
Convierte esa evidencia en pruebas offline reproducibles y evalúa sistemas compuestos por capa y de extremo a extremo.
- 1. Crear evaluaciones offline y puertas de regresión →
Implementar una evaluación offline reproducible e independiente de la plataforma que bloquee regresiones relevantes antes de ampliar el despliegue.
- 2. Evaluar RAG, agentes y efectos de herramientas →
Diagnosticar sistemas compuestos evaluando tanto componentes intermedios como el outcome real y las consecuencias de cada acción.
Módulo 3
Trazas y monitorización
Haz observable cada ejecución, correlaciona cambios con comportamiento y detecta degradación técnica, semántica y económica.
- 1. Trazar solicitudes, prompts, modelos, herramientas y costes →
Diseñar telemetría que permita reconstruir una ejecución y atribuir cambios sin registrar contenido sensible innecesario.
- 2. Monitorizar calidad, deriva, latencia y coste →
Diseñar paneles y alertas segmentados que distingan degradación técnica, semántica y económica y permitan investigar sus causas.
Módulo 4
Cambios e incidentes
Versiona toda la configuración de comportamiento, reduce el radio de impacto de cada cambio y recupera el servicio ante incidentes.
- 1. Versionar configuración y desplegar gradualmente →
Versionar todos los componentes que alteran comportamiento y desplegar candidatos de forma gradual limitando su radio de impacto.
- 2. Responder a incidentes, rollback y fallbacks →
Diseñar una respuesta a incidentes con roles, mitigación prioritaria, rollback, degradación segura, evidencia y postmortem accionable.
Módulo 5
Operación continua
Convierte feedback, revisión temporal, ownership y runbooks en una práctica continua de operación y retirada.
- 1. Incorporar feedback y revisión continua →
Convertir señales de producción en casos reproducibles y cambios evaluados, manteniendo separación entre feedback, holdout y datos reutilizables.
- 2. Preparar readiness y plan de operación →
Emitir una decisión de readiness para un alcance concreto mediante evidencia verificable, responsables, runbooks, drills y blockers explícitos.
Aplicación a un caso real
¿Tienes un prototipo que debe pasar a producción?
Podemos revisar calidad, observabilidad, fallos, despliegue gradual y criterios de rollback antes de escalar.
Revisar readiness →