Muestra de evaluación
Evaluation sample
Subconjunto seleccionado de casos sobre el que se ejecuta una evaluación concreta.
Ver definición completa →Cargando diccionario…
Bloque temático
Diseño, ejecución, documentación e interpretación de evaluaciones de modelos y sistemas de inteligencia artificial antes y después del despliegue.
Evaluation sample
Subconjunto seleccionado de casos sobre el que se ejecuta una evaluación concreta.
Ver definición completa →Evaluation objective
Pregunta o decisión concreta que la evaluación debe resolver.
Ver definición completa →Evaluation plan
Documento que fija objetivos, datos, métodos, responsables, métricas y criterios de aceptación.
Ver definición completa →Human preference
Elección o valoración expresada por una persona entre alternativas de salida.
Ver definición completa →Evaluation protocol
Procedimiento reproducible que define cómo ejecutar y registrar una evaluación.
Ver definición completa →Model acceptance test
Prueba formal que determina si una versión satisface los requisitos acordados.
Ver definición completa →AI stress test
Prueba que somete el sistema a cargas, volúmenes o condiciones extremas para observar sus límites.
Ver definición completa →Regression test
Prueba que comprueba que una modificación no deteriora comportamientos previamente aceptados.
Ver definición completa →Model quality gate
Control que impide avanzar una versión cuando no cumple criterios obligatorios.
Ver definición completa →AI red teaming
Exploración estructurada de fallos y riesgos mediante equipos que intentan provocar comportamientos problemáticos.
Ver definición completa →Evaluation record
Evidencia estructurada de configuración, datos, resultados, incidencias y responsables de una evaluación.
Ver definición completa →Evaluation repeatability
Capacidad de obtener resultados próximos al repetir la evaluación bajo las mismas condiciones.
Ver definición completa →Evaluation reproducibility
Capacidad de obtener resultados comparables con otros equipos, implementaciones o entornos.
Ver definición completa →Evaluation rubric
Conjunto explícito de dimensiones, niveles y reglas para asignar una valoración.
Ver definición completa →Evaluation task
Actividad específica que el modelo debe completar durante una prueba.
Ver definición completa →Test, evaluation, verification and validation
Conjunto de actividades de prueba, evaluación, verificación y validación aplicado a sistemas de IA.
Ver definición completa →Evaluation traceability
Capacidad de reconstruir qué se evaluó, con qué versión, datos, métodos y criterios.
Ver definición completa →Pass threshold
Valor mínimo o máximo que separa un resultado aceptable de uno no aceptable.
Ver definición completa →Construct validity
Grado en que una evaluación mide realmente la capacidad o propiedad que afirma medir.
Ver definición completa →Ecological validity
Grado en que las condiciones de prueba representan el uso real del sistema.
Ver definición completa →External validity
Grado en que los resultados pueden generalizarse a otras poblaciones, tareas o entornos.
Ver definición completa →Internal validity
Grado en que los resultados se atribuyen al factor examinado y no a variables de confusión.
Ver definición completa →Evaluation versioning
Gestión explícita de cambios en casos, rúbricas, métricas y configuraciones de evaluación.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.