Acuerdo entre evaluadores
Inter-rater agreement
Grado en que varios evaluadores asignan juicios coincidentes a los mismos casos.
Ver definición completa →Cargando diccionario…
Bloque temático
Diseño, ejecución, documentación e interpretación de evaluaciones de modelos y sistemas de inteligencia artificial antes y después del despliegue.
Inter-rater agreement
Grado en que varios evaluadores asignan juicios coincidentes a los mismos casos.
Ver definición completa →Disagreement adjudication
Proceso de revisión para resolver discrepancias entre evaluadores.
Ver definición completa →Evaluation scope
Límites funcionales, poblacionales, temporales y operativos cubiertos por una evaluación.
Ver definición completa →Test case
Entrada, contexto, resultado esperado y criterio de decisión usados para comprobar un comportamiento.
Ver definición completa →Edge case
Situación infrecuente o extrema situada cerca de los límites de funcionamiento esperado.
Ver definición completa →Pairwise comparison
Método en el que un evaluador elige entre dos respuestas producidas bajo condiciones comparables.
Ver definición completa →Evaluation set
Colección de ejemplos reservados para medir el comportamiento del modelo.
Ver definición completa →Challenge set
Colección de casos difíciles creada para revelar fallos que no aparecen en muestras ordinarias.
Ver definición completa →Acceptance criterion
Condición observable que debe cumplirse para aceptar un modelo o una versión.
Ver definición completa →Golden dataset
Conjunto curado de ejemplos y respuestas de referencia usado como base estable de evaluación.
Ver definición completa →AI go/no-go decision
Decisión formal de desplegar, mantener, limitar o retirar un sistema según la evidencia disponible.
Ver definición completa →Rating scale
Conjunto ordenado de categorías o puntuaciones usado para expresar un juicio.
Ver definición completa →Likert scale
Escala ordinal de respuesta con grados de acuerdo, calidad u otra dimensión.
Ver definición completa →Evaluation scenario
Situación de uso representada mediante tareas, usuarios, entorno y restricciones.
Ver definición completa →Champion-challenger strategy
Comparación continua entre el modelo vigente y candidatos alternativos antes de sustituirlo.
Ver definición completa →Evals
Nombre habitual para conjuntos ejecutables de casos, evaluadores y criterios aplicados a modelos de IA.
Ver definición completa →Adversarial evaluation
Evaluación diseñada para encontrar fallos mediante entradas deliberadamente difíciles o manipuladas.
Ver definición completa →Automated evaluation
Evaluación calculada mediante reglas, métricas o programas sin juicio humano directo.
Ver definición completa →Blind evaluation
Evaluación en la que se oculta la identidad del modelo o la condición experimental para reducir sesgos.
Ver definición completa →Continuous evaluation
Repetición programada o activada por eventos para detectar degradación y riesgos emergentes.
Ver definición completa →Quality evaluation
Valoración de propiedades como corrección, relevancia, claridad, utilidad o estilo.
Ver definición completa →Capability evaluation
Medición de lo que un modelo puede realizar en una tarea o conjunto de tareas.
Ver definición completa →Explainability evaluation
Medición de la utilidad, fidelidad y comprensión de explicaciones producidas para un sistema.
Ver definición completa →Reliability evaluation
Medición de la consistencia con la que un sistema mantiene el comportamiento requerido.
Ver definición completa →Model evaluation
Proceso sistemático para medir si un modelo cumple objetivos de rendimiento, calidad y riesgo en un contexto definido.
Ver definición completa →Privacy evaluation
Prueba de riesgos de exposición, memorización o inferencia sobre datos personales o sensibles.
Ver definición completa →Robustness evaluation
Medición de la estabilidad del rendimiento ante perturbaciones, variaciones o condiciones adversas.
Ver definición completa →Safety evaluation
Prueba destinada a detectar comportamientos que puedan causar daño o incumplir restricciones de seguridad.
Ver definición completa →Bias evaluation
Análisis de diferencias sistemáticas de comportamiento o impacto entre grupos y contextos.
Ver definición completa →AI system evaluation
Evaluación del modelo junto con datos, herramientas, interfaz, reglas y operación humana que forman el sistema completo.
Ver definición completa →Dynamic evaluation
Evaluación cuyo contenido o condiciones cambian para reflejar evolución, interacción o nuevos riesgos.
Ver definición completa →In-distribution evaluation
Evaluación con datos que representan la distribución prevista durante el desarrollo.
Ver definición completa →Online evaluation
Evaluación realizada durante el uso real o mediante tráfico controlado en producción.
Ver definición completa →Static evaluation
Evaluación sobre un conjunto fijo de casos y condiciones previamente definidos.
Ver definición completa →Out-of-distribution evaluation
Evaluación con datos o condiciones diferentes de la distribución usada para desarrollar el modelo.
Ver definición completa →Human evaluation
Evaluación basada en juicios emitidos por personas siguiendo instrucciones y criterios definidos.
Ver definición completa →Offline evaluation
Evaluación realizada fuera del tráfico o proceso productivo.
Ver definición completa →Slice-based evaluation
Análisis de rendimiento sobre segmentos definidos por atributos, condiciones o tipos de caso.
Ver definición completa →Model-based evaluation
Uso de otro modelo para puntuar, clasificar o criticar las salidas evaluadas.
Ver definición completa →Subgroup evaluation
Desglose de resultados por grupos relevantes para detectar diferencias ocultas en el promedio.
Ver definición completa →Post-deployment evaluation
Evaluación del comportamiento observado una vez que el sistema está en uso.
Ver definición completa →Pre-deployment evaluation
Conjunto de pruebas ejecutadas antes de autorizar el uso productivo.
Ver definición completa →Pointwise evaluation
Puntuación de cada respuesta de manera independiente, sin compararla directamente con otra.
Ver definición completa →Automated evaluator
Componente que aplica de forma repetible una regla o métrica a las salidas del sistema.
Ver definición completa →Expert evaluator
Evaluador con conocimiento especializado del dominio o de la tarea examinada.
Ver definición completa →Human evaluator
Persona que revisa ejemplos y emite juicios conforme a una guía de anotación.
Ver definición completa →Evaluation uncertainty
Margen de duda asociado al muestreo, los evaluadores, las métricas y la variabilidad del sistema.
Ver definición completa →LLM as a judge
Uso de un modelo de lenguaje como evaluador de respuestas, normalmente mediante una rúbrica.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.