MLPerf
MLPerf
Familia de benchmarks de MLCommons para entrenamiento, inferencia y sistemas de aprendizaje automático.
Ver definición completa →Cargando diccionario…
Bloque temático
Diseño, uso e interpretación de benchmarks, suites comparativas, tablas de clasificación y pruebas estandarizadas de modelos de IA.
MLPerf
Familia de benchmarks de MLCommons para entrenamiento, inferencia y sistemas de aprendizaje automático.
Ver definición completa →Massive Multitask Language Understanding
Benchmark de preguntas de opción múltiple que cubre numerosas materias académicas y profesionales.
Ver definición completa →Massive Multitask Language Understanding Pro
Extensión más exigente de MMLU con preguntas revisadas y mayor número de opciones.
Ver definición completa →Multi-turn benchmark
Benchmark de conversación multivuelta evaluado mediante jueces humanos o modelos.
Ver definición completa →Comparative test
Prueba diseñada para contrastar dos o más sistemas con el mismo procedimiento.
Ver definición completa →Benchmark score
Resultado cuantitativo obtenido por un sistema en un benchmark.
Ver definición completa →Model rank
Posición relativa de un modelo dentro de una tabla de resultados.
Ver definición completa →Model Elo rating
Puntuación relativa estimada a partir de enfrentamientos pareados entre modelos.
Ver definición completa →Benchmark reproducibility
Capacidad de repetir una ejecución y obtener resultados comparables con la configuración publicada.
Ver definición completa →Benchmark saturation
Pérdida de capacidad discriminativa cuando muchos sistemas alcanzan resultados próximos al máximo.
Ver definición completa →Benchmark overfitting
Optimización excesiva para una prueba concreta sin mejora equivalente en uso real.
Ver definición completa →Stanford Question Answering Dataset
Benchmark de respuesta extractiva a preguntas sobre fragmentos de texto.
Ver definición completa →Benchmark suite
Colección coordinada de benchmarks que cubre varias tareas, capacidades o riesgos.
Ver definición completa →SWE-bench
Benchmark de ingeniería de software basado en incidencias y cambios reales de repositorios.
Ver definición completa →Leaderboard
Tabla que ordena modelos según resultados publicados en una prueba o conjunto de pruebas.
Ver definición completa →Hidden test set
Conjunto de prueba no revelado a los participantes antes de la evaluación.
Ver definición completa →ToolBench
Benchmark y conjunto de datos para uso de herramientas mediante modelos de lenguaje.
Ver definición completa →TruthfulQA
Benchmark que mide si un modelo evita respuestas falsas asociadas a ideas erróneas comunes.
Ver definición completa →Benchmark validity
Grado en que la prueba sustenta las conclusiones que se extraen de sus resultados.
Ver definición completa →Benchmark freshness
Grado en que los casos siguen siendo actuales, no contaminados y representativos.
Ver definición completa →WinoGrande
Benchmark de razonamiento de sentido común basado en resolución de referencias ambiguas.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.