AgentBench
AgentBench
Benchmark para evaluar agentes de lenguaje en entornos interactivos.
Ver definición completa →Cargando diccionario…
Bloque temático
Diseño, uso e interpretación de benchmarks, suites comparativas, tablas de clasificación y pruebas estandarizadas de modelos de IA.
AgentBench
Benchmark para evaluar agentes de lenguaje en entornos interactivos.
Ver definición completa →AlpacaEval
Benchmark automático de seguimiento de instrucciones basado en comparaciones de respuestas.
Ver definición completa →AI2 Reasoning Challenge
Benchmark de preguntas científicas escolares dividido en conjuntos de dificultad distinta.
Ver definición completa →Evaluation harness
Software que carga tareas, ejecuta modelos y calcula resultados de manera estandarizada.
Ver definición completa →Benchmark
Prueba estandarizada que permite medir y comparar sistemas bajo condiciones definidas.
Ver definición completa →Academic benchmark
Benchmark creado principalmente para investigación y comparación científica.
Ver definición completa →Agent benchmark
Benchmark que evalúa planificación, uso de herramientas, memoria y ejecución de tareas por agentes.
Ver definición completa →Coding benchmark
Benchmark que mide generación, comprensión, reparación o ejecución de código.
Ver definición completa →Knowledge benchmark
Benchmark que mide recuperación y aplicación de conocimiento factual o especializado.
Ver definición completa →Long-context benchmark
Benchmark que comprueba el uso fiable de entradas extensas y dependencias alejadas.
Ver definición completa →Domain benchmark
Benchmark centrado en conocimiento y tareas de un sector o disciplina específica.
Ver definición completa →Mathematics benchmark
Benchmark de resolución de problemas matemáticos y cálculo simbólico o numérico.
Ver definición completa →RAG benchmark
Benchmark para medir recuperación, atribución y calidad de respuestas aumentadas con documentos.
Ver definición completa →Reasoning benchmark
Benchmark dirigido a medir resolución de problemas, inferencia o razonamiento estructurado.
Ver definición completa →Robustness benchmark
Benchmark que mide estabilidad frente a perturbaciones y cambios de distribución.
Ver definición completa →Safety benchmark
Benchmark que examina conductas inseguras, abuso, resistencia o cumplimiento de políticas.
Ver definición completa →Bias benchmark
Benchmark orientado a detectar diferencias sistemáticas o estereotipos entre grupos.
Ver definición completa →Dynamic benchmark
Benchmark que renueva casos, datos o condiciones para mantener capacidad discriminativa.
Ver definición completa →Static benchmark
Benchmark con tareas y datos que permanecen esencialmente fijos entre ejecuciones.
Ver definición completa →Few-shot benchmark
Configuración de benchmark que proporciona pocos ejemplos antes de la tarea.
Ver definición completa →Holistic benchmark
Benchmark que combina múltiples escenarios, métricas y dimensiones de riesgo.
Ver definición completa →Industry benchmark
Benchmark orientado a cargas, restricciones o decisiones propias de entornos productivos.
Ver definición completa →Multilingual benchmark
Benchmark que evalúa capacidades en varios idiomas y condiciones lingüísticas.
Ver definición completa →Private benchmark
Benchmark cuyos casos de prueba se mantienen reservados para reducir filtraciones y sobreajuste.
Ver definición completa →Public benchmark
Benchmark cuyos datos, reglas o resultados son accesibles públicamente.
Ver definición completa →Living benchmark
Benchmark mantenido de forma continua con nuevas tareas, modelos y correcciones.
Ver definición completa →Zero-shot benchmark
Configuración de benchmark sin ejemplos demostrativos en el contexto.
Ver definición completa →Benchmarks and comparative tests
Conjunto de métodos estandarizados para comparar modelos mediante tareas, datos, reglas y resultados comunes.
Ver definición completa →Beyond the Imitation Game benchmark
Colección colaborativa de tareas diversas para explorar capacidades y limitaciones emergentes.
Ver definición completa →BIG-bench Hard
Subconjunto de tareas especialmente difíciles extraídas de BIG-bench.
Ver definición completa →Chatbot Arena
Plataforma de comparación pareada y anónima basada en preferencias de usuarios.
Ver definición completa →Benchmark coverage
Proporción y diversidad del espacio de tareas, poblaciones y riesgos representados.
Ver definición completa →Benchmark configuration
Conjunto de modelo, prompt, parámetros, hardware, datos y reglas usado en una ejecución.
Ver definición completa →Benchmark contamination
Presencia de ejemplos o soluciones del benchmark en los datos de entrenamiento o ajuste.
Ver definición completa →Benchmark drift
Cambio en la relevancia o interpretación de una prueba por evolución del dominio o de los sistemas.
Ver definición completa →Discrete Reasoning Over Paragraphs
Benchmark de comprensión lectora que requiere operaciones discretas sobre párrafos.
Ver definición completa →Benchmark run
Instancia concreta y registrada de una prueba comparativa.
Ver definición completa →State of the art
Mejor resultado conocido bajo una configuración de comparación concreta.
Ver definición completa →Test set leakage
Uso directo o indirecto de información reservada para evaluación durante el desarrollo.
Ver definición completa →Benchmark gaming
Mejora aparente lograda explotando reglas o defectos de la prueba en vez de la capacidad buscada.
Ver definición completa →Graduate-Level Google-Proof Q&A
Benchmark de preguntas científicas de nivel de posgrado diseñadas para ser difíciles de buscar y resolver.
Ver definición completa →Grade School Math 8K
Benchmark de problemas verbales de matemáticas de nivel escolar.
Ver definición completa →HellaSwag
Benchmark de finalización de situaciones que mide razonamiento de sentido común.
Ver definición completa →Holistic Evaluation of Language Models
Marco y benchmark holístico para evaluar modelos bajo escenarios y métricas estandarizados.
Ver definición completa →HumanEval
Benchmark de programación que evalúa corrección funcional de soluciones Python generadas desde especificaciones.
Ver definición completa →Instruction-Following Evaluation
Benchmark verificable para medir cumplimiento de instrucciones explícitas.
Ver definición completa →Baseline
Sistema o resultado de referencia contra el que se compara una alternativa.
Ver definición completa →Mostly Basic Python Problems
Benchmark de problemas breves de programación en Python con pruebas funcionales.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.