Latencia de cola
Queue latency
Tiempo que una solicitud espera antes de comenzar su procesamiento.
Ver definición completa →Cargando diccionario…
Bloque temático
Métricas, patrones de arquitectura y mecanismos operativos para controlar latencia, capacidad, concurrencia, escalado y resiliencia de servicios de IA.
Queue latency
Tiempo que una solicitud espera antes de comenzar su procesamiento.
Ver definición completa →Tail latency
Latencia observada en percentiles altos que representa las respuestas más lentas.
Ver definición completa →Postprocessing latency
Tiempo dedicado a validar, transformar o enriquecer la salida del modelo.
Ver definición completa →Preprocessing latency
Tiempo dedicado a preparar, validar o transformar la entrada.
Ver definición completa →Time to first response
Tiempo hasta que el usuario recibe la primera señal útil de respuesta.
Ver definición completa →Network latency
Tiempo consumido en transportar datos entre cliente, servicios y proveedores.
Ver definición completa →Client-side latency
Tiempo de respuesta percibido y medido desde el dispositivo o interfaz del usuario.
Ver definición completa →Model latency
Tiempo utilizado por el modelo para procesar entradas y generar salidas.
Ver definición completa →Server-side latency
Tiempo empleado dentro de la infraestructura del servicio para procesar una solicitud.
Ver definición completa →Inter-token latency
Intervalo de tiempo entre fragmentos consecutivos de una respuesta en streaming.
Ver definición completa →Rate limiting
Restricción del número de solicitudes o tokens aceptados por intervalo.
Ver definición completa →Capacity headroom
Capacidad libre mantenida para absorber picos o fallos.
Ver definición completa →Microbatching
Procesamiento de lotes pequeños para equilibrar latencia y rendimiento.
Ver definición completa →Latency objective
Umbral de latencia que un servicio pretende cumplir.
Ver definición completa →Service level objective
Objetivo de nivel de servicio es meta cuantitativa para un indicador de servicio.
Ver definición completa →Throughput objective
Volumen de procesamiento que un servicio pretende sostener.
Ver definición completa →Model serving sharding
Distribución de un modelo o carga entre varios recursos.
Ver definición completa →AI capacity planning
Estimación y provisión de recursos para atender demanda presente y futura.
Ver definición completa →Retry budget
Límite de reintentos permitido para evitar amplificar fallos y carga.
Ver definición completa →Queue depth
Número de trabajos pendientes en una cola.
Ver definición completa →Overload protection
Mecanismos que evitan que una carga excesiva provoque un fallo generalizado.
Ver definición completa →AI load test
Prueba que mide comportamiento bajo un volumen previsto de solicitudes.
Ver definición completa →Soak test
Prueba de carga sostenida para detectar degradación, fugas o acumulación de errores.
Ver definición completa →Retry
Nueva ejecución de una operación después de un fallo recuperable.
Ver definición completa →Idempotent retry
Reintento diseñado para no duplicar efectos aunque la operación se ejecute más de una vez.
Ver definición completa →AI system performance
Capacidad de un sistema de IA para responder con la velocidad, volumen, calidad y estabilidad requeridos.
Ver definición completa →Model replica
Copia desplegada de un modelo que atiende solicitudes.
Ver definición completa →AI service replica
Instancia adicional de un servicio utilizada para escalar o tolerar fallos.
Ver definición completa →Warm pool
Conjunto de instancias preparadas para absorber demanda rápidamente.
Ver definición completa →Service saturation
Estado en el que un recurso se aproxima o supera su capacidad operativa.
Ver definición completa →In-flight requests
Solicitudes aceptadas que todavía no han finalizado.
Ver definición completa →Requests per second
Número de solicitudes que un servicio procesa por segundo.
Ver definición completa →Response streaming
Entrega incremental de la salida antes de que termine la generación completa.
Ver definición completa →Batch size
Número de solicitudes procesadas conjuntamente.
Ver definición completa →Throughput
Cantidad de solicitudes, ejemplos o tokens procesados por unidad de tiempo.
Ver definición completa →Waiting time
Tiempo que una solicitud permanece pendiente antes de recibir servicio.
Ver definición completa →Service time
Tiempo durante el cual una solicitud utiliza activamente un recurso.
Ver definición completa →Time to first token
Tiempo entre iniciar una solicitud y recibir el primer token generado.
Ver definición completa →End-to-end latency
Tiempo transcurrido desde que el cliente inicia una solicitud hasta que recibe el resultado completo.
Ver definición completa →Timeout
Límite temporal tras el cual una operación se considera fallida o se cancela.
Ver definición completa →Tokens per second
Cantidad de tokens de salida generados por unidad de tiempo.
Ver definición completa →Capacity utilization
Porcentaje de capacidad disponible que se encuentra en uso.
Ver definición completa →Latency variability
Dispersión de los tiempos de respuesta entre solicitudes similares.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.