Acuerdo de nivel de servicio
Service level agreement
Acuerdo de nivel de servicio es compromiso contractual sobre niveles de servicio.
Ver definición completa →Cargando diccionario…
Bloque temático
Métricas, patrones de arquitectura y mecanismos operativos para controlar latencia, capacidad, concurrencia, escalado y resiliencia de servicios de IA.
Service level agreement
Acuerdo de nivel de servicio es compromiso contractual sobre niveles de servicio.
Ver definición completa →Request batching
Combinación de varias solicitudes para procesarlas conjuntamente.
Ver definición completa →Warm start
Inicio de una ejecución con recursos o modelo ya preparados.
Ver definición completa →Cold start
Arranque en frío es latencia inicial al crear o cargar un recurso inactivo.
Ver definición completa →Autoscaling
Autoescalado es ajuste automático de capacidad según métricas o demanda.
Ver definición completa →Node autoscaling
Adición o retirada automática de nodos de cómputo.
Ver definición completa →Horizontal workload autoscaling
Ajuste automático del número de réplicas según métricas de demanda.
Ver definición completa →Predictive autoscaling
Ajuste anticipado de capacidad usando previsiones de demanda.
Ver definición completa →Scheduled autoscaling
Ajuste de capacidad según horarios o eventos previstos.
Ver definición completa →Vertical workload autoscaling
Ajuste automático de CPU, memoria u otros recursos por instancia.
Ver definición completa →Exponential backoff
Incremento progresivo del tiempo de espera entre reintentos.
Ver definición completa →Backpressure
Mecanismo por el que un consumidor saturado limita el ritmo de entrada.
Ver definición completa →Load balancing
Distribución de solicitudes entre instancias disponibles.
Ver definición completa →Least-connections load balancing
Enrutamiento hacia la instancia con menos solicitudes activas.
Ver definición completa →Round-robin load balancing
Distribución cíclica de solicitudes entre instancias.
Ver definición completa →Continuous batching
Incorporación y retirada continua de secuencias durante la generación.
Ver definición completa →Dynamic batching
Formación de lotes en tiempo de ejecución según carga y límites de espera.
Ver definición completa →Production benchmark
Medición reproducible de rendimiento en condiciones cercanas a producción.
Ver definición completa →Bulkhead
Aislamiento de recursos o grupos de trabajo para contener fallos y saturación.
Ver definición completa →Response cache
Almacenamiento temporal de respuestas reutilizables para evitar trabajo repetido.
Ver definición completa →Bounded queue
Cola con un número máximo de elementos para evitar crecimiento ilimitado.
Ver definición completa →Request queue
Estructura que retiene solicitudes pendientes de procesamiento.
Ver definición completa →Priority queue
Cola que ordena trabajos según prioridad.
Ver definición completa →Health check
Prueba periódica para determinar si una instancia puede recibir tráfico.
Ver definición completa →Concurrencia
Concepto de latencia, escalabilidad y rendimiento identificado en el inventario de referencia.
Ver definición completa →Request concurrency
Número de solicitudes que se procesan simultáneamente.
Ver definición completa →Admission control
Control de admisión es validación y modificación de solicitudes antes de aceptar una carga.
Ver definición completa →Leaky bucket
Algoritmo que suaviza tráfico liberándolo a un ritmo controlado.
Ver definición completa →Token bucket
Algoritmo de limitación que acumula permisos de consumo a una tasa definida.
Ver definición completa →Deadline
Instante límite absoluto para completar una operación.
Ver definición completa →Serving speculative decoding
Uso coordinado de propuestas rápidas y verificación para acelerar generación.
Ver definición completa →Graceful degradation
Reducción controlada de funciones o calidad sin caída completa del servicio.
Ver definición completa →Load shedding
Rechazo controlado de trabajo para proteger la estabilidad del sistema.
Ver definición completa →Elasticity
Capacidad de ajustar recursos al alza o a la baja según demanda.
Ver definición completa →Locality-aware routing
Selección de destino considerando región, zona o proximidad de datos.
Ver definición completa →Latency-based routing
Selección de proveedor o instancia según el tiempo de respuesta esperado.
Ver definición completa →Horizontal scalability
Capacidad de aumentar rendimiento añadiendo instancias o réplicas.
Ver definición completa →Vertical scalability
Capacidad de aumentar rendimiento asignando más recursos a una instancia.
Ver definición completa →Scale down
Reducción de recursos asignados a una instancia.
Ver definición completa →Scale up
Aumento de recursos asignados a una instancia.
Ver definición completa →Scale in
Retirada de instancias cuando disminuye la carga.
Ver definición completa →Scale out
Adición de instancias para repartir la carga.
Ver definición completa →Maximum batch delay
Tiempo máximo que una solicitud puede esperar para formar un lote.
Ver definición completa →Performance fallback
Alternativa simplificada utilizada para mantener servicio bajo degradación.
Ver definición completa →Service level indicator
Indicador de nivel de servicio es métrica que representa una dimensión del servicio.
Ver definición completa →Circuit breaker
Control que deja de llamar temporalmente a un servicio que falla repetidamente.
Ver definición completa →Retry jitter
Variación aleatoria añadida a los intervalos para evitar reintentos sincronizados.
Ver definición completa →Latency
Tiempo transcurrido desde una solicitud hasta la respuesta o resultado medido.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.