Escala de cuantización
Quantization scale
Escala de cuantización es factor que relaciona valores reales y enteros.
Ver definición completa →Cargando diccionario…
Bloque temático
Técnicas numéricas, de compilación y de ejecución que reducen memoria, coste o latencia de modelos manteniendo una calidad aceptable.
Quantization scale
Escala de cuantización es factor que relaciona valores reales y enteros.
Ver definición completa →Sparsity
Esparsidad es proporción elevada de valores cero en tensores.
Ver definición completa →N:M sparsity
Esparsidad N:M es patrón que conserva N valores de cada grupo de M.
Ver definición completa →FlashAttention
FlashAttention es algoritmo exacto de atención que reduce movimientos de memoria.
Ver definición completa →Optimized model format
Formato de modelo optimizado es representación preparada para un runtime y hardware concretos.
Ver definición completa →Operator fusion
Fusión de operadores es combinación de varias operaciones en una implementación.
Ver definición completa →Quantization granularity
Granularidad de cuantización es tamaño de la unidad que comparte escala y punto cero.
Ver definición completa →Model memory footprint
Huella de memoria del modelo es memoria total necesaria para pesos y estado de ejecución.
Ver definición completa →Kernel fusion
Kernel fusion es ejecución de operaciones consecutivas en un único kernel.
Ver definición completa →Microscaling FP4
Microscaling FP4 es formato de cuatro bits con escalas compartidas por bloques.
Ver definición completa →NormalFloat 4
NormalFloat 4 es formato de cuatro bits adaptado a distribuciones normales.
Ver definición completa →Quantization observer
Observador de cuantización es componente que recoge estadísticas de tensores.
Ver definición completa →Graph optimization
Optimización de grafo es reescritura del grafo para eliminar o combinar operaciones.
Ver definición completa →Inference optimization
Optimización de inferencia es conjunto de técnicas para reducir latencia, memoria o coste.
Ver definición completa →Hardware-specific optimization
Optimización específica de hardware es transformación adaptada a instrucciones y memoria del destino.
Ver definición completa →Activation outlier
Outlier de activación es valor extremo que dificulta representar el resto con baja precisión.
Ver definición completa →PagedAttention
PagedAttention es gestión de caché KV mediante bloques no contiguos.
Ver definición completa →Inference profiling
Perfilado de inferencia es medición detallada de tiempo y memoria por operación.
Ver definición completa →Constant folding
Plegado de constantes es cálculo anticipado de expresiones constantes.
Ver definición completa →Structured pruning
Poda estructurada es eliminación de canales, cabezas, filas u otros bloques.
Ver definición completa →Unstructured pruning
Poda no estructurada es eliminación de pesos individuales.
Ver definición completa →Magnitude pruning
Poda por magnitud es eliminación de pesos según su valor absoluto.
Ver definición completa →16-bit floating point
Precisión FP16 es formato de coma flotante de 16 bits.
Ver definición completa →32-bit floating point
Precisión FP32 es formato de coma flotante de 32 bits.
Ver definición completa →Mixed precision
Precisión mixta es uso combinado de varios formatos numéricos.
Ver definición completa →Weight prepacking
Preempaquetado de pesos es reorganización previa de pesos para kernels específicos.
Ver definición completa →Execution provider
Proveedor de ejecución es backend que asigna subgrafos a hardware específico.
Ver definición completa →Pruning
Pruning es eliminación de parámetros o estructuras poco relevantes.
Ver definición completa →Quantization zero point
Punto cero de cuantización es valor entero que representa el cero real.
Ver definición completa →Accuracy regression
Regresión de precisión es pérdida medible de calidad tras una optimización.
Ver definición completa →Numeric saturation
Saturación numérica es recorte de valores que exceden el rango representable.
Ver definición completa →Kernel selection
Selección de kernel es elección de la implementación más adecuada para forma y hardware.
Ver definición completa →Quantization sensitivity
Sensibilidad a la cuantización es grado en que una capa pierde calidad al reducir precisión.
Ver definición completa →SmoothQuant
SmoothQuant es método que redistribuye dificultad entre activaciones y pesos.
Ver definición completa →Speedup
Speedup es relación entre tiempo base y tiempo optimizado.
Ver definición completa →TensorFloat-32
TensorFloat-32 es formato de cálculo de NVIDIA para operaciones tensoriales.
Ver definición completa →Post-quantization validation
Validación posterior a cuantización es comparación de calidad y rendimiento tras convertir el modelo.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.