Aceleración por esparsidad
Sparsity acceleration
Aceleración por esparsidad es aprovechamiento hardware o software de valores cero.
Ver definición completa →Cargando diccionario…
Bloque temático
Técnicas numéricas, de compilación y de ejecución que reducen memoria, coste o latencia de modelos manteniendo una calidad aceptable.
Sparsity acceleration
Aceleración por esparsidad es aprovechamiento hardware o software de valores cero.
Ver definición completa →Higher-precision accumulation
Acumulación en mayor precisión es suma de productos en un formato más preciso que las entradas.
Ver definición completa →Memory-efficient attention
Atención eficiente en memoria es implementación que evita materializar matrices intermedias grandes.
Ver definición completa →Kernel autotuning
Autotuning de kernels es medición automática de variantes para elegir la más rápida.
Ver definición completa →Brain floating point 16
Bfloat16 es formato de 16 bits con exponente similar a FP32.
Ver definición completa →Quantization configuration search
Búsqueda de configuración de cuantización es selección automática de bits y granularidad.
Ver definición completa →Quantization calibration
Calibración de cuantización es estimación de rangos usando datos representativos.
Ver definición completa →Activation clipping
Clipping de activaciones es limitación deliberada del rango de activaciones.
Ver definición completa →8-bit floating point
Coma flotante de 8 bits es familia de formatos flotantes de ocho bits.
Ver definición completa →Weight sharing
Compartición de pesos es reutilización de un mismo valor entre múltiples conexiones.
Ver definición completa →Ahead-of-time compilation
Compilación anticipada es compilación realizada antes de ejecutar el modelo.
Ver definición completa →Model compilation
Compilación de modelo es transformación del gráfico en código optimizado para un destino.
Ver definición completa →Just-in-time compilation
Compilación justo a tiempo es compilación realizada durante la ejecución.
Ver definición completa →Model compression
Compresión de modelo es reducción de tamaño o coste preservando utilidad.
Ver definición completa →Quality-performance trade-off
Compromiso calidad-rendimiento es equilibrio entre exactitud, latencia, memoria y coste.
Ver definición completa →Quantization
Cuantización es representación de tensores con menor precisión numérica.
Ver definición completa →Asymmetric quantization
Cuantización asimétrica es mapeo con desplazamiento para cubrir un rango no centrado.
Ver definición completa →Activation-aware Weight Quantization
Cuantización AWQ es método que protege pesos relevantes según activaciones.
Ver definición completa →Activation quantization
Cuantización de activaciones es reducción de precisión de valores intermedios.
Ver definición completa →Block-wise quantization
Cuantización de bloque es aplicación de escalas a bloques pequeños de valores.
Ver definición completa →KV cache quantization
Cuantización de caché KV es reducción de precisión de la caché de atención.
Ver definición completa →Weight-and-activation quantization
Cuantización de pesos y activaciones es reducción conjunta de precisión en pesos y activaciones.
Ver definición completa →Full-range quantization
Cuantización de rango completo es uso de todo el rango representable del formato.
Ver definición completa →Dynamic quantization
Cuantización dinámica es cálculo de parámetros de activación durante la ejecución.
Ver definición completa →Static quantization
Cuantización estática es uso de parámetros fijados mediante calibración previa.
Ver definición completa →GPTQ
Cuantización GPTQ es método post-entrenamiento de cuantización de pesos para transformadores.
Ver definición completa →Layer-wise mixed quantization
Cuantización mixta por capa es asignación de precisiones distintas según sensibilidad de cada capa.
Ver definición completa →Per-channel quantization
Cuantización por canal es parámetros distintos para cada canal.
Ver definición completa →Group-wise quantization
Cuantización por grupo es parámetros compartidos por grupos de valores.
Ver definición completa →Per-tensor quantization
Cuantización por tensor es un único conjunto de parámetros para todo el tensor.
Ver definición completa →Post-training quantization
Cuantización post-entrenamiento es cuantización aplicada después de entrenar el modelo.
Ver definición completa →Hessian-aware quantization
Cuantización sensible a Hessiana es método que usa información de curvatura para minimizar error.
Ver definición completa →Symmetric quantization
Cuantización simétrica es mapeo numérico centrado en cero.
Ver definición completa →Fake quantization
Cuantización simulada es simulación de redondeo y saturación durante entrenamiento.
Ver definición completa →Data-free quantization
Cuantización sin datos es cuantización que no requiere el dataset original.
Ver definición completa →Weight-only quantization
Cuantización solo de pesos es reducción de precisión aplicada únicamente a los pesos.
Ver definición completa →Calibration dataset
Dataset de calibración es muestra de entradas usada para ajustar rangos.
Ver definición completa →Low-rank decomposition
Descomposición de bajo rango es aproximación de matrices mediante factores de rango menor.
Ver definición completa →Tensor decomposition
Descomposición tensorial es factorización de tensores para reducir parámetros y cálculo.
Ver definición completa →Dequantization
Descuantización es reconstrucción aproximada de valores de mayor precisión.
Ver definición completa →E4M3
E4M3 es formato FP8 con cuatro bits de exponente y tres de mantisa.
Ver definición completa →E5M2
E5M2 es formato FP8 con cinco bits de exponente y dos de mantisa.
Ver definición completa →Dead code elimination
Eliminación de código muerto es supresión de nodos sin efecto en la salida.
Ver definición completa →2-bit integer
Entero de 2 bits es representación entera de dos bits.
Ver definición completa →4-bit integer
Entero de 4 bits es representación entera de cuatro bits.
Ver definición completa →8-bit integer
Entero de 8 bits es representación entera de ocho bits.
Ver definición completa →Quantization-aware training
Entrenamiento consciente de cuantización es entrenamiento que simula efectos de baja precisión.
Ver definición completa →Quantization error
Error de cuantización es diferencia introducida por redondeo y rango limitado.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.