Acceso directo a memoria
Direct memory access
Acceso directo a memoria es transferencia entre dispositivo y memoria sin intervención continua de CPU.
Ver definición completa →Cargando diccionario…
Bloque temático
Procesadores, aceleradores, memorias, interconexiones y métricas de hardware relevantes para entrenamiento e inferencia de modelos de inteligencia artificial.
Direct memory access
Acceso directo a memoria es transferencia entre dispositivo y memoria sin intervención continua de CPU.
Ver definición completa →Non-uniform memory access
Acceso no uniforme a memoria es arquitectura donde la latencia depende de la ubicación de la memoria.
Ver definición completa →Edge accelerator
Acelerador de borde es chip de bajo consumo para inferencia cerca del origen de datos.
Ver definición completa →AI accelerator
Acelerador de IA es hardware especializado para acelerar entrenamiento o inferencia.
Ver definición completa →Interconnect bandwidth
Ancho de banda de interconexión es volumen de datos transferible por unidad de tiempo.
Ver definición completa →Memory bandwidth
Ancho de banda de memoria es velocidad de transferencia entre procesador y memoria.
Ver definición completa →AI hardware benchmark
Benchmark de hardware de IA es prueba comparable de rendimiento y eficiencia de aceleradores.
Ver definición completa →GPU KV cache
Caché de contexto KV en GPU es memoria de dispositivo que conserva claves y valores de atención.
Ver definición completa →L1 cache
Caché L1 es caché pequeña y rápida cercana a las unidades de ejecución.
Ver definición completa →L2 cache
Caché L2 es caché compartida de segundo nivel.
Ver definición completa →Memory capacity
Capacidad de memoria es cantidad total de datos que puede mantener un dispositivo.
Ver definición completa →Compute-bound workload
Carga limitada por cómputo es carga cuyo cuello de botella es la capacidad aritmética.
Ver definición completa →Memory-bound workload
Carga limitada por memoria es carga limitada por movimiento o acceso a memoria.
Ver definición completa →Application-specific integrated circuit
Circuito integrado de aplicación específica es chip diseñado para una función concreta.
Ver definición completa →Compute capability
Compatibilidad de cómputo es versión de características hardware soportadas por una GPU.
Ver definición completa →Compute Express Link
Compute Express Link es protocolo coherente sobre PCIe para memoria y aceleradores.
Ver definición completa →Compute Unified Device Architecture
CUDA es plataforma y modelo de programación paralela de NVIDIA.
Ver definición completa →CPU memory offload
Desbordamiento a memoria del sistema es traslado de tensores a RAM cuando no caben en memoria aceleradora.
Ver definición completa →Compute device
Dispositivo de cómputo es recurso hardware que ejecuta kernels o gráficos de cálculo.
Ver definición completa →GPU driver
Driver de GPU es software del sistema que controla y expone la GPU.
Ver definición completa →Multi-GPU execution
Ejecución multi-GPU es uso coordinado de varias GPU para una carga.
Ver definición completa →Host-device link
Enlace host-dispositivo es canal físico por el que CPU y acelerador intercambian datos.
Ver definición completa →Discrete GPU
GPU discreta es GPU independiente con recursos y memoria propios.
Ver definición completa →Integrated GPU
GPU integrada es GPU que comparte encapsulado o memoria con la CPU.
Ver definición completa →CPU inference
Inferencia en CPU es ejecución de un modelo utilizando procesadores generales.
Ver definición completa →GPU inference
Inferencia en GPU es ejecución de un modelo usando procesamiento paralelo de GPU.
Ver definición completa →NPU inference
Inferencia en NPU es ejecución de redes neuronales en una unidad especializada.
Ver definición completa →Infinity Fabric
Infinity Fabric es interconexión de AMD para comunicar chiplets y dispositivos.
Ver definición completa →Arithmetic intensity
Intensidad aritmética es relación entre operaciones y bytes transferidos.
Ver definición completa →NVLink
Interconexión NVLink es enlace de alta velocidad entre GPU o entre CPU y GPU.
Ver definición completa →Memory hierarchy
Jerarquía de memoria es niveles de almacenamiento ordenados por latencia, tamaño y proximidad.
Ver definición completa →GPU kernel
Kernel de GPU es función paralela ejecutada en un acelerador.
Ver definición completa →Interconnect latency
Latencia de interconexión es tiempo necesario para transferir datos entre componentes.
Ver definición completa →Thermal throttling
Limitación térmica es reducción automática de frecuencia para controlar temperatura.
Ver definición completa →Field-programmable gate array
Matriz de puertas programable es circuito reconfigurable para implementar pipelines especializados.
Ver definición completa →Systolic array
Matriz sistólica es arquitectura de celdas que mueve datos rítmicamente para calcular matrices.
Ver definición completa →GPU shared memory
Memoria compartida de GPU es memoria rápida accesible por hilos de un mismo bloque.
Ver definición completa →High Bandwidth Memory
Memoria de alto ancho de banda es memoria apilada con gran ancho de banda próxima al acelerador.
Ver definición completa →Video random-access memory
Memoria de vídeo es memoria dedicada usada por una GPU.
Ver definición completa →Pinned memory
Memoria fijada es memoria del host no paginable para transferencias eficientes.
Ver definición completa →Graphics Double Data Rate memory
Memoria GDDR es memoria gráfica de alta velocidad utilizada por GPU discretas.
Ver definición completa →Unified memory
Memoria unificada es espacio de direcciones gestionado entre CPU y GPU.
Ver definición completa →Roofline model
Modelo Roofline es modelo que relaciona intensidad aritmética, ancho de banda y rendimiento.
Ver definición completa →CUDA core
Núcleo CUDA es unidad aritmética programable de una GPU NVIDIA.
Ver definición completa →Tensor core
Núcleo tensorial es unidad especializada en multiplicaciones y acumulaciones matriciales.
Ver definición completa →NVSwitch
NVSwitch es conmutador que conecta múltiples GPU mediante NVLink.
Ver definición completa →GPU occupancy
Ocupación de GPU es proporción de warps activos respecto al máximo soportado.
Ver definición completa →oneAPI
oneAPI es modelo de programación de Intel para hardware heterogéneo.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.