Acceso remoto directo a memoria
Remote Direct Memory Access
Acceso remoto directo a memoria es transferencia directa entre memorias sin copiar por la CPU.
Ver definición completa →Cargando diccionario…
Bloque temático
Arquitecturas de cómputo, orquestación, almacenamiento, redes y operación necesarias para entrenar, desplegar y mantener sistemas de inteligencia artificial de forma fiable.
Remote Direct Memory Access
Acceso remoto directo a memoria es transferencia directa entre memorias sin copiar por la CPU.
Ver definición completa →Accelerator
Acelerador es dispositivo especializado que descarga operaciones intensivas del procesador general.
Ver definición completa →All-reduce
All-reduce es operación colectiva que agrega valores y devuelve el resultado a todos.
Ver definición completa →Distributed storage
Almacenamiento distribuido es sistema que reparte datos y redundancia entre varios nodos.
Ver definición completa →Local scratch storage
Almacenamiento temporal local es espacio rápido y efímero próximo al cómputo.
Ver definición completa →High availability
Alta disponibilidad es diseño que reduce interrupciones mediante redundancia y recuperación.
Ver definición completa →Bisection bandwidth
Ancho de banda de bisección es capacidad total que atraviesa un corte equilibrado de la red.
Ver definición completa →Autoscaling
Autoescalado es ajuste automático de capacidad según métricas o demanda.
Ver definición completa →Load balancer
Balanceador de carga es componente que distribuye solicitudes entre réplicas.
Ver definición completa →Dataset cache
Caché de datasets es copia rápida de datos de entrenamiento usada para reducir lecturas remotas.
Ver definición completa →Elastic capacity
Capacidad elástica es recursos que aumentan o disminuyen según la demanda.
Ver definición completa →Reserved capacity
Capacidad reservada es recursos apartados con antelación para asegurar disponibilidad.
Ver definición completa →Data center
Centro de datos es instalación que alberga sistemas de cómputo, red, energía y refrigeración.
Ver definición completa →Distributed checkpoint
Checkpoint distribuido es estado de entrenamiento guardado en paralelo desde varios procesos.
Ver definición completa →Training cluster
Clúster de entrenamiento es conjunto de nodos coordinados para entrenar modelos.
Ver definición completa →Inference cluster
Clúster de inferencia es conjunto de nodos dedicado a servir predicciones o generaciones.
Ver definición completa →Job queue
Lista persistente de tareas pendientes de ejecución.
Ver definición completa →Collective communication
Comunicación colectiva es operación coordinada de intercambio entre varios procesos.
Ver definición completa →Failover
Conmutación por error es traslado automático o manual a un recurso alternativo.
Ver definición completa →Network contention
Contención de red es degradación causada por varias transferencias que compiten por enlaces.
Ver definición completa →Container
Contenedor es unidad aislada que empaqueta aplicación y dependencias.
Ver definición completa →Admission control
Control de admisión es validación y modificación de solicitudes antes de aceptar una carga.
Ver definición completa →Resource quota
Cuota de recursos es límite agregado aplicado a un espacio o equipo.
Ver definición completa →Compute density
Densidad de cómputo es capacidad de procesamiento concentrada por espacio o unidad de energía.
Ver definición completa →Kubernetes Deployment
Deployment de Kubernetes es recurso que gestiona réplicas y actualizaciones de pods.
Ver definición completa →Availability
Disponibilidad es proporción de tiempo en que un servicio está operativo.
Ver definición completa →Horizontal scaling
Escalado horizontal es aumento de capacidad mediante más instancias.
Ver definición completa →Vertical scaling
Escalado vertical es aumento de recursos de una instancia existente.
Ver definición completa →GPUDirect RDMA
GPUDirect RDMA es acceso remoto directo a memoria de GPU mediante adaptadores compatibles.
Ver definición completa →Node pool
Grupo de nodos es conjunto homogéneo de nodos administrado como una unidad.
Ver definición completa →Accelerator host
Host de aceleradores es servidor configurado para alojar una o varias unidades aceleradoras.
Ver definición completa →Container image
Imagen de contenedor es artefacto inmutable usado para crear contenedores.
Ver definición completa →InfiniBand
InfiniBand es tecnología de interconexión usada en clústeres de alto rendimiento.
Ver definición completa →AI infrastructure
Infraestructura de IA es conjunto coordinado de recursos físicos y lógicos que soporta cargas de IA.
Ver definición completa →Kubernetes
Kubernetes es plataforma declarativa para orquestar contenedores.
Ver definición completa →Resource limit
Control o concepto defensivo relacionado con validación, filtrado y aplicación de políticas sobre entradas y salidas.
Ver definición completa →Data locality
Localidad de datos es proximidad entre los datos y el recurso que los procesa.
Ver definición completa →Infrastructure log
Log de infraestructura es registro de eventos producido por componentes de plataforma.
Ver definición completa →Zero-downtime maintenance
Mantenimiento sin interrupción es actualización o reparación sin detener el servicio completo.
Ver definición completa →Infrastructure metric
Métrica de infraestructura es medición temporal de uso, capacidad o salud.
Ver definición completa →Kubernetes namespace
Namespace de Kubernetes es partición lógica para organizar y aislar recursos de un clúster.
Ver definición completa →NVIDIA Collective Communications Library
NCCL es biblioteca de comunicaciones colectivas para múltiples GPU.
Ver definición completa →Compute node
Nodo de cómputo es servidor que aporta CPU, memoria o aceleradores a un clúster.
Ver definición completa →Control-plane node
Nodo de control es nodo que ejecuta servicios de coordinación y estado del clúster.
Ver definición completa →Worker node
Nodo trabajador es nodo que ejecuta cargas de trabajo asignadas por el orquestador.
Ver definición completa →Recovery point objective
Objetivo de punto de recuperación es pérdida máxima de datos aceptable medida en tiempo.
Ver definición completa →Recovery time objective
Objetivo de tiempo de recuperación es tiempo máximo previsto para restaurar un servicio.
Ver definición completa →Infrastructure observability
Observabilidad de infraestructura es capacidad de comprender el estado interno mediante señales operativas.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.