Modelo multimodal nativo
Native multimodal model
Modelo entrenado desde el inicio con varias modalidades dentro de una arquitectura común.
Ver definición completa →Cargando diccionario…
Bloque temático
Modelos que reciben, alinean, razonan o generan información en dos o más modalidades, junto con sus arquitecturas, tareas, evaluación y riesgos.
Native multimodal model
Modelo entrenado desde el inicio con varias modalidades dentro de una arquitectura común.
Ver definición completa →Omni model
Modelo diseñado para aceptar y producir varias modalidades de forma integrada.
Ver definición completa →Video-language model
Modelo que comprende o genera lenguaje condicionado por vídeo.
Ver definición completa →Vision-language model
Modelo que relaciona imágenes y texto.
Ver definición completa →Multimodality
Uso coordinado de varios tipos de señal o representación.
Ver definición completa →Audio-text pair
Clip de audio asociado a una descripción textual.
Ver definición completa →Image-text pair
Imagen asociada a una descripción o texto relacionado.
Ver definición completa →Video-text pair
Vídeo asociado a una descripción o instrucción textual.
Ver definición completa →Perceiver Resampler
Módulo que comprime características visuales variables en un conjunto fijo de tokens.
Ver definición completa →Multimodal pretraining
Entrenamiento previo con grandes colecciones de datos de varias modalidades.
Ver definición completa →Multimodal token budget
Límite de representación asignado a texto, imágenes, audio o vídeo.
Ver definición completa →Multimodal prompt
Instrucción que combina texto con imágenes, audio, vídeo u otros datos.
Ver definición completa →Multimodal projector
Capa que adapta representaciones de una modalidad al espacio del modelo lingüístico.
Ver definición completa →Querying Transformer
Transformer ligero que consulta características visuales para conectarlas con un LLM.
Ver definición completa →Multimodal reasoning
Inferencia que combina evidencia procedente de varias modalidades.
Ver definición completa →Cross-modal retrieval
Búsqueda en una modalidad mediante una consulta expresada en otra.
Ver definición completa →Audio question answering
Respuesta a preguntas sobre contenido de una señal de audio.
Ver definición completa →Multimodal question answering
Respuesta basada en evidencia combinada de varias modalidades.
Ver definición completa →Visual question answering
Respuesta a preguntas sobre una imagen.
Ver definición completa →Multimodal output
Respuesta que combina o produce varias modalidades.
Ver definición completa →Interleaved multimodal sequence
Secuencia que alterna texto, imágenes u otras modalidades en un mismo contexto.
Ver definición completa →Multimodal safety
Controles frente a riesgos específicos de entradas y salidas de varias modalidades.
Ver definición completa →Text modality
Representación lingüística usada dentro de un sistema multimodal.
Ver definición completa →Multimodal token
Token que representa o referencia contenido de una modalidad no textual.
Ver definición completa →Visual token
Unidad latente que representa una región o parche visual.
Ver definición completa →Vision tower
Codificador visual usado para extraer características de imágenes o vídeo.
Ver definición completa →Multimodal context window
Capacidad de contexto compartida por tokens de varias modalidades.
Ver definición completa →Video modality
Secuencia audiovisual o visual temporal usada por el modelo.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.