Adaptador multimodal
Multimodal adapter
Módulo ligero que conecta un codificador de modalidad con otro modelo.
Ver definición completa →Cargando diccionario…
Bloque temático
Modelos que reciben, alinean, razonan o generan información en dos o más modalidades, junto con sus arquitecturas, tareas, evaluación y riesgos.
Multimodal adapter
Módulo ligero que conecta un codificador de modalidad con otro modelo.
Ver definición completa →Multimodal instruction tuning
Ajuste del modelo con instrucciones y respuestas que incluyen varias modalidades.
Ver definición completa →Audio-text alignment
Correspondencia semántica entre audio y lenguaje.
Ver definición completa →Image-text alignment
Correspondencia semántica entre imágenes y descripciones.
Ver definición completa →Multimodal alignment
Aprendizaje de correspondencias entre elementos de modalidades diferentes.
Ver definición completa →Video-text alignment
Correspondencia semántica entre secuencias de vídeo y texto.
Ver definición completa →Audio hallucination
Afirmación sobre audio que no está sustentada por la señal.
Ver definición completa →Multimodal hallucination
Contenido no respaldado por la evidencia disponible en una o varias modalidades.
Ver definición completa →Visual hallucination
Afirmación sobre una imagen que no está sustentada por sus píxeles.
Ver definición completa →Visual grounding
Vinculación de palabras o frases con regiones concretas de una imagen.
Ver definición completa →Multimodal contrastive learning
Entrenamiento que acerca pares relacionados y separa pares no relacionados entre modalidades.
Ver definición completa →Multimodal in-context learning
Uso de ejemplos multimodales dentro del prompt sin actualizar pesos.
Ver definición completa →Multimodal few-shot learning
Adaptación a una tarea multimodal usando pocos ejemplos en contexto.
Ver definición completa →Audio modality
Señal acústica usada como entrada o salida multimodal.
Ver definición completa →Multimodal benchmark
Conjunto de pruebas que evalúa capacidades combinadas de varias modalidades.
Ver definición completa →Modality gap
Diferencia estructural o estadística entre representaciones de modalidades.
Ver definición completa →Modality-specific encoder
Codificador especializado en una modalidad antes de la fusión.
Ver definición completa →Multimodal encoder
Componente que produce representaciones combinadas de varias modalidades.
Ver definición completa →Referring expression comprehension
Identificación del objeto al que se refiere una expresión lingüística.
Ver definición completa →OCR-free document understanding
Interpretación directa de documentos visuales sin una etapa OCR separada.
Ver definición completa →Visual understanding
Interpretación de objetos, relaciones, escenas y texto en imágenes.
Ver definición completa →Modality connector
Interfaz aprendida que permite transferir información entre representaciones.
Ver definición completa →Modality conversion
Transformación de información de una modalidad a otra.
Ver definición completa →Sensor modality
Mediciones físicas incorporadas junto con lenguaje u otras señales.
Ver definición completa →Interleaved multimodal data
Datos donde texto e imágenes o vídeos aparecen en secuencia contextual.
Ver definición completa →Multimodal decoder
Componente que genera una o varias modalidades desde una representación común.
Ver definición completa →Image captioning
Generación de una descripción textual de una imagen.
Ver definición completa →Video captioning
Generación de texto que resume escenas y acciones de un vídeo.
Ver definición completa →Modality imbalance
Predominio de una modalidad sobre otras durante entrenamiento o inferencia.
Ver definición completa →Document modality
Documento cuya combinación de texto, estructura e imagen se trata de forma conjunta.
Ver definición completa →Document visual question answering
Respuesta a preguntas usando texto, estructura y apariencia de documentos.
Ver definición completa →Modality dropout
Omisión deliberada de modalidades durante entrenamiento para mejorar robustez.
Ver definición completa →Multimodal embedding
Vector situado en un espacio compartido por varias modalidades.
Ver definición completa →Multimodal input
Entrada compuesta por dos o más modalidades.
Ver definición completa →Shared representation space
Espacio latente común donde señales de distintas modalidades son comparables.
Ver definición completa →Intermediate fusion
Combinación de representaciones después de codificación parcial.
Ver definición completa →Cross-attention fusion
Integración de modalidades mediante atención entre secuencias distintas.
Ver definición completa →Late fusion
Combinación de predicciones o representaciones finales de cada modalidad.
Ver definición completa →Early fusion
Combinación de modalidades en etapas iniciales del procesamiento.
Ver definición completa →Cross-modal generation
Producción de una modalidad condicionada por otra distinta.
Ver definición completa →Image modality
Información visual estática usada como entrada o salida.
Ver definición completa →Cross-modal inconsistency
Contradicción entre información de modalidades diferentes.
Ver definición completa →Real-time multimodal interaction
Procesamiento continuo y de baja latencia de señales como voz, imagen y texto.
Ver definición completa →Modality
Tipo de información con estructura y propiedades propias.
Ver definición completa →Missing modality
Situación en la que una modalidad esperada no está disponible.
Ver definición completa →Audio-language model
Modelo que relaciona señales de audio con representaciones lingüísticas.
Ver definición completa →Speech-to-speech model
Modelo que recibe voz y produce voz preservando contenido conversacional.
Ver definición completa →Multimodal model
Modelo capaz de procesar o generar más de una modalidad de información.
Ver definición completa →Diagnóstico de procesos
Software interno a medida
Automatización de tareas repetitivas
Integración de sistemas y APIs
IA aplicada solo cuando aporta valor
© 2026 Camilo Boo. Automatización de procesos y software interno.