1. Large-scale non-linear multimodal semantic embedding
- Author
-
Vanegas Ramírez, Jorge Andrés, Escalante Balderas, Hugo Jair (Thesis advisor), and Gonzalez Osorio, Fabio Augusto
- Subjects
0 Generalidades / Computer science, information and general works ,Kernel methods ,Multi-modal information ,Análisis de datos multimodales ,Multimodal Data Analysis ,Latent semantic embedding ,Machine Learning ,Métodos del kernel ,Información multimodal ,Indexación semántica latente ,Conjuntos de datos a gran escala ,62 Ingeniería y operaciones afines / Engineering ,Large-scale datasets ,Aprendizaje de máquina - Abstract
The main goal of this thesis is to investigate effective and efficient methods to combine complementary evidence, and model the relationships between multiple modalities of multimedia data in order to improve the access and analysis of the information, to finally obtain valuable insights about the data. In this thesis is proposed to use multimodal latent semantic as the strategy that allows us to combine and to exploit the different views from this heterogeneous source of knowledge, by modeling relations between the different modalities and finding a new common low-dimensional semantic representation space. For a richer modeling, it is proposed the usage of kernel-based methods that usually present accurate and robust results. Unfortunately, kernel-based methods present a high computational complexity that makes them infeasible for large data collections. This drawback implies one of the most important challenges addressed in this thesis, which was to investigate alternatives to handle large-scale datasets with modest computational architectures. In this thesis, several kernelized semantic embedding methods based on matrix factorization have been proposed, developed and evaluated. Thanks to the non-linear capabilities of the kernel representations, the proposed methods can model the complex relationships between the different modalities, allowing to construct a richer multimodal representation even when one of the modalities presents incomplete data. Besides, the proposed methods have been designed under a scalable architecture based on two main strategies: online learning and learning-in-a-budget that allow preserving low computational requirements in terms of memory usage and processing time. An extended experimental evaluation shows that the proposed multimodal strategies achieve the state-of-the-art in several data analysis tasks, such as multi-labeling and multi-class classification and cross-modal retrieval and under different learning setups, such as supervised, semi-supervised, and transductive learning. Furthermore, thanks to the online learning and learning-in-a-budget strategies proposed in this thesis, the scalability capabilities are preserved allowing to deal with large-scale multimodal collections. Resumen: El objetivo principal de esta tesis es investigar m´etodos eficaces y eficientes para combinar evidencia complementaria de múltiples modalidades de información multimedia y modelar las relaciones entre éstas, con el fin de mejorar el acceso y el análisis de los datos contenidos. En esta tesis se pretende utilizar la estrategia de semántica latente multimodal, la cual permite combinar y explotar las diferentes vistas de esta fuente de información heterogénea, modelando las relaciones entre las diferentes modalidades y encontrando un nuevo espacio com´un de representación semántica de baja dimensionalidad. Para un modelado más rico, se propone el uso de métodos basados en kernel los cuales usualmente presentan resultados precisos y robustos. Desafortunadamente, los métodos basados en kernel presentan una alta complejidad computacional que los hace inviables para grandes colecciones de datos. Este inconveniente implica uno de los desafíos más importantes abordados en esta tesis, que fue investigar alternativas para manejar conjuntos de datos de gran escala con modestas arquitecturas computacionales. En esta tesis, han sido propuestos, desarrollados y evaluados varios métodos kernelizados de semántica latente basados en factorización de matrices, donde, gracias a las capacidades no lineales de las representaciones basadas en kernels, los métodos propuestos pueden modelar las relaciones complejas entre las diferentes modalidades, lo que permite construir una representación multimodal enriquecida, incluso cuando una de las modalidades presenta datos incompletos. Además, los métodos propuestos han sido diseñaados bajo una arquitectura escalable basada en dos estrategias principales: el aprendizaje en línea y el aprendizaje bajo presupuesto que permiten preservar bajos requerimientos computacionales en términos de uso de memoria y tiempo de procesamiento. Una extensiva evaluación experimental muestra que las estrategias multimodales propuestas logran el estado del arte en varias tareas de análisis de datos, tales como la anotación multi-etiqueta y la clasificación multi-clase, así como la búsqueda y recuperación intermodal, y bajo diferentes configuraciones de aprendizaje, tales como aprendizaje supervisado, semisupervisado y transductivo. Además, gracias a las estrategias de aprendizaje en línea y de aprendizaje bajo presupuesto propuestas en esta tesis, se preservan las capacidades de escalabilidad, lo que permite tratar con colecciones multimodales de gran escala. Doctorado
- Published
- 2018