Towards Robust Multimodal Representation: A Unified Approach with Adaptive Experts and Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Moradinasab, Nazanin, Sengupta, Saurav, Liu, Jiebei, Syed, Sana, Brown, Donald E. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features
par: Sengupta, Saurav, et autres
Publié: (2025)
par: Sengupta, Saurav, et autres
Publié: (2025)
Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions
par: Sengupta, Saurav, et autres
Publié: (2025)
par: Sengupta, Saurav, et autres
Publié: (2025)
GenGMM: Generalized Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
par: Moradinasab, Nazanin, et autres
Publié: (2024)
par: Moradinasab, Nazanin, et autres
Publié: (2024)
Automatic Report Generation for Histopathology images using pre-trained Vision Transformers and BERT
par: Sengupta, Saurav, et autres
Publié: (2023)
par: Sengupta, Saurav, et autres
Publié: (2023)
Toward Unified Multimodal Representation Learning for Autonomous Driving
par: Tao, Ximeng, et autres
Publié: (2026)
par: Tao, Ximeng, et autres
Publié: (2026)
ProtoGMM: Multi-prototype Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
par: Moradinasab, Nazanin, et autres
Publié: (2024)
par: Moradinasab, Nazanin, et autres
Publié: (2024)
Hierarchical Adaptive Expert for Multimodal Sentiment Analysis
par: Qin, Jiahao, et autres
Publié: (2025)
par: Qin, Jiahao, et autres
Publié: (2025)
Semantic Residual for Multimodal Unified Discrete Representation
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Learning Unified Representations from Heterogeneous Data for Robust Heart Rate Modeling
par: Huang, Zhengdong, et autres
Publié: (2025)
par: Huang, Zhengdong, et autres
Publié: (2025)
Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning
par: Du, Ruoshuang, et autres
Publié: (2026)
par: Du, Ruoshuang, et autres
Publié: (2026)
Gramian Multimodal Representation Learning and Alignment
par: Cicchetti, Giordano, et autres
Publié: (2024)
par: Cicchetti, Giordano, et autres
Publié: (2024)
Label-efficient Contrastive Learning-based model for nuclei detection and classification in 3D Cardiovascular Immunofluorescent Images
par: Moradinasab, Nazanin, et autres
Publié: (2023)
par: Moradinasab, Nazanin, et autres
Publié: (2023)
Reconstruction Alignment Improves Unified Multimodal Models
par: Xie, Ji, et autres
Publié: (2025)
par: Xie, Ji, et autres
Publié: (2025)
Towards Adversarial Robustness of Model-Level Mixture-of-Experts Architectures for Semantic Segmentation
par: Pavlitska, Svetlana, et autres
Publié: (2024)
par: Pavlitska, Svetlana, et autres
Publié: (2024)
UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations
par: Mühlematter, Dominik J., et autres
Publié: (2025)
par: Mühlematter, Dominik J., et autres
Publié: (2025)
FORESEE: Multimodal and Multi-view Representation Learning for Robust Prediction of Cancer Survival
par: Pan, Liangrui, et autres
Publié: (2024)
par: Pan, Liangrui, et autres
Publié: (2024)
One Adapter for All: Towards Unified Representation in Step-Imbalanced Class-Incremental Learning
par: Zhang, Xiaoyan, et autres
Publié: (2026)
par: Zhang, Xiaoyan, et autres
Publié: (2026)
Can Generative Models Improve Self-Supervised Representation Learning?
par: Ayromlou, Sana, et autres
Publié: (2024)
par: Ayromlou, Sana, et autres
Publié: (2024)
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
par: Wu, Han, et autres
Publié: (2025)
par: Wu, Han, et autres
Publié: (2025)
GOMA: Toward Structure-Driven Multimodal Alignment from a Graph Signal Smoothing Perspective
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Unified Multimodal Uncertain Inference
par: Zhang, Dengjia, et autres
Publié: (2026)
par: Zhang, Dengjia, et autres
Publié: (2026)
Robust Experts: the Effect of Adversarial Training on CNNs with Sparse Mixture-of-Experts Layers
par: Pavlitska, Svetlana, et autres
Publié: (2025)
par: Pavlitska, Svetlana, et autres
Publié: (2025)
An Approach Towards Learning K-means-friendly Deep Latent Representation
par: Roy, Debapriya
Publié: (2024)
par: Roy, Debapriya
Publié: (2024)
Align Your Query: Representation Alignment for Multimodality Medical Object Detection
par: Seo, Ara, et autres
Publié: (2025)
par: Seo, Ara, et autres
Publié: (2025)
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
par: Kim, Shiwon, et autres
Publié: (2026)
par: Kim, Shiwon, et autres
Publié: (2026)
URRL-IMVC: Unified and Robust Representation Learning for Incomplete Multi-View Clustering
par: Teng, Ge, et autres
Publié: (2024)
par: Teng, Ge, et autres
Publié: (2024)
Unified Alignment Protocol: Making Sense of the Unlabeled Data in New Domains
par: Ahmed, Sabbir, et autres
Publié: (2025)
par: Ahmed, Sabbir, et autres
Publié: (2025)
Towards Robust Multimodal Open-set Test-time Adaptation via Adaptive Entropy-aware Optimization
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate
par: Cherian, Anoop, et autres
Publié: (2025)
par: Cherian, Anoop, et autres
Publié: (2025)
Balancing the Scales: Enhancing Fairness in Facial Expression Recognition with Latent Alignment
par: Rizvi, Syed Sameen Ahmad, et autres
Publié: (2024)
par: Rizvi, Syed Sameen Ahmad, et autres
Publié: (2024)
Towards Robust Nonlinear Subspace Clustering: A Kernel Learning Approach
par: Xu, Kunpeng, et autres
Publié: (2025)
par: Xu, Kunpeng, et autres
Publié: (2025)
Unified Lexical Representation for Interpretable Visual-Language Alignment
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Principled Multimodal Representation Learning
par: Liu, Xiaohao, et autres
Publié: (2025)
par: Liu, Xiaohao, et autres
Publié: (2025)
General Transform: A Unified Framework for Adaptive Transform to Enhance Representations
par: Budiutama, Gekko, et autres
Publié: (2025)
par: Budiutama, Gekko, et autres
Publié: (2025)
Towards Achieving Perfect Multimodal Alignment
par: Kamboj, Abhi, et autres
Publié: (2025)
par: Kamboj, Abhi, et autres
Publié: (2025)
Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing
par: Ravirathinam, Praveen, et autres
Publié: (2024)
par: Ravirathinam, Praveen, et autres
Publié: (2024)
On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
par: Cai, Yichao, et autres
Publié: (2025)
par: Cai, Yichao, et autres
Publié: (2025)
When Does Perceptual Alignment Benefit Vision Representations?
par: Sundaram, Shobhita, et autres
Publié: (2024)
par: Sundaram, Shobhita, et autres
Publié: (2024)
SUTrack: Towards Simple and Unified Single Object Tracking
par: Chen, Xin, et autres
Publié: (2024)
par: Chen, Xin, et autres
Publié: (2024)
Documents similaires
-
Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features
par: Sengupta, Saurav, et autres
Publié: (2025) -
Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions
par: Sengupta, Saurav, et autres
Publié: (2025) -
GenGMM: Generalized Gaussian-Mixture-based Domain Adaptation Model for Semantic Segmentation
par: Moradinasab, Nazanin, et autres
Publié: (2024) -
Automatic Report Generation for Histopathology images using pre-trained Vision Transformers and BERT
par: Sengupta, Saurav, et autres
Publié: (2023) -
Toward Unified Multimodal Representation Learning for Autonomous Driving
par: Tao, Ximeng, et autres
Publié: (2026)