Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Madaan, Divyam, Chopra, Sumit, Cho, Kyunghyun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal Learning
par: Madaan, Divyam, et autres
Publié: (2024)
par: Madaan, Divyam, et autres
Publié: (2024)
Temporal Generalization: A Reality Check
par: Madaan, Divyam, et autres
Publié: (2025)
par: Madaan, Divyam, et autres
Publié: (2025)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
par: Madaan, Divyam, et autres
Publié: (2025)
par: Madaan, Divyam, et autres
Publié: (2025)
HIST-AID: Leveraging Historical Patient Reports for Enhanced Multi-Modal Automatic Diagnosis
par: Huang, Haoxu, et autres
Publié: (2024)
par: Huang, Haoxu, et autres
Publié: (2024)
Hyperparameters in Continual Learning: A Reality Check
par: Cha, Sungmin, et autres
Publié: (2024)
par: Cha, Sungmin, et autres
Publié: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models
par: Zhu, Mengdan, et autres
Publié: (2024)
par: Zhu, Mengdan, et autres
Publié: (2024)
Everything is a Video: Unifying Modalities through Next-Frame Prediction
par: Hudson, G. Thomas, et autres
Publié: (2024)
par: Hudson, G. Thomas, et autres
Publié: (2024)
Impact of Noisy Supervision in Foundation Model Learning
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Multimodal Latent Language Modeling with Next-Token Diffusion
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap
par: Fahim, Abrar, et autres
Publié: (2024)
par: Fahim, Abrar, et autres
Publié: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2023)
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2023)
Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
par: Huang, Chengyue, et autres
Publié: (2025)
par: Huang, Chengyue, et autres
Publié: (2025)
SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs
par: Hosseini, Parsa, et autres
Publié: (2025)
par: Hosseini, Parsa, et autres
Publié: (2025)
Text-centric Alignment for Multi-Modality Learning
par: Tsai, Yun-Da, et autres
Publié: (2024)
par: Tsai, Yun-Da, et autres
Publié: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
par: Chen, Junyi, et autres
Publié: (2023)
par: Chen, Junyi, et autres
Publié: (2023)
Mem-W: Latent Memory-Native GUI Agents
par: Zhang, Guibin, et autres
Publié: (2026)
par: Zhang, Guibin, et autres
Publié: (2026)
CROME: Cross-Modal Adapters for Efficient Multimodal LLM
par: Ebrahimi, Sayna, et autres
Publié: (2024)
par: Ebrahimi, Sayna, et autres
Publié: (2024)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
par: Ghazanfari, Sara, et autres
Publié: (2024)
par: Ghazanfari, Sara, et autres
Publié: (2024)
Multi-Modal Hallucination Control by Visual Information Grounding
par: Favero, Alessandro, et autres
Publié: (2024)
par: Favero, Alessandro, et autres
Publié: (2024)
A training regime to learn unified representations from complementary breast imaging modalities
par: Sharma, Umang, et autres
Publié: (2024)
par: Sharma, Umang, et autres
Publié: (2024)
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
Deep Augmentation: Dropout as Augmentation for Self-Supervised Learning
par: Brüel-Gabrielsson, Rickard, et autres
Publié: (2023)
par: Brüel-Gabrielsson, Rickard, et autres
Publié: (2023)
Text-to-Image Cross-Modal Generation: A Systematic Review
par: Żelaszczyk, Maciej, et autres
Publié: (2024)
par: Żelaszczyk, Maciej, et autres
Publié: (2024)
The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems
par: Liu, Xiaoze, et autres
Publié: (2026)
par: Liu, Xiaoze, et autres
Publié: (2026)
Similarity-Dissimilarity Loss for Multi-label Supervised Contrastive Learning
par: Huang, Guangming, et autres
Publié: (2024)
par: Huang, Guangming, et autres
Publié: (2024)
Ethology of Latent Spaces
par: Boisnard, Philippe
Publié: (2026)
par: Boisnard, Philippe
Publié: (2026)
Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning
par: Huang, Siteng, et autres
Publié: (2023)
par: Huang, Siteng, et autres
Publié: (2023)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity
par: Liang, Weixin, et autres
Publié: (2025)
par: Liang, Weixin, et autres
Publié: (2025)
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
par: Hakim, Zaber Ibn Abdul, et autres
Publié: (2023)
par: Hakim, Zaber Ibn Abdul, et autres
Publié: (2023)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
No Train, all Gain: Self-Supervised Gradients Improve Deep Frozen Representations
par: Simoncini, Walter, et autres
Publié: (2024)
par: Simoncini, Walter, et autres
Publié: (2024)
Latent Action Pretraining from Videos
par: Ye, Seonghyeon, et autres
Publié: (2024)
par: Ye, Seonghyeon, et autres
Publié: (2024)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
par: Park, Simon, et autres
Publié: (2025)
par: Park, Simon, et autres
Publié: (2025)
Documents similaires
-
Jointly Modeling Inter- & Intra-Modality Dependencies for Multi-modal Learning
par: Madaan, Divyam, et autres
Publié: (2024) -
Temporal Generalization: A Reality Check
par: Madaan, Divyam, et autres
Publié: (2025) -
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
par: Madaan, Divyam, et autres
Publié: (2025) -
HIST-AID: Leveraging Historical Patient Reports for Enhanced Multi-Modal Automatic Diagnosis
par: Huang, Haoxu, et autres
Publié: (2024) -
Hyperparameters in Continual Learning: A Reality Check
par: Cha, Sungmin, et autres
Publié: (2024)