On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Yichao, Liu, Yuhang, Gao, Erdun, Jiang, Tianjiao, Zhang, Zhen, Hengel, Anton van den, Shi, Javen Qinfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
par: Jiang, Tianjiao, et autres
Publié: (2025)
par: Jiang, Tianjiao, et autres
Publié: (2025)
Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning
par: Liu, Yuhang, et autres
Publié: (2024)
par: Liu, Yuhang, et autres
Publié: (2024)
CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts
par: Cai, Yichao, et autres
Publié: (2023)
par: Cai, Yichao, et autres
Publié: (2023)
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
par: Tian, Mingkai, et autres
Publié: (2025)
par: Tian, Mingkai, et autres
Publié: (2025)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
par: Mohammadi, Bahram, et autres
Publié: (2025)
par: Mohammadi, Bahram, et autres
Publié: (2025)
Concept Component Analysis: A Principled Approach for Concept Extraction in LLMs
par: Liu, Yuhang, et autres
Publié: (2026)
par: Liu, Yuhang, et autres
Publié: (2026)
I Predict Therefore I Am: Is Next Token Prediction Enough to Learn Human-Interpretable Concepts from Data?
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence
par: Cai, Yichao, et autres
Publié: (2026)
par: Cai, Yichao, et autres
Publié: (2026)
A Survey on Deep Neural Network Pruning-Taxonomy, Comparison, Analysis, and Recommendations
par: Cheng, Hongrong, et autres
Publié: (2023)
par: Cheng, Hongrong, et autres
Publié: (2023)
A Simple-but-effective Baseline for Training-free Class-Agnostic Counting
par: Lin, Yuhao, et autres
Publié: (2024)
par: Lin, Yuhao, et autres
Publié: (2024)
Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers
par: Shinnick, Zachary, et autres
Publié: (2025)
par: Shinnick, Zachary, et autres
Publié: (2025)
Premonition: Using Generative Models to Preempt Future Data Changes in Continual Learning
par: McDonnell, Mark D., et autres
Publié: (2024)
par: McDonnell, Mark D., et autres
Publié: (2024)
Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors
par: Xia, Jiatong, et autres
Publié: (2026)
par: Xia, Jiatong, et autres
Publié: (2026)
Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings
par: Yin, Wei, et autres
Publié: (2022)
par: Yin, Wei, et autres
Publié: (2022)
Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction
par: Liu, Zheyuan, et autres
Publié: (2025)
par: Liu, Zheyuan, et autres
Publié: (2025)
Let Your Video Listen to Your Music!
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
What Makes a Representation Good for Single-Cell Perturbation Prediction?
par: Jiang, Wenkang, et autres
Publié: (2026)
par: Jiang, Wenkang, et autres
Publié: (2026)
Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors
par: Lu, Haodong, et autres
Publié: (2025)
par: Lu, Haodong, et autres
Publié: (2025)
Augmented Commonsense Knowledge for Remote Object Grounding
par: Mohammadi, Bahram, et autres
Publié: (2024)
par: Mohammadi, Bahram, et autres
Publié: (2024)
RanPAC: Random Projections and Pre-trained Models for Continual Learning
par: McDonnell, Mark D., et autres
Publié: (2023)
par: McDonnell, Mark D., et autres
Publié: (2023)
Representation Space Constrained Learning with Modality Decoupling for Multimodal Object Detection
par: Shao, YiKang, et autres
Publié: (2025)
par: Shao, YiKang, et autres
Publié: (2025)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
par: Qian, Chengxuan, et autres
Publié: (2025)
par: Qian, Chengxuan, et autres
Publié: (2025)
Hierarchical Process Reward Models are Symbolic Vision Learners
par: Zhang, Shan, et autres
Publié: (2025)
par: Zhang, Shan, et autres
Publié: (2025)
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
par: Yang, Xianghui, et autres
Publié: (2024)
par: Yang, Xianghui, et autres
Publié: (2024)
Towards Identifiable Latent Additive Noise Models
par: Liu, Yuhang, et autres
Publié: (2024)
par: Liu, Yuhang, et autres
Publié: (2024)
Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
Categorical Keypoint Positional Embedding for Robust Animal Re-Identification
par: Lin, Yuhao, et autres
Publié: (2024)
par: Lin, Yuhao, et autres
Publié: (2024)
Open-set Cross Modal Generalization via Multimodal Unified Representation
par: Huang, Hai, et autres
Publié: (2025)
par: Huang, Hai, et autres
Publié: (2025)
Knowledge Composition using Task Vectors with Learned Anisotropic Scaling
par: Zhang, Frederic Z., et autres
Publié: (2024)
par: Zhang, Frederic Z., et autres
Publié: (2024)
Source-Free Unsupervised Domain Adaptation with Hypothesis Consolidation of Prediction Rationale
par: Shu, Yangyang, et autres
Publié: (2024)
par: Shu, Yangyang, et autres
Publié: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
par: Ma, Wenxuan, et autres
Publié: (2024)
par: Ma, Wenxuan, et autres
Publié: (2024)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
par: Huang, Hai, et autres
Publié: (2024)
par: Huang, Hai, et autres
Publié: (2024)
Multimodal Cancer Survival Analysis via Hypergraph Learning with Cross-Modality Rebalance
par: Qu, Mingcheng, et autres
Publié: (2025)
par: Qu, Mingcheng, et autres
Publié: (2025)
SO3UFormer: Learning Intrinsic Spherical Features for Rotation-Robust Panoramic Segmentation
par: Zhu, Qinfeng, et autres
Publié: (2026)
par: Zhu, Qinfeng, et autres
Publié: (2026)
Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP
par: Herzog, Jonas, et autres
Publié: (2026)
par: Herzog, Jonas, et autres
Publié: (2026)
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
par: Dong, Xiaoyu, et autres
Publié: (2026)
par: Dong, Xiaoyu, et autres
Publié: (2026)
Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding
par: Li, Xinyu, et autres
Publié: (2026)
par: Li, Xinyu, et autres
Publié: (2026)
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
par: Zheng, Xuhui, et autres
Publié: (2025)
par: Zheng, Xuhui, et autres
Publié: (2025)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
par: Yang, Zuopeng, et autres
Publié: (2025)
par: Yang, Zuopeng, et autres
Publié: (2025)
Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities
par: Bao, Jindi, et autres
Publié: (2026)
par: Bao, Jindi, et autres
Publié: (2026)
Documents similaires
-
Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
par: Jiang, Tianjiao, et autres
Publié: (2025) -
Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning
par: Liu, Yuhang, et autres
Publié: (2024) -
CLAP: Isolating Content from Style through Contrastive Learning with Augmented Prompts
par: Cai, Yichao, et autres
Publié: (2023) -
The Devil is in the Distributions: Explicit Modeling of Scene Content is Key in Zero-Shot Video Captioning
par: Tian, Mingkai, et autres
Publié: (2025) -
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
par: Mohammadi, Bahram, et autres
Publié: (2025)