VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Mingxiao, Su, Na, Qu, Fang, Zhong, Zhizhou, Chen, Ziyang, Li, Yuan, Tu, Zhaopeng, Li, Xiaolong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs
por: Li, Mingxiao, et al.
Publicado: (2025)
por: Li, Mingxiao, et al.
Publicado: (2025)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
por: Chen, Zhanpeng, et al.
Publicado: (2025)
por: Chen, Zhanpeng, et al.
Publicado: (2025)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment
por: Song, Jia, et al.
Publicado: (2024)
por: Song, Jia, et al.
Publicado: (2024)
MOLE: MOdular Learning FramEwork via Mutual Information Maximization
por: Li, Tianchao, et al.
Publicado: (2023)
por: Li, Tianchao, et al.
Publicado: (2023)
What Makes Good Collaborative Views? Contrastive Mutual Information Maximization for Multi-Agent Perception
por: Su, Wanfang, et al.
Publicado: (2024)
por: Su, Wanfang, et al.
Publicado: (2024)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
por: Huang, Yanjia, et al.
Publicado: (2025)
por: Huang, Yanjia, et al.
Publicado: (2025)
Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs
por: Su, Yongyi, et al.
Publicado: (2025)
por: Su, Yongyi, et al.
Publicado: (2025)
CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs
por: Li, Jiameng, et al.
Publicado: (2026)
por: Li, Jiameng, et al.
Publicado: (2026)
Bridge Feature Matching and Cross-Modal Alignment with Mutual-filtering for Zero-shot Anomaly Detection
por: Bai, Yuhu, et al.
Publicado: (2025)
por: Bai, Yuhu, et al.
Publicado: (2025)
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching
por: Ma, Xiang, et al.
Publicado: (2024)
por: Ma, Xiang, et al.
Publicado: (2024)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
por: Li, Haoxuan, et al.
Publicado: (2025)
por: Li, Haoxuan, et al.
Publicado: (2025)
InfoPO: On Mutual Information Maximization for Large Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2025)
por: Xiao, Teng, et al.
Publicado: (2025)
NeuroLIP: Interpretable and Fair Cross-Modal Alignment of fMRI and Phenotypic Text
por: Yang, Yanting, et al.
Publicado: (2025)
por: Yang, Yanting, et al.
Publicado: (2025)
Aligning Explanations for Recommendation with Rating and Feature via Maximizing Mutual Information
por: Zhao, Yurou, et al.
Publicado: (2024)
por: Zhao, Yurou, et al.
Publicado: (2024)
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
por: Qian, Chengxuan, et al.
Publicado: (2025)
por: Qian, Chengxuan, et al.
Publicado: (2025)
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
por: Wang, Zitian, et al.
Publicado: (2025)
por: Wang, Zitian, et al.
Publicado: (2025)
Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs
por: Luo, Ziyang, et al.
Publicado: (2026)
por: Luo, Ziyang, et al.
Publicado: (2026)
Enhancing CLIP Robustness via Cross-Modality Alignment
por: Zhu, Xingyu, et al.
Publicado: (2025)
por: Zhu, Xingyu, et al.
Publicado: (2025)
Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models
por: Li, Jinhao, et al.
Publicado: (2024)
por: Li, Jinhao, et al.
Publicado: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024)
por: Ma, Wenxuan, et al.
Publicado: (2024)
Ultrasound Report Generation with Cross-Modality Feature Alignment via Unsupervised Guidance
por: Li, Jun, et al.
Publicado: (2024)
por: Li, Jun, et al.
Publicado: (2024)
Advancing Molecular Graph-Text Pre-training via Fine-grained Alignment
por: Li, Yibo, et al.
Publicado: (2024)
por: Li, Yibo, et al.
Publicado: (2024)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
por: Feng, Qianhan, et al.
Publicado: (2024)
por: Feng, Qianhan, et al.
Publicado: (2024)
Multi-Modal Continual Learning via Cross-Modality Adapters and Representation Alignment with Knowledge Preservation
por: Chee, Evelyn, et al.
Publicado: (2025)
por: Chee, Evelyn, et al.
Publicado: (2025)
CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation
por: Du, Yuxuan, et al.
Publicado: (2025)
por: Du, Yuxuan, et al.
Publicado: (2025)
Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM
por: Li, Shen, et al.
Publicado: (2025)
por: Li, Shen, et al.
Publicado: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
por: Shang, Tianyi, et al.
Publicado: (2025)
por: Shang, Tianyi, et al.
Publicado: (2025)
Time Matters: Enhancing Pre-trained News Recommendation Models with Robust User Dwell Time Injection
por: Jiang, Hao, et al.
Publicado: (2024)
por: Jiang, Hao, et al.
Publicado: (2024)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
por: Zheng, Yuze, et al.
Publicado: (2024)
por: Zheng, Yuze, et al.
Publicado: (2024)
VOLTA: Improving Generative Diversity by Variational Mutual Information Maximizing Autoencoder
por: Ma, Yueen, et al.
Publicado: (2023)
por: Ma, Yueen, et al.
Publicado: (2023)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
CARMA: Enhanced Compositionality in LLMs via Advanced Regularisation and Mutual Information Alignment
por: Aljaafari, Nura, et al.
Publicado: (2025)
por: Aljaafari, Nura, et al.
Publicado: (2025)
Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment
por: Jia, Xiaojun, et al.
Publicado: (2025)
por: Jia, Xiaojun, et al.
Publicado: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs
por: Huang, Jen-Tse, et al.
Publicado: (2025)
por: Huang, Jen-Tse, et al.
Publicado: (2025)
Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data
por: Nam, Hyunji, et al.
Publicado: (2026)
por: Nam, Hyunji, et al.
Publicado: (2026)
Ejemplares similares
-
From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs
por: Li, Mingxiao, et al.
Publicado: (2025) -
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025) -
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
por: Chen, Zhanpeng, et al.
Publicado: (2025) -
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
por: Yang, Ruihan, et al.
Publicado: (2025) -
Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment
por: Song, Jia, et al.
Publicado: (2024)