Unified Lexical Representation for Interpretable Visual-Language Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yifan, Wang, Yikai, Fu, Yanwei, Ru, Dongyu, Zhang, Zheng, He, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023)
par: Liu, Yanqing, et autres
Publié: (2023)
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
par: Qiu, Yifu, et autres
Publié: (2026)
par: Qiu, Yifu, et autres
Publié: (2026)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
par: AI, Inclusion, et autres
Publié: (2025)
par: AI, Inclusion, et autres
Publié: (2025)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
par: Li, Shengzhi, et autres
Publié: (2024)
par: Li, Shengzhi, et autres
Publié: (2024)
CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook
par: Chen, Zeyu, et autres
Publié: (2026)
par: Chen, Zeyu, et autres
Publié: (2026)
Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models
par: He, Zoe Wanying, et autres
Publié: (2025)
par: He, Zoe Wanying, et autres
Publié: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
Better Language Models Exhibit Higher Visual Alignment
par: Ruthardt, Jona, et autres
Publié: (2024)
par: Ruthardt, Jona, et autres
Publié: (2024)
GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts
par: Yuan, Fan, et autres
Publié: (2025)
par: Yuan, Fan, et autres
Publié: (2025)
Reconstructive Visual Instruction Tuning
par: Wang, Haochen, et autres
Publié: (2024)
par: Wang, Haochen, et autres
Publié: (2024)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
par: Yu, Hao, et autres
Publié: (2025)
par: Yu, Hao, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024)
par: Fan, Xiaoran, et autres
Publié: (2024)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
par: Han, Jiaming, et autres
Publié: (2025)
par: Han, Jiaming, et autres
Publié: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
par: Fu, Xingyu, et autres
Publié: (2023)
par: Fu, Xingyu, et autres
Publié: (2023)
ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
par: Zhang, Yongting, et autres
Publié: (2024)
par: Zhang, Yongting, et autres
Publié: (2024)
TULIP: Towards Unified Language-Image Pretraining
par: Tang, Zineng, et autres
Publié: (2025)
par: Tang, Zineng, et autres
Publié: (2025)
A Survey on Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
par: He, Hulingxiao, et autres
Publié: (2025)
par: He, Hulingxiao, et autres
Publié: (2025)
Analyzing The Language of Visual Tokens
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
par: Zhou, Andy, et autres
Publié: (2023)
par: Zhou, Andy, et autres
Publié: (2023)
Feedback-Driven Vision-Language Alignment with Minimal Human Supervision
par: Giannone, Giorgio, et autres
Publié: (2025)
par: Giannone, Giorgio, et autres
Publié: (2025)
Can Vision-Language Models Solve Visual Math Equations?
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
par: Choudhury, Monjoy Narayan, et autres
Publié: (2025)
ContextualStory: Consistent Visual Storytelling with Spatially-Enhanced and Storyline Context
par: Zheng, Sixiao, et autres
Publié: (2024)
par: Zheng, Sixiao, et autres
Publié: (2024)
Unveiling Uncertainty: A Deep Dive into Calibration and Performance of Multimodal Large Language Models
par: Chen, Zijun, et autres
Publié: (2024)
par: Chen, Zijun, et autres
Publié: (2024)
Why are Visually-Grounded Language Models Bad at Image Classification?
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
par: Zhan, Jun, et autres
Publié: (2024)
par: Zhan, Jun, et autres
Publié: (2024)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
par: Maharana, Adyasha, et autres
Publié: (2023)
par: Maharana, Adyasha, et autres
Publié: (2023)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
par: Wu, Junjie, et autres
Publié: (2024)
par: Wu, Junjie, et autres
Publié: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
Nemesis: Normalizing the Soft-prompt Vectors of Vision-Language Models
par: Fu, Shuai, et autres
Publié: (2024)
par: Fu, Shuai, et autres
Publié: (2024)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
par: Yin, Shukang, et autres
Publié: (2023)
par: Yin, Shukang, et autres
Publié: (2023)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
par: Han, Xiaochuang, et autres
Publié: (2025)
par: Han, Xiaochuang, et autres
Publié: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
par: Bawazir, Ameera, et autres
Publié: (2024)
par: Bawazir, Ameera, et autres
Publié: (2024)
Documents similaires
-
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023) -
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024) -
Unified Vision-Language Modeling via Concept Space Alignment
par: Qiu, Yifu, et autres
Publié: (2026) -
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2024) -
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
par: AI, Inclusion, et autres
Publié: (2025)