Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Xuanyu, Yang, Zonghan, Chen, Xinrui, Li, Peng, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
par: Gao, Junyuan, et autres
Publié: (2025)
par: Gao, Junyuan, et autres
Publié: (2025)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)
par: Zhang, Yin, et autres
Publié: (2026)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Coordinated Robustness Evaluation Framework for Vision-Language Models
par: Babu, Ashwin Ramesh, et autres
Publié: (2025)
par: Babu, Ashwin Ramesh, et autres
Publié: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
par: Xu, Runsen, et autres
Publié: (2025)
par: Xu, Runsen, et autres
Publié: (2025)
Watch Out Your Album! On the Inadvertent Privacy Memorization in Multi-Modal Large Language Models
par: Ju, Tianjie, et autres
Publié: (2025)
par: Ju, Tianjie, et autres
Publié: (2025)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
par: Wang, Yunnan, et autres
Publié: (2025)
par: Wang, Yunnan, et autres
Publié: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
par: Zhu, Yingjie, et autres
Publié: (2025)
par: Zhu, Yingjie, et autres
Publié: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
par: Cheng, Sijie, et autres
Publié: (2023)
par: Cheng, Sijie, et autres
Publié: (2023)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
A Survey on Hallucination in Large Vision-Language Models
par: Liu, Hanchao, et autres
Publié: (2024)
par: Liu, Hanchao, et autres
Publié: (2024)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
par: Liang, Qiao, et autres
Publié: (2025)
par: Liang, Qiao, et autres
Publié: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Inference Compute-Optimal Video Vision Language Models
par: Wang, Peiqi, et autres
Publié: (2025)
par: Wang, Peiqi, et autres
Publié: (2025)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
par: Shao, Zhenwei, et autres
Publié: (2025)
par: Shao, Zhenwei, et autres
Publié: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models
par: Zhao, Dachuan, et autres
Publié: (2025)
par: Zhao, Dachuan, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service
par: Wang, Xiasi, et autres
Publié: (2025)
par: Wang, Xiasi, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
par: Qiu, Haoyi, et autres
Publié: (2024)
par: Qiu, Haoyi, et autres
Publié: (2024)
DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception
par: Luo, Run, et autres
Publié: (2024)
par: Luo, Run, et autres
Publié: (2024)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
par: Chen, Yi-Chia, et autres
Publié: (2024)
par: Chen, Yi-Chia, et autres
Publié: (2024)
Image-Based Geolocation Using Large Vision-Language Models
par: Liu, Yi, et autres
Publié: (2024)
par: Liu, Yi, et autres
Publié: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
par: Wang, Weihang, et autres
Publié: (2025)
par: Wang, Weihang, et autres
Publié: (2025)
Documents similaires
-
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025) -
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024) -
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
par: Gao, Junyuan, et autres
Publié: (2025) -
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024) -
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)