Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Pengfei, Xu, Guohai, Wang, Weinong, Yang, Junjie, Lou, Jie, Xue, Yunhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
por: Ma, Yiwei, et al.
Publicado: (2025)
por: Ma, Yiwei, et al.
Publicado: (2025)
Visual Implicit Autoregressive Modeling
por: Jiang, Pengfei, et al.
Publicado: (2026)
por: Jiang, Pengfei, et al.
Publicado: (2026)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
por: Zhao, Shiji, et al.
Publicado: (2025)
por: Zhao, Shiji, et al.
Publicado: (2025)
PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment
por: Li, Qiqi, et al.
Publicado: (2026)
por: Li, Qiqi, et al.
Publicado: (2026)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2024)
por: Dong, Yuhao, et al.
Publicado: (2024)
Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors
por: Yang, Chengxu, et al.
Publicado: (2026)
por: Yang, Chengxu, et al.
Publicado: (2026)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
por: Zhang, YiFan, et al.
Publicado: (2024)
por: Zhang, YiFan, et al.
Publicado: (2024)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
por: Yang, Jiabing, et al.
Publicado: (2025)
por: Yang, Jiabing, et al.
Publicado: (2025)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
por: Xu, Hai-Ming, et al.
Publicado: (2024)
por: Xu, Hai-Ming, et al.
Publicado: (2024)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Survey of Adversarial Robustness in Multimodal Large Language Models
por: Jiang, Chengze, et al.
Publicado: (2025)
por: Jiang, Chengze, et al.
Publicado: (2025)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
por: Zhou, Yue, et al.
Publicado: (2026)
por: Zhou, Yue, et al.
Publicado: (2026)
Implicit and Explicit Language Guidance for Diffusion-based Visual Perception
por: Wang, Hefeng, et al.
Publicado: (2024)
por: Wang, Hefeng, et al.
Publicado: (2024)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
por: He, Jinlong, et al.
Publicado: (2024)
por: He, Jinlong, et al.
Publicado: (2024)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
por: Guo, Jiayi, et al.
Publicado: (2025)
por: Guo, Jiayi, et al.
Publicado: (2025)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
Large Language Models for Multimodal Deformable Image Registration
por: Ma, Mingrui, et al.
Publicado: (2024)
por: Ma, Mingrui, et al.
Publicado: (2024)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
por: Bi, Jing, et al.
Publicado: (2024)
por: Bi, Jing, et al.
Publicado: (2024)
Personal Visual Context Learning in Large Multimodal Models
por: Xue, Zihui, et al.
Publicado: (2026)
por: Xue, Zihui, et al.
Publicado: (2026)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
por: Wang, Yahong, et al.
Publicado: (2026)
por: Wang, Yahong, et al.
Publicado: (2026)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
por: Lin, Ci-Siang, et al.
Publicado: (2025)
por: Lin, Ci-Siang, et al.
Publicado: (2025)
DeepEyesV2: Toward Agentic Multimodal Model
por: Hong, Jack, et al.
Publicado: (2025)
por: Hong, Jack, et al.
Publicado: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
por: Yu, Runpeng, et al.
Publicado: (2025)
por: Yu, Runpeng, et al.
Publicado: (2025)
Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model
por: Zhuang, Jiedong, et al.
Publicado: (2026)
por: Zhuang, Jiedong, et al.
Publicado: (2026)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
por: Majeedi, Abrar, et al.
Publicado: (2026)
por: Majeedi, Abrar, et al.
Publicado: (2026)
Exploring the Transferability of Visual Prompting for Multimodal Large Language Models
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
por: Chen, Jiahua, et al.
Publicado: (2026)
por: Chen, Jiahua, et al.
Publicado: (2026)
SedarEval: Automated Evaluation using Self-Adaptive Rubrics
por: Fan, Zhiyuan, et al.
Publicado: (2025)
por: Fan, Zhiyuan, et al.
Publicado: (2025)
Improving Visual Storytelling with Multimodal Large Language Models
por: Lin, Xiaochuan, et al.
Publicado: (2024)
por: Lin, Xiaochuan, et al.
Publicado: (2024)
Visual Representation Alignment for Multimodal Large Language Models
por: Yoon, Heeji, et al.
Publicado: (2025)
por: Yoon, Heeji, et al.
Publicado: (2025)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
por: Tang, Jianting, et al.
Publicado: (2025)
por: Tang, Jianting, et al.
Publicado: (2025)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
por: Xing, Shuo, et al.
Publicado: (2025)
por: Xing, Shuo, et al.
Publicado: (2025)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
por: Zhou, Nan, et al.
Publicado: (2026)
por: Zhou, Nan, et al.
Publicado: (2026)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
por: Liu, Haogeng, et al.
Publicado: (2024)
por: Liu, Haogeng, et al.
Publicado: (2024)
LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models
por: Liu, Juntao, et al.
Publicado: (2025)
por: Liu, Juntao, et al.
Publicado: (2025)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
por: Sun, Yiming, et al.
Publicado: (2024)
por: Sun, Yiming, et al.
Publicado: (2024)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
Ejemplares similares
-
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
por: Ma, Yiwei, et al.
Publicado: (2025) -
Visual Implicit Autoregressive Modeling
por: Jiang, Pengfei, et al.
Publicado: (2026) -
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
por: Zhao, Shiji, et al.
Publicado: (2025) -
PIDNet: Progressive Implicit Decouple Network for Multimodal Action Quality Assessment
por: Li, Qiqi, et al.
Publicado: (2026) -
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2024)