Large Vision-Language Models Get Lost in Attention
Fuente:
arXiv
Saved in:
| Main Authors: | Xi, Gongli, Tian, Ye, Yang, Mengyu, Yi, Huahui, Lin, Liang, Hao, Xiaoshuai, Wang, Kun, Wang, Wendong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
by: Xi, Gongli, et al.
Published: (2026)
by: Xi, Gongli, et al.
Published: (2026)
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
by: Yi, Huahui, et al.
Published: (2025)
by: Yi, Huahui, et al.
Published: (2025)
AdaViPro: Region-based Adaptive Visual Prompt for Large-Scale Models Adapting
by: Yang, Mengyu, et al.
Published: (2024)
by: Yang, Mengyu, et al.
Published: (2024)
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
by: Li, Zhecheng, et al.
Published: (2025)
by: Li, Zhecheng, et al.
Published: (2025)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
by: Qu, Tianyuan, et al.
Published: (2025)
by: Qu, Tianyuan, et al.
Published: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
by: Yang, Jiabing, et al.
Published: (2025)
by: Yang, Jiabing, et al.
Published: (2025)
View while Moving: Efficient Video Recognition in Long-untrimmed Videos
by: Tian, Ye, et al.
Published: (2023)
by: Tian, Ye, et al.
Published: (2023)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
by: jia, Feiyang, et al.
Published: (2026)
by: jia, Feiyang, et al.
Published: (2026)
iDPA: Instance Decoupled Prompt Attention for Incremental Medical Object Detection
by: Yi, Huahui, et al.
Published: (2025)
by: Yi, Huahui, et al.
Published: (2025)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
by: Huang, Kai, et al.
Published: (2025)
by: Huang, Kai, et al.
Published: (2025)
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
by: Wu, Mingrui, et al.
Published: (2024)
by: Wu, Mingrui, et al.
Published: (2024)
ViLLa: Video Reasoning Segmentation with Large Language Model
by: Zheng, Rongkun, et al.
Published: (2024)
by: Zheng, Rongkun, et al.
Published: (2024)
StripDet: Strip Attention-Based Lightweight 3D Object Detection from Point Cloud
by: Wang, Weichao, et al.
Published: (2025)
by: Wang, Weichao, et al.
Published: (2025)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
by: Tian, Xiaoyu, et al.
Published: (2024)
by: Tian, Xiaoyu, et al.
Published: (2024)
Exploring Large Vision-Language Models for Robust and Efficient Industrial Anomaly Detection
by: Qian, Kun, et al.
Published: (2024)
by: Qian, Kun, et al.
Published: (2024)
Attention Prompting on Image for Large Vision-Language Models
by: Yu, Runpeng, et al.
Published: (2024)
by: Yu, Runpeng, et al.
Published: (2024)
A Lost Opportunity for Vision-Language Models: A Comparative Study of Online Test-Time Adaptation for Vision-Language Models
by: Döbler, Mario, et al.
Published: (2024)
by: Döbler, Mario, et al.
Published: (2024)
Unified Modeling Enhanced Multimodal Learning for Precision Neuro-Oncology
by: Yi, Huahui, et al.
Published: (2024)
by: Yi, Huahui, et al.
Published: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
by: Tan, Huajie, et al.
Published: (2025)
by: Tan, Huajie, et al.
Published: (2025)
DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models
by: Qin, Mengxin, et al.
Published: (2026)
by: Qin, Mengxin, et al.
Published: (2026)
An archaeological Catalog Collection Method Based on Large Vision-Language Models
by: Pang, Honglin, et al.
Published: (2024)
by: Pang, Honglin, et al.
Published: (2024)
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
by: Li, Qiming, et al.
Published: (2025)
by: Li, Qiming, et al.
Published: (2025)
Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test
by: Fu, Tairan, et al.
Published: (2026)
by: Fu, Tairan, et al.
Published: (2026)
Evaluating Attribute Comprehension in Large Vision-Language Models
by: Zhang, Haiwen, et al.
Published: (2024)
by: Zhang, Haiwen, et al.
Published: (2024)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
by: Gu, Renjie, et al.
Published: (2026)
by: Gu, Renjie, et al.
Published: (2026)
Towards Generalizable Deepfake Detection with Spatial-Frequency Collaborative Learning and Hierarchical Cross-Modal Fusion
by: Qiao, Mengyu, et al.
Published: (2025)
by: Qiao, Mengyu, et al.
Published: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
by: Li, Wenyan, et al.
Published: (2025)
by: Li, Wenyan, et al.
Published: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
by: Yuan, Zhengqing, et al.
Published: (2023)
by: Yuan, Zhengqing, et al.
Published: (2023)
Guiding Medical Vision-Language Models with Explicit Visual Prompts: Framework Design and Comprehensive Exploration of Prompt Variations
by: Zhu, Kangyu, et al.
Published: (2025)
by: Zhu, Kangyu, et al.
Published: (2025)
FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling
by: Hamid, Kaiser, et al.
Published: (2025)
by: Hamid, Kaiser, et al.
Published: (2025)
FairCLIP: Harnessing Fairness in Vision-Language Learning
by: Luo, Yan, et al.
Published: (2024)
by: Luo, Yan, et al.
Published: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
by: Cao, Sihan, et al.
Published: (2026)
by: Cao, Sihan, et al.
Published: (2026)
Attention! Your Vision Language Model Could Be Maliciously Manipulated
by: Wang, Xiaosen, et al.
Published: (2025)
by: Wang, Xiaosen, et al.
Published: (2025)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
by: Kuo, Chia-Wen, et al.
Published: (2025)
by: Kuo, Chia-Wen, et al.
Published: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
by: Yang, Chenyu, et al.
Published: (2024)
by: Yang, Chenyu, et al.
Published: (2024)
Personalized Large Vision-Language Models
by: Pham, Chau, et al.
Published: (2024)
by: Pham, Chau, et al.
Published: (2024)
MLAE: Masked LoRA Experts for Visual Parameter-Efficient Fine-Tuning
by: Wang, Junjie, et al.
Published: (2024)
by: Wang, Junjie, et al.
Published: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
by: Li, Bin, et al.
Published: (2025)
by: Li, Bin, et al.
Published: (2025)
One Last Attention for Your Vision-Language Model
by: Chen, Liang, et al.
Published: (2025)
by: Chen, Liang, et al.
Published: (2025)
AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models
by: Li, Yue, et al.
Published: (2026)
by: Li, Yue, et al.
Published: (2026)
Similar Items
-
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
by: Xi, Gongli, et al.
Published: (2026) -
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
by: Yi, Huahui, et al.
Published: (2025) -
AdaViPro: Region-based Adaptive Visual Prompt for Large-Scale Models Adapting
by: Yang, Mengyu, et al.
Published: (2024) -
Texture or Semantics? Vision-Language Models Get Lost in Font Recognition
by: Li, Zhecheng, et al.
Published: (2025) -
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
by: Qu, Tianyuan, et al.
Published: (2025)