Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Jiwan, Kim, Kibum, Kim, Wonjoong, Lee, Byung-Kwan, Park, Chanyoung |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
par: Kim, Jiwan, et autres
Publié: (2025)
par: Kim, Jiwan, et autres
Publié: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
par: Park, Sangwu, et autres
Publié: (2026)
par: Park, Sangwu, et autres
Publié: (2026)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
RA-SGG: Retrieval-Augmented Scene Graph Generation Framework via Multi-Prototype Learning
par: Yoon, Kanghoon, et autres
Publié: (2024)
par: Yoon, Kanghoon, et autres
Publié: (2024)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024)
par: Kim, Wonjoong, et autres
Publié: (2024)
Semantic Diversity-aware Prototype-based Learning for Unbiased Scene Graph Generation
par: Jeon, Jaehyeong, et autres
Publié: (2024)
par: Jeon, Jaehyeong, et autres
Publié: (2024)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
par: Lee, Yuna, et autres
Publié: (2026)
par: Lee, Yuna, et autres
Publié: (2026)
Does Visual Token Pruning Improve Calibration? An Empirical Study on Confidence in MLLMs
par: Tan, Kaizhen
Publié: (2026)
par: Tan, Kaizhen
Publié: (2026)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
par: Kim, Kibum, et autres
Publié: (2024)
par: Kim, Kibum, et autres
Publié: (2024)
Weakly Supervised Video Scene Graph Generation via Natural Language Supervision
par: Kim, Kibum, et autres
Publié: (2025)
par: Kim, Kibum, et autres
Publié: (2025)
GridPrune: From "Where to Look" to "What to Select" in Visual Token Pruning for MLLMs
par: Duan, Yuxiang, et autres
Publié: (2025)
par: Duan, Yuxiang, et autres
Publié: (2025)
SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation
par: Shin, Youngwoo, et autres
Publié: (2026)
par: Shin, Youngwoo, et autres
Publié: (2026)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
par: Wang, Yahong, et autres
Publié: (2025)
par: Wang, Yahong, et autres
Publié: (2025)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
par: Tan, Yifan, et autres
Publié: (2026)
par: Tan, Yifan, et autres
Publié: (2026)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
par: Li, Duo, et autres
Publié: (2025)
par: Li, Duo, et autres
Publié: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
par: Kim, Jongha, et autres
Publié: (2026)
par: Kim, Jongha, et autres
Publié: (2026)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
par: Kim, Kibum, et autres
Publié: (2023)
par: Kim, Kibum, et autres
Publié: (2023)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
par: Lew, Jaihyun, et autres
Publié: (2024)
par: Lew, Jaihyun, et autres
Publié: (2024)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
par: Choi, Joonmyung, et autres
Publié: (2026)
par: Choi, Joonmyung, et autres
Publié: (2026)
Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning
par: Lee, Naeun, et autres
Publié: (2026)
par: Lee, Naeun, et autres
Publié: (2026)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
par: Chung, Jiwan, et autres
Publié: (2024)
par: Chung, Jiwan, et autres
Publié: (2024)
RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
par: Baek, Changwoo, et autres
Publié: (2026)
par: Baek, Changwoo, et autres
Publié: (2026)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
par: Kim, Sanghwan, et autres
Publié: (2025)
par: Kim, Sanghwan, et autres
Publié: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
par: Lou, Haoran, et autres
Publié: (2025)
par: Lou, Haoran, et autres
Publié: (2025)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
CoLLaVO: Crayon Large Language and Vision mOdel
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
par: Lee, Byung-Kwan, et autres
Publié: (2024)
par: Lee, Byung-Kwan, et autres
Publié: (2024)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
par: Cho, Beomsik, et autres
Publié: (2025)
par: Cho, Beomsik, et autres
Publié: (2025)
Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
par: Chi, Donghwan, et autres
Publié: (2025)
par: Chi, Donghwan, et autres
Publié: (2025)
How Do Medical MLLMs Fail? A Study on Visual Grounding in Medical Images
par: Liu, Guimeng, et autres
Publié: (2026)
par: Liu, Guimeng, et autres
Publié: (2026)
Representation Shift: Unifying Token Compression with FlashAttention
par: Choi, Joonmyung, et autres
Publié: (2025)
par: Choi, Joonmyung, et autres
Publié: (2025)
Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
par: Kwon, Mincheol, et autres
Publié: (2026)
par: Kwon, Mincheol, et autres
Publié: (2026)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
A More Word-like Image Tokenization for MLLMs
par: Lee, Hyun, et autres
Publié: (2026)
par: Lee, Hyun, et autres
Publié: (2026)
Structured State-Space Regularization for Generation-Friendly Image Tokenization
par: Lee, Jinsung, et autres
Publié: (2026)
par: Lee, Jinsung, et autres
Publié: (2026)
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
par: Kim, Jongha, et autres
Publié: (2024)
par: Kim, Jongha, et autres
Publié: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
par: Lee, Dong-Jae, et autres
Publié: (2025)
par: Lee, Dong-Jae, et autres
Publié: (2025)
Documents similaires
-
CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
par: Kim, Jiwan, et autres
Publié: (2025) -
Test-Time Training for Visual Foresight Vision-Language-Action Models
par: Park, Sangwu, et autres
Publié: (2026) -
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025) -
RA-SGG: Retrieval-Augmented Scene Graph Generation Framework via Multi-Prototype Learning
par: Yoon, Kanghoon, et autres
Publié: (2024) -
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024)