When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Yahong, Wu, Juncheng, Ni, Zhangkai, Yang, Longzhen, Liu, Yihang, Yang, Chengmei, Wen, Ying, He, Lianghua, Tang, Xianfeng, Liu, Hui, Zhou, Yuyin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation
von: Yang, Longzhen, et al.
Veröffentlicht: (2025)
von: Yang, Longzhen, et al.
Veröffentlicht: (2025)
AFiRe: Anatomy-Driven Self-Supervised Learning for Fine-Grained Representation in Radiographic Images
von: Liu, Yihang, et al.
Veröffentlicht: (2025)
von: Liu, Yihang, et al.
Veröffentlicht: (2025)
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
von: Liu, Yihang, et al.
Veröffentlicht: (2026)
von: Liu, Yihang, et al.
Veröffentlicht: (2026)
Visual Neural Decoding via Improved Visual-EEG Semantic Consistency
von: Chen, Hongzhou, et al.
Veröffentlicht: (2024)
von: Chen, Hongzhou, et al.
Veröffentlicht: (2024)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
DDR: Exploiting Deep Degradation Response as Flexible Image Descriptor
von: Wu, Juncheng, et al.
Veröffentlicht: (2024)
von: Wu, Juncheng, et al.
Veröffentlicht: (2024)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
von: Ma, Jie, et al.
Veröffentlicht: (2026)
von: Ma, Jie, et al.
Veröffentlicht: (2026)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
Synthesizing High-Quality Visual Question Answering from Medical Documents with Generator-Verifier LMMs
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
von: Huang, Xiaoke, et al.
Veröffentlicht: (2025)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
Seeing Beyond Redundancy: Task Complexity's Role in Vision Token Specialization in VLLMs
von: Hannan, Darryl, et al.
Veröffentlicht: (2026)
von: Hannan, Darryl, et al.
Veröffentlicht: (2026)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
von: Li, Duo, et al.
Veröffentlicht: (2025)
von: Li, Duo, et al.
Veröffentlicht: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
von: Chen, Hanning, et al.
Veröffentlicht: (2024)
von: Chen, Hanning, et al.
Veröffentlicht: (2024)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
von: Huang, YiJie, et al.
Veröffentlicht: (2026)
von: Huang, YiJie, et al.
Veröffentlicht: (2026)
Reg4Pru: Regularisation Through Random Token Routing for Token Pruning
von: Wyatt, Julian, et al.
Veröffentlicht: (2026)
von: Wyatt, Julian, et al.
Veröffentlicht: (2026)
TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba
von: Yang, Ziyue, et al.
Veröffentlicht: (2026)
von: Yang, Ziyue, et al.
Veröffentlicht: (2026)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
von: Tan, Yifan, et al.
Veröffentlicht: (2026)
von: Tan, Yifan, et al.
Veröffentlicht: (2026)
HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding
von: Nguyen, Toan, et al.
Veröffentlicht: (2026)
von: Nguyen, Toan, et al.
Veröffentlicht: (2026)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
von: Chen, Yuhao, et al.
Veröffentlicht: (2026)
von: Chen, Yuhao, et al.
Veröffentlicht: (2026)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning
von: Tong, Enwei, et al.
Veröffentlicht: (2026)
von: Tong, Enwei, et al.
Veröffentlicht: (2026)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
von: Deng, Jinhong, et al.
Veröffentlicht: (2025)
von: Deng, Jinhong, et al.
Veröffentlicht: (2025)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
von: Kim, Jiwan, et al.
Veröffentlicht: (2026)
CROP: Contextual Region-Oriented Visual Token Pruning
von: Guo, Jiawei, et al.
Veröffentlicht: (2025)
von: Guo, Jiawei, et al.
Veröffentlicht: (2025)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
von: Fan, Lijie, et al.
Veröffentlicht: (2025)
von: Fan, Lijie, et al.
Veröffentlicht: (2025)
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
von: Li, Han, et al.
Veröffentlicht: (2026)
von: Li, Han, et al.
Veröffentlicht: (2026)
TP-Spikformer: Token Pruned Spiking Transformer
von: Wei, Wenjie, et al.
Veröffentlicht: (2026)
von: Wei, Wenjie, et al.
Veröffentlicht: (2026)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
von: Alvar, Saeed Ranjbar, et al.
Veröffentlicht: (2025)
von: Alvar, Saeed Ranjbar, et al.
Veröffentlicht: (2025)
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
von: Long, Lingkun, et al.
Veröffentlicht: (2025)
von: Long, Lingkun, et al.
Veröffentlicht: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
von: Li, Xu, et al.
Veröffentlicht: (2026)
von: Li, Xu, et al.
Veröffentlicht: (2026)
PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
von: Li, Haotang, et al.
Veröffentlicht: (2026)
von: Li, Haotang, et al.
Veröffentlicht: (2026)
Worse than Random: The Importance of a Baseline for Unsupervised Feature Selection
von: Rajabinasab, Muhammad, et al.
Veröffentlicht: (2026)
von: Rajabinasab, Muhammad, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
von: Wang, Yahong, et al.
Veröffentlicht: (2026) -
Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation
von: Yang, Longzhen, et al.
Veröffentlicht: (2025) -
AFiRe: Anatomy-Driven Self-Supervised Learning for Fine-Grained Representation in Radiographic Images
von: Liu, Yihang, et al.
Veröffentlicht: (2025) -
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
von: Liu, Yihang, et al.
Veröffentlicht: (2026) -
Visual Neural Decoding via Improved Visual-EEG Semantic Consistency
von: Chen, Hongzhou, et al.
Veröffentlicht: (2024)