What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yutao, Wu, Qiong, Lin, Wenhao, Yu, Wei, Zhou, Yiyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
di: Huang, YiJie, et al.
Pubblicazione: (2026)
di: Huang, YiJie, et al.
Pubblicazione: (2026)
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
di: Ju, Shaobo, et al.
Pubblicazione: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
Efficient Multi-modal Large Language Models via Visual Token Grouping
di: Huang, Minbin, et al.
Pubblicazione: (2024)
di: Huang, Minbin, et al.
Pubblicazione: (2024)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
di: Wang, Yahong, et al.
Pubblicazione: (2026)
di: Wang, Yahong, et al.
Pubblicazione: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
CROP: Contextual Region-Oriented Visual Token Pruning
di: Guo, Jiawei, et al.
Pubblicazione: (2025)
di: Guo, Jiawei, et al.
Pubblicazione: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
GridPrune: From "Where to Look" to "What to Select" in Visual Token Pruning for MLLMs
di: Duan, Yuxiang, et al.
Pubblicazione: (2025)
di: Duan, Yuxiang, et al.
Pubblicazione: (2025)
Training Noise Token Pruning
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
di: Wang, Yahong, et al.
Pubblicazione: (2025)
di: Wang, Yahong, et al.
Pubblicazione: (2025)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
di: Alvar, Saeed Ranjbar, et al.
Pubblicazione: (2025)
di: Alvar, Saeed Ranjbar, et al.
Pubblicazione: (2025)
What Kind of Librarians Do We Need in the Future? Youth Services Librarians!
di: Parikh, Neel
Pubblicazione: (2000)
di: Parikh, Neel
Pubblicazione: (2000)
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking
di: Wu, Hao, et al.
Pubblicazione: (2026)
di: Wu, Hao, et al.
Pubblicazione: (2026)
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
di: Li, Xu, et al.
Pubblicazione: (2026)
di: Li, Xu, et al.
Pubblicazione: (2026)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
di: Chi, Tien-Yu, et al.
Pubblicazione: (2025)
di: Chi, Tien-Yu, et al.
Pubblicazione: (2025)
LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models
di: Sun, Yizheng, et al.
Pubblicazione: (2025)
di: Sun, Yizheng, et al.
Pubblicazione: (2025)
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
di: Fan, Yingqi, et al.
Pubblicazione: (2026)
di: Fan, Yingqi, et al.
Pubblicazione: (2026)
FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning
di: Tong, Enwei, et al.
Pubblicazione: (2026)
di: Tong, Enwei, et al.
Pubblicazione: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
di: Li, Daiqiang, et al.
Pubblicazione: (2026)
di: Li, Daiqiang, et al.
Pubblicazione: (2026)
Token Coordinated Prompt Attention is Needed for Visual Prompting
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation
di: Wang, Qitong, et al.
Pubblicazione: (2026)
di: Wang, Qitong, et al.
Pubblicazione: (2026)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
di: Yang, Zhen, et al.
Pubblicazione: (2023)
di: Yang, Zhen, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024) -
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
di: Wu, Qiong, et al.
Pubblicazione: (2024) -
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
di: Huang, YiJie, et al.
Pubblicazione: (2026) -
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
di: Ju, Shaobo, et al.
Pubblicazione: (2026) -
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)