Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Yuxuan, Li, Xu, Chen, Xiaolei, Zheng, Yi, Chen, Haotian, Li, Bin, Xue, Xiangyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2026)
par: Li, Xu, et autres
Publié: (2026)
Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models
par: Liang, Yuxuan, et autres
Publié: (2025)
par: Liang, Yuxuan, et autres
Publié: (2025)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2024)
par: Li, Xu, et autres
Publié: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)
par: Li, Xue, et autres
Publié: (2025)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
par: Luo, Junwei, et autres
Publié: (2025)
par: Luo, Junwei, et autres
Publié: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
par: Liu, Jizhihui, et autres
Publié: (2025)
par: Liu, Jizhihui, et autres
Publié: (2025)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
par: Meng, Yu, et autres
Publié: (2025)
par: Meng, Yu, et autres
Publié: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
par: Xu, Jingqi, et autres
Publié: (2025)
par: Xu, Jingqi, et autres
Publié: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
par: Ma, Kexin, et autres
Publié: (2026)
par: Ma, Kexin, et autres
Publié: (2026)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024)
par: Cao, Jianjian, et autres
Publié: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
par: Li, Ao, et autres
Publié: (2025)
par: Li, Ao, et autres
Publié: (2025)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
par: Chen, Hanning, et autres
Publié: (2024)
par: Chen, Hanning, et autres
Publié: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
par: Luan, Bozhi, et autres
Publié: (2025)
par: Luan, Bozhi, et autres
Publié: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)
par: Li, Guangyuan, et autres
Publié: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
par: Wang, Xinhao, et autres
Publié: (2026)
par: Wang, Xinhao, et autres
Publié: (2026)
LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models
par: Sun, Yizheng, et autres
Publié: (2025)
par: Sun, Yizheng, et autres
Publié: (2025)
SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models
par: Wang, Zekun, et autres
Publié: (2023)
par: Wang, Zekun, et autres
Publié: (2023)
When Large Vision-Language Models Meet Person Re-Identification
par: Wang, Qizao, et autres
Publié: (2024)
par: Wang, Qizao, et autres
Publié: (2024)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
par: Fang, Zhengyao, et autres
Publié: (2026)
par: Fang, Zhengyao, et autres
Publié: (2026)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
par: Sun, Zhichao, et autres
Publié: (2026)
par: Sun, Zhichao, et autres
Publié: (2026)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
par: Xu, Zhou, et autres
Publié: (2026)
par: Xu, Zhou, et autres
Publié: (2026)
Towards Joint Quantization and Token Pruning of Vision-Language Models
par: Li, Xinqing, et autres
Publié: (2026)
par: Li, Xinqing, et autres
Publié: (2026)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
par: Lee, Jaewoo, et autres
Publié: (2025)
par: Lee, Jaewoo, et autres
Publié: (2025)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation
par: Wang, Qitong, et autres
Publié: (2026)
par: Wang, Qitong, et autres
Publié: (2026)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
par: Wu, Hao, et autres
Publié: (2026)
par: Wu, Hao, et autres
Publié: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
par: He, Jialuo, et autres
Publié: (2026)
par: He, Jialuo, et autres
Publié: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
par: Zheng, Haotian, et autres
Publié: (2024)
par: Zheng, Haotian, et autres
Publié: (2024)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
par: Li, Jiaao, et autres
Publié: (2025)
par: Li, Jiaao, et autres
Publié: (2025)
Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
par: Liu, Yudong, et autres
Publié: (2025)
par: Liu, Yudong, et autres
Publié: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
par: Wang, Yahong, et autres
Publié: (2026)
par: Wang, Yahong, et autres
Publié: (2026)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
par: Li, Chenyang, et autres
Publié: (2026)
par: Li, Chenyang, et autres
Publié: (2026)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
par: Ji, Yicheng, et autres
Publié: (2025)
par: Ji, Yicheng, et autres
Publié: (2025)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
par: Wu, Xinjian, et autres
Publié: (2023)
par: Wu, Xinjian, et autres
Publié: (2023)
Attention Debiasing for Token Pruning in Vision Language Models
par: Zhao, Kai, et autres
Publié: (2025)
par: Zhao, Kai, et autres
Publié: (2025)
Documents similaires
-
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2025) -
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2026) -
Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models
par: Liang, Yuxuan, et autres
Publié: (2025) -
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2024) -
Efficient Vision-Language Reasoning via Adaptive Token Pruning
par: Li, Xue, et autres
Publié: (2025)