Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Apedo, Yvon, Poreba, Martyna, Szczepanski, Michal, Bouchafa, Samia |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
par: Szczepanski, Michal, et autres
Publié: (2025)
par: Szczepanski, Michal, et autres
Publié: (2025)
I-Segmenter: Integer-Only Vision Transformer for Efficient Semantic Segmentation
par: Sassoon, Jordan, et autres
Publié: (2025)
par: Sassoon, Jordan, et autres
Publié: (2025)
Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
par: Galagain, Calvin, et autres
Publié: (2026)
par: Galagain, Calvin, et autres
Publié: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
par: Li, Ao, et autres
Publié: (2025)
par: Li, Ao, et autres
Publié: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)
par: Li, Guangyuan, et autres
Publié: (2025)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
par: Meng, Yu, et autres
Publié: (2025)
par: Meng, Yu, et autres
Publié: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
par: He, Jialuo, et autres
Publié: (2026)
par: He, Jialuo, et autres
Publié: (2026)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
par: Lee, Dong-Jae, et autres
Publié: (2026)
par: Lee, Dong-Jae, et autres
Publié: (2026)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
par: Son, Jaemin, et autres
Publié: (2025)
par: Son, Jaemin, et autres
Publié: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
par: Wang, Xinhao, et autres
Publié: (2026)
par: Wang, Xinhao, et autres
Publié: (2026)
ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models
par: Zhang, Pu, et autres
Publié: (2025)
par: Zhang, Pu, et autres
Publié: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
par: Sha, Lin, et autres
Publié: (2026)
par: Sha, Lin, et autres
Publié: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
par: Ma, Jie, et autres
Publié: (2026)
par: Ma, Jie, et autres
Publié: (2026)
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
par: Góral, Gracjan, et autres
Publié: (2025)
par: Góral, Gracjan, et autres
Publié: (2025)
FoPru: Focal Pruning for Efficient Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2024)
par: Jiang, Lei, et autres
Publié: (2024)
HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
par: Liu, Shengyuan, et autres
Publié: (2026)
par: Liu, Shengyuan, et autres
Publié: (2026)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference
par: Kang, Beomseok, et autres
Publié: (2026)
par: Kang, Beomseok, et autres
Publié: (2026)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
par: Huang, Mingzhe, et autres
Publié: (2026)
par: Huang, Mingzhe, et autres
Publié: (2026)
Exploring Token Pruning in Vision State Space Models
par: Zhan, Zheng, et autres
Publié: (2024)
par: Zhan, Zheng, et autres
Publié: (2024)
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
par: Hoang-Xuan, Nhat, et autres
Publié: (2025)
par: Hoang-Xuan, Nhat, et autres
Publié: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
par: Liu, Jizhihui, et autres
Publié: (2025)
par: Liu, Jizhihui, et autres
Publié: (2025)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
Token Pruning using a Lightweight Background Aware Vision Transformer
par: Sah, Sudhakar, et autres
Publié: (2024)
par: Sah, Sudhakar, et autres
Publié: (2024)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
par: Deniz, Omer Faruk, et autres
Publié: (2026)
par: Deniz, Omer Faruk, et autres
Publié: (2026)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models
par: Bai, Lincen, et autres
Publié: (2026)
par: Bai, Lincen, et autres
Publié: (2026)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
par: Zhang, Qizhe, et autres
Publié: (2024)
par: Zhang, Qizhe, et autres
Publié: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
par: Luo, Junwei, et autres
Publié: (2025)
par: Luo, Junwei, et autres
Publié: (2025)
VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models
par: Ji, Huawei, et autres
Publié: (2026)
par: Ji, Huawei, et autres
Publié: (2026)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
par: Lin, Haokun, et autres
Publié: (2024)
par: Lin, Haokun, et autres
Publié: (2024)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
par: Wen, Yuxin, et autres
Publié: (2024)
par: Wen, Yuxin, et autres
Publié: (2024)
Walk and Read Less: Improving the Efficiency of Vision-and-Language Navigation via Tuning-Free Multimodal Token Pruning
par: Qin, Wenda, et autres
Publié: (2025)
par: Qin, Wenda, et autres
Publié: (2025)
Documents similaires
-
Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions
par: Szczepanski, Michal, et autres
Publié: (2025) -
I-Segmenter: Integer-Only Vision Transformer for Efficient Semantic Segmentation
par: Sassoon, Jordan, et autres
Publié: (2025) -
Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
par: Galagain, Calvin, et autres
Publié: (2026) -
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
par: Li, Ao, et autres
Publié: (2025) -
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)