Reinforcement Learning-based Token Pruning in Vision Transformers: A Markov Game Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Chenglong, Liang, Shen, Wang, Xuewei, Wang, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PPT: Token Pruning and Pooling for Efficient Vision Transformers
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
di: Wu, Xinjian, et al.
Pubblicazione: (2023)
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
di: Su, Wei-Yuan, et al.
Pubblicazione: (2026)
di: Su, Wei-Yuan, et al.
Pubblicazione: (2026)
Adaptive MLP Pruning for Large Vision Transformers
di: Shen, Chengchao
Pubblicazione: (2026)
di: Shen, Chengchao
Pubblicazione: (2026)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation
di: Wang, Haonan, et al.
Pubblicazione: (2024)
di: Wang, Haonan, et al.
Pubblicazione: (2024)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
di: Takezoe, Rinyoichi, et al.
Pubblicazione: (2026)
di: Takezoe, Rinyoichi, et al.
Pubblicazione: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
di: Ma, Kexin, et al.
Pubblicazione: (2026)
di: Ma, Kexin, et al.
Pubblicazione: (2026)
TP-Spikformer: Token Pruned Spiking Transformer
di: Wei, Wenjie, et al.
Pubblicazione: (2026)
di: Wei, Wenjie, et al.
Pubblicazione: (2026)
Attention Debiasing for Token Pruning in Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens
di: Sun, Dengdi, et al.
Pubblicazione: (2024)
di: Sun, Dengdi, et al.
Pubblicazione: (2024)
Block-based Symmetric Pruning and Fusion for Efficient Vision Transformers
di: Hsieh, Yi-Kuan, et al.
Pubblicazione: (2025)
di: Hsieh, Yi-Kuan, et al.
Pubblicazione: (2025)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
di: Uddin, Mohammad Helal, et al.
Pubblicazione: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Token Pruning for In-Context Generation in Diffusion Transformers
di: Lin, Junqing, et al.
Pubblicazione: (2026)
di: Lin, Junqing, et al.
Pubblicazione: (2026)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
di: Li, Haotang, et al.
Pubblicazione: (2026)
di: Li, Haotang, et al.
Pubblicazione: (2026)
Exploring Token Pruning in Vision State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
Token Pruning using a Lightweight Background Aware Vision Transformer
di: Sah, Sudhakar, et al.
Pubblicazione: (2024)
di: Sah, Sudhakar, et al.
Pubblicazione: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
Fast SAM2 with Text-Driven Token Pruning
di: Mandal, Avilasha, et al.
Pubblicazione: (2025)
di: Mandal, Avilasha, et al.
Pubblicazione: (2025)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
DORA: Dynamic Online Reinforcement Agent for Token Merging in Vision Transformers
di: He, Kaixuan, et al.
Pubblicazione: (2026)
di: He, Kaixuan, et al.
Pubblicazione: (2026)
Towards Joint Quantization and Token Pruning of Vision-Language Models
di: Li, Xinqing, et al.
Pubblicazione: (2026)
di: Li, Xinqing, et al.
Pubblicazione: (2026)
EfficientLLaVA:Generalizable Auto-Pruning for Large Vision-language Models
di: Liang, Yinan, et al.
Pubblicazione: (2025)
di: Liang, Yinan, et al.
Pubblicazione: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
di: Sha, Lin, et al.
Pubblicazione: (2026)
di: Sha, Lin, et al.
Pubblicazione: (2026)
Pruning One More Token is Enough: Leveraging Latency-Workload Non-Linearities for Vision Transformers on the Edge
di: Eliopoulos, Nick John, et al.
Pubblicazione: (2024)
di: Eliopoulos, Nick John, et al.
Pubblicazione: (2024)
Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
di: Fang, Zhengyao, et al.
Pubblicazione: (2026)
di: Fang, Zhengyao, et al.
Pubblicazione: (2026)
SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation
di: Ma, Shilin, et al.
Pubblicazione: (2026)
di: Ma, Shilin, et al.
Pubblicazione: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
di: Chen, Hanning, et al.
Pubblicazione: (2024)
di: Chen, Hanning, et al.
Pubblicazione: (2024)
CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PPT: Token Pruning and Pooling for Efficient Vision Transformers
di: Wu, Xinjian, et al.
Pubblicazione: (2023) -
Rényi Entropy: A New Token Pruning Metric for Vision Transformers
di: Su, Wei-Yuan, et al.
Pubblicazione: (2026) -
Adaptive MLP Pruning for Large Vision Transformers
di: Shen, Chengchao
Pubblicazione: (2026) -
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
di: Cao, Jianjian, et al.
Pubblicazione: (2024) -
GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation
di: Wang, Haonan, et al.
Pubblicazione: (2024)