ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sha, Lin, Guo, Haiyun, Wang, Tao, Zhang, Cong, Huang, Min, Wang, Jinqiao, Miao, Qinghai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
von: Kim, Youngeun, et al.
Veröffentlicht: (2025)
von: Kim, Youngeun, et al.
Veröffentlicht: (2025)
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2026)
von: Luo, Yuechen, et al.
Veröffentlicht: (2026)
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
von: Xu, Zhou, et al.
Veröffentlicht: (2026)
von: Xu, Zhou, et al.
Veröffentlicht: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
von: Zhang, Enming, et al.
Veröffentlicht: (2025)
von: Zhang, Enming, et al.
Veröffentlicht: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
von: Cheng, Jintao, et al.
Veröffentlicht: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
von: Li, Ao, et al.
Veröffentlicht: (2025)
von: Li, Ao, et al.
Veröffentlicht: (2025)
HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving
von: Wang, Yiru, et al.
Veröffentlicht: (2026)
von: Wang, Yiru, et al.
Veröffentlicht: (2026)
Attention Debiasing for Token Pruning in Vision Language Models
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding
von: Li, Jiaqi, et al.
Veröffentlicht: (2026)
von: Li, Jiaqi, et al.
Veröffentlicht: (2026)
Training Noise Token Pruning
von: Rao, Mingxing, et al.
Veröffentlicht: (2024)
von: Rao, Mingxing, et al.
Veröffentlicht: (2024)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
von: Guo, Hongyu, et al.
Veröffentlicht: (2025)
von: Guo, Hongyu, et al.
Veröffentlicht: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
von: Lin, Xinying, et al.
Veröffentlicht: (2026)
von: Lin, Xinying, et al.
Veröffentlicht: (2026)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
PPT: Token Pruning and Pooling for Efficient Vision Transformers
von: Wu, Xinjian, et al.
Veröffentlicht: (2023)
von: Wu, Xinjian, et al.
Veröffentlicht: (2023)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
von: Endo, Mark, et al.
Veröffentlicht: (2024)
von: Endo, Mark, et al.
Veröffentlicht: (2024)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
von: Chen, Hanning, et al.
Veröffentlicht: (2024)
von: Chen, Hanning, et al.
Veröffentlicht: (2024)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
von: Sun, Zhichao, et al.
Veröffentlicht: (2026)
Towards Joint Quantization and Token Pruning of Vision-Language Models
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
von: Kumar, Yogesh
Veröffentlicht: (2025)
von: Kumar, Yogesh
Veröffentlicht: (2025)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
von: Li, Geng, et al.
Veröffentlicht: (2026)
von: Li, Geng, et al.
Veröffentlicht: (2026)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval
von: Wang, Tianyue, et al.
Veröffentlicht: (2026)
von: Wang, Tianyue, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026) -
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
von: Zhang, Enming, et al.
Veröffentlicht: (2024) -
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
von: Kim, Youngeun, et al.
Veröffentlicht: (2025) -
LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2026) -
Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents
von: Xu, Zhou, et al.
Veröffentlicht: (2026)