Local Information Matters: Inference Acceleration For Grounded Conversation Generation Models Through Adaptive Local-Aware Token Pruning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bai, Bizhe, Cao, Jianjian, Luo, Yadan, Chen, Tao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)
Grounding-Aware Token Pruning: Recovering from Drastic Performance Drops in Visual Grounding Caused by Pruning
von: Chien, Tzu-Chun, et al.
Veröffentlicht: (2025)
von: Chien, Tzu-Chun, et al.
Veröffentlicht: (2025)
CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models
von: Cheng, Xinle, et al.
Veröffentlicht: (2025)
von: Cheng, Xinle, et al.
Veröffentlicht: (2025)
CorrAdaptor: Adaptive Local Context Learning for Correspondence Pruning
von: Zhu, Wei, et al.
Veröffentlicht: (2024)
von: Zhu, Wei, et al.
Veröffentlicht: (2024)
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
von: Li, Ye, et al.
Veröffentlicht: (2024)
von: Li, Ye, et al.
Veröffentlicht: (2024)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
von: Li, Geng, et al.
Veröffentlicht: (2026)
von: Li, Geng, et al.
Veröffentlicht: (2026)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
Motion-Aware Adaptive Pixel Pruning for Efficient Local Motion Deblurring
von: Shang, Wei, et al.
Veröffentlicht: (2025)
von: Shang, Wei, et al.
Veröffentlicht: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management
von: Wang, Chao, et al.
Veröffentlicht: (2026)
von: Wang, Chao, et al.
Veröffentlicht: (2026)
TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation
von: Shaulov, Ariel, et al.
Veröffentlicht: (2026)
von: Shaulov, Ariel, et al.
Veröffentlicht: (2026)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
von: Endo, Mark, et al.
Veröffentlicht: (2024)
von: Endo, Mark, et al.
Veröffentlicht: (2024)
FastEdit: Fast Text-Guided Single-Image Editing via Semantic-Aware Diffusion Fine-Tuning
von: Chen, Zhi, et al.
Veröffentlicht: (2024)
von: Chen, Zhi, et al.
Veröffentlicht: (2024)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
von: Lee, Jaewoo, et al.
Veröffentlicht: (2025)
von: Lee, Jaewoo, et al.
Veröffentlicht: (2025)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
Reg4Pru: Regularisation Through Random Token Routing for Token Pruning
von: Wyatt, Julian, et al.
Veröffentlicht: (2026)
von: Wyatt, Julian, et al.
Veröffentlicht: (2026)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
Similarity-Aware Token Pruning: Your VLM but Faster
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
von: He, Jialuo, et al.
Veröffentlicht: (2026)
von: He, Jialuo, et al.
Veröffentlicht: (2026)
ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
von: Lee, Yuna, et al.
Veröffentlicht: (2026)
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning
von: Xia, Guoyang, et al.
Veröffentlicht: (2025)
von: Xia, Guoyang, et al.
Veröffentlicht: (2025)
CATP: Confidence-Aware Token Pruning for Camouflaged Object Detection
von: Gao, Yuhan, et al.
Veröffentlicht: (2026)
von: Gao, Yuhan, et al.
Veröffentlicht: (2026)
$Δ$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
von: Chen, Pengtao, et al.
Veröffentlicht: (2024)
von: Chen, Pengtao, et al.
Veröffentlicht: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
FastVAR: Linear Visual Autoregressive Modeling via Cached Token Pruning
von: Guo, Hang, et al.
Veröffentlicht: (2025)
von: Guo, Hang, et al.
Veröffentlicht: (2025)
Token Pruning for In-Context Generation in Diffusion Transformers
von: Lin, Junqing, et al.
Veröffentlicht: (2026)
von: Lin, Junqing, et al.
Veröffentlicht: (2026)
GALA: Geometry-Aware Local Adaptive Grids for Detailed 3D Generation
von: Yang, Dingdong, et al.
Veröffentlicht: (2024)
von: Yang, Dingdong, et al.
Veröffentlicht: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
von: Li, Ye, et al.
Veröffentlicht: (2025)
von: Li, Ye, et al.
Veröffentlicht: (2025)
MambaOcc: Visual State Space Model for BEV-based Occupancy Prediction with Local Adaptive Reordering
von: Tian, Yonglin, et al.
Veröffentlicht: (2024)
von: Tian, Yonglin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025) -
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024) -
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025) -
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025) -
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
von: Zhang, Weichen, et al.
Veröffentlicht: (2025)