OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Geng, Chen, Guohao, Chen, Ting, Shan, Shilin, Zuo, Kuangji, Lyu, Bofan, An, Tuo, Li, Gen, Yang, Jianfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoboForge: Physically Optimized Text-guided Whole-Body Locomotion for Humanoids
di: Yuan, Xichen, et al.
Pubblicazione: (2026)
di: Yuan, Xichen, et al.
Pubblicazione: (2026)
FLASH: Efficient Visuomotor Policy via Sparse Sampling
di: Bai, Jiaqi, et al.
Pubblicazione: (2026)
di: Bai, Jiaqi, et al.
Pubblicazione: (2026)
CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects
di: Li, Jingliang, et al.
Pubblicazione: (2026)
di: Li, Jingliang, et al.
Pubblicazione: (2026)
Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
di: Zuo, Kuangji, et al.
Pubblicazione: (2026)
di: Zuo, Kuangji, et al.
Pubblicazione: (2026)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
di: Bagrov, Natan, et al.
Pubblicazione: (2025)
AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference
di: Feng, Yilin, et al.
Pubblicazione: (2026)
di: Feng, Yilin, et al.
Pubblicazione: (2026)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
di: Wu, Zhenkai, et al.
Pubblicazione: (2025)
Pruning Large Language Models with Semi-Structural Adaptive Sparse Training
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
di: Huang, Weiyu, et al.
Pubblicazione: (2024)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
di: Chen, Yuhao, et al.
Pubblicazione: (2026)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
di: Hu, Junshan, et al.
Pubblicazione: (2025)
di: Hu, Junshan, et al.
Pubblicazione: (2025)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2026)
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2026)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
di: Li, Jiaao, et al.
Pubblicazione: (2025)
di: Li, Jiaao, et al.
Pubblicazione: (2025)
EVA-0: Test-Time Model Evolution with Only Two Forward Passes per Sample
di: Chen, Guohao, et al.
Pubblicazione: (2026)
di: Chen, Guohao, et al.
Pubblicazione: (2026)
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference
di: Liao, Ruqi, et al.
Pubblicazione: (2024)
di: Liao, Ruqi, et al.
Pubblicazione: (2024)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
di: Li, Ye, et al.
Pubblicazione: (2024)
di: Li, Ye, et al.
Pubblicazione: (2024)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
MARS Policy: Multimodality Only When It Matters
di: Jia, Jindou, et al.
Pubblicazione: (2026)
di: Jia, Jindou, et al.
Pubblicazione: (2026)
Feedback World Model Enables Precise Guidance of Diffusion Policy
di: An, Tuo, et al.
Pubblicazione: (2026)
di: An, Tuo, et al.
Pubblicazione: (2026)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
di: Chen, Huamin, et al.
Pubblicazione: (2026)
di: Chen, Huamin, et al.
Pubblicazione: (2026)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
di: Li, Xue, et al.
Pubblicazione: (2025)
di: Li, Xue, et al.
Pubblicazione: (2025)
SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Similarity-Aware Token Pruning: Your VLM but Faster
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
Real-Time Human Activity Recognition on Edge Microcontrollers: Dynamic Hierarchical Inference with Multi-Spectral Sensor Fusion
di: Li, Boyu, et al.
Pubblicazione: (2026)
di: Li, Boyu, et al.
Pubblicazione: (2026)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2023)
di: Wang, Zekun, et al.
Pubblicazione: (2023)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
di: Qian, Chen, et al.
Pubblicazione: (2026)
di: Qian, Chen, et al.
Pubblicazione: (2026)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
di: Liu, Shengyuan, et al.
Pubblicazione: (2026)
di: Liu, Shengyuan, et al.
Pubblicazione: (2026)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
di: Huang, Yihong, et al.
Pubblicazione: (2026)
di: Huang, Yihong, et al.
Pubblicazione: (2026)
Training Noise Token Pruning
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
di: Rao, Mingxing, et al.
Pubblicazione: (2024)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
di: Liu, Ziyan, et al.
Pubblicazione: (2025)
Efficient Token Pruning for LLaDA-V
di: Wan, Zhewen, et al.
Pubblicazione: (2026)
di: Wan, Zhewen, et al.
Pubblicazione: (2026)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
di: Yang, Wang, et al.
Pubblicazione: (2026)
di: Yang, Wang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RoboForge: Physically Optimized Text-guided Whole-Body Locomotion for Humanoids
di: Yuan, Xichen, et al.
Pubblicazione: (2026) -
FLASH: Efficient Visuomotor Policy via Sparse Sampling
di: Bai, Jiaqi, et al.
Pubblicazione: (2026) -
CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects
di: Li, Jingliang, et al.
Pubblicazione: (2026) -
Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
di: Zuo, Kuangji, et al.
Pubblicazione: (2026) -
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
di: Bagrov, Natan, et al.
Pubblicazione: (2025)