Walk and Read Less: Improving the Efficiency of Vision-and-Language Navigation via Tuning-Free Multimodal Token Pruning
Fuente:
arXiv
Salvato in:
| Autori principali: | Qin, Wenda, Burns, Andrea, Plummer, Bryan A., Betke, Margrit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tell Me What's Next: Textual Foresight for Generic UI Representations
di: Burns, Andrea, et al.
Pubblicazione: (2024)
di: Burns, Andrea, et al.
Pubblicazione: (2024)
LoRA-Loop: Closing the Synthetic Replay Cycle for Continual VLM Learning
di: Wang, Kaihong, et al.
Pubblicazione: (2025)
di: Wang, Kaihong, et al.
Pubblicazione: (2025)
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
di: Kim, Youngeun, et al.
Pubblicazione: (2025)
di: Kim, Youngeun, et al.
Pubblicazione: (2025)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
di: Cao, Jianjian, et al.
Pubblicazione: (2024)
Web Artifact Attacks Disrupt Vision Language Models
di: Qraitem, Maan, et al.
Pubblicazione: (2025)
di: Qraitem, Maan, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-Guidance
di: Liu, Aoming, et al.
Pubblicazione: (2024)
di: Liu, Aoming, et al.
Pubblicazione: (2024)
Attention Debiasing for Token Pruning in Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
di: Sha, Lin, et al.
Pubblicazione: (2026)
di: Sha, Lin, et al.
Pubblicazione: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
di: Suo, Wei, et al.
Pubblicazione: (2024)
di: Suo, Wei, et al.
Pubblicazione: (2024)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
di: Pham, Chau, et al.
Pubblicazione: (2024)
di: Pham, Chau, et al.
Pubblicazione: (2024)
Towards Joint Quantization and Token Pruning of Vision-Language Models
di: Li, Xinqing, et al.
Pubblicazione: (2026)
di: Li, Xinqing, et al.
Pubblicazione: (2026)
HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
di: Wang, Yahong, et al.
Pubblicazione: (2026)
di: Wang, Yahong, et al.
Pubblicazione: (2026)
ExeChecker: Where Did I Go Wrong?
di: Gu, Yiwen, et al.
Pubblicazione: (2024)
di: Gu, Yiwen, et al.
Pubblicazione: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
ChA-MAEViT: Unifying Channel-Aware Masked Autoencoders and Multi-Channel Vision Transformers for Improved Cross-Channel Learning
di: Pham, Chau, et al.
Pubblicazione: (2025)
di: Pham, Chau, et al.
Pubblicazione: (2025)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
di: Chen, Hanning, et al.
Pubblicazione: (2024)
di: Chen, Hanning, et al.
Pubblicazione: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
di: Lee, Dong-Jae, et al.
Pubblicazione: (2026)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
di: Li, Xue, et al.
Pubblicazione: (2025)
di: Li, Xue, et al.
Pubblicazione: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
di: Ma, Kexin, et al.
Pubblicazione: (2026)
di: Ma, Kexin, et al.
Pubblicazione: (2026)
Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models
di: He, Landi, et al.
Pubblicazione: (2026)
di: He, Landi, et al.
Pubblicazione: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
di: Luan, Bozhi, et al.
Pubblicazione: (2025)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
di: Takezoe, Rinyoichi, et al.
Pubblicazione: (2026)
di: Takezoe, Rinyoichi, et al.
Pubblicazione: (2026)
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
di: Sun, Zhichao, et al.
Pubblicazione: (2026)
GenEAva: Generating Cartoon Avatars with Fine-Grained Facial Expressions from Realistic Diffusion-based Faces
di: Yu, Hao, et al.
Pubblicazione: (2025)
di: Yu, Hao, et al.
Pubblicazione: (2025)
Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy
di: Yu, Hao, et al.
Pubblicazione: (2025)
di: Yu, Hao, et al.
Pubblicazione: (2025)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
LNL+K: Enhancing Learning with Noisy Labels Through Noise Source Knowledge Integration
di: Wang, Siqi, et al.
Pubblicazione: (2023)
di: Wang, Siqi, et al.
Pubblicazione: (2023)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Tell Me What's Next: Textual Foresight for Generic UI Representations
di: Burns, Andrea, et al.
Pubblicazione: (2024) -
LoRA-Loop: Closing the Synthetic Replay Cycle for Continual VLM Learning
di: Wang, Kaihong, et al.
Pubblicazione: (2025) -
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models
di: Kim, Youngeun, et al.
Pubblicazione: (2025) -
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
di: Cao, Jianjian, et al.
Pubblicazione: (2024) -
Web Artifact Attacks Disrupt Vision Language Models
di: Qraitem, Maan, et al.
Pubblicazione: (2025)