Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Luan, Bozhi, Zhou, Wengang, Feng, Hao, Wang, Zhe, Li, Xiaosong, Li, Houqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
di: Luan, Bozhi, et al.
Pubblicazione: (2024)
di: Luan, Bozhi, et al.
Pubblicazione: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
di: Liu, Keli, et al.
Pubblicazione: (2026)
di: Liu, Keli, et al.
Pubblicazione: (2026)
Revisiting Shadow Detection from a Vision-Language Perspective
di: Wang, Yonghui, et al.
Pubblicazione: (2026)
di: Wang, Yonghui, et al.
Pubblicazione: (2026)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
Progressive Multi-modal Conditional Prompt Tuning
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
GaussNav: Gaussian Splatting for Visual Navigation
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
di: Lei, Xiaohan, et al.
Pubblicazione: (2024)
BookNet: Book Image Rectification via Cross-Page Attention Network
di: Liu, Shaokai, et al.
Pubblicazione: (2026)
di: Liu, Shaokai, et al.
Pubblicazione: (2026)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
di: Xu, Weiye, et al.
Pubblicazione: (2025)
di: Xu, Weiye, et al.
Pubblicazione: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
di: Qi, Yukun, et al.
Pubblicazione: (2026)
di: Qi, Yukun, et al.
Pubblicazione: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
di: Zhou, Keyi, et al.
Pubblicazione: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
di: Liao, Zhaokang, et al.
Pubblicazione: (2024)
di: Liao, Zhaokang, et al.
Pubblicazione: (2024)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
di: Pei, Ruiguang, et al.
Pubblicazione: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Cross-Modal Consistency Learning for Sign Language Recognition
di: Wu, Kepeng, et al.
Pubblicazione: (2025)
di: Wu, Kepeng, et al.
Pubblicazione: (2025)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Video-based Sign Language Recognition without Temporal Segmentation
di: Huang, Jie, et al.
Pubblicazione: (2018)
di: Huang, Jie, et al.
Pubblicazione: (2018)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
di: Wang, Yahong, et al.
Pubblicazione: (2026)
di: Wang, Yahong, et al.
Pubblicazione: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
di: Li, Ao, et al.
Pubblicazione: (2025)
di: Li, Ao, et al.
Pubblicazione: (2025)
DeepEraser: Deep Iterative Context Mining for Generic Text Eraser
di: Feng, Hao, et al.
Pubblicazione: (2024)
di: Feng, Hao, et al.
Pubblicazione: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
di: Feng, Hao, et al.
Pubblicazione: (2023)
di: Feng, Hao, et al.
Pubblicazione: (2023)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
di: He, Jialuo, et al.
Pubblicazione: (2026)
di: He, Jialuo, et al.
Pubblicazione: (2026)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
di: Liu, Jizhihui, et al.
Pubblicazione: (2025)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
SwinShadow: Shifted Window for Ambiguous Adjacent Shadow Detection
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
di: Wang, Yonghui, et al.
Pubblicazione: (2024)
Motion-aware 3D Gaussian Splatting for Efficient Dynamic Scene Reconstruction
di: Guo, Zhiyang, et al.
Pubblicazione: (2024)
di: Guo, Zhiyang, et al.
Pubblicazione: (2024)
SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval
di: Jiang, Longtao, et al.
Pubblicazione: (2024)
di: Jiang, Longtao, et al.
Pubblicazione: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
di: Sun, Qi, et al.
Pubblicazione: (2024)
di: Sun, Qi, et al.
Pubblicazione: (2024)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
di: Ma, Jie, et al.
Pubblicazione: (2026)
di: Ma, Jie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
di: Luan, Bozhi, et al.
Pubblicazione: (2024) -
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
di: Liu, Keli, et al.
Pubblicazione: (2026) -
Revisiting Shadow Detection from a Vision-Language Perspective
di: Wang, Yonghui, et al.
Pubblicazione: (2026) -
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
di: Wang, Yonghui, et al.
Pubblicazione: (2024) -
Progressive Multi-modal Conditional Prompt Tuning
di: Qiu, Xiaoyu, et al.
Pubblicazione: (2024)