ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ju, Shaobo, Song, Baiyang, Chen, Tao, Zhang, Jiapeng, Wu, Qiong, Chang, Chao, Wang, HuaiXi, Zhou, Yiyi, Ji, Rongrong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion
von: Zhang, Ziyue, et al.
Veröffentlicht: (2026)
von: Zhang, Ziyue, et al.
Veröffentlicht: (2026)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
von: Chen, Tao, et al.
Veröffentlicht: (2026)
von: Chen, Tao, et al.
Veröffentlicht: (2026)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
von: Chen, Tao, et al.
Veröffentlicht: (2025)
von: Chen, Tao, et al.
Veröffentlicht: (2025)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
von: Ye, Weihao, et al.
Veröffentlicht: (2024)
What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph
von: Jiang, Yutao, et al.
Veröffentlicht: (2025)
von: Jiang, Yutao, et al.
Veröffentlicht: (2025)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
von: Tong, Bo, et al.
Veröffentlicht: (2024)
von: Tong, Bo, et al.
Veröffentlicht: (2024)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models
von: Li, Siyou, et al.
Veröffentlicht: (2025)
von: Li, Siyou, et al.
Veröffentlicht: (2025)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
von: Alvar, Saeed Ranjbar, et al.
Veröffentlicht: (2025)
von: Alvar, Saeed Ranjbar, et al.
Veröffentlicht: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
von: Peng, Tianfan, et al.
Veröffentlicht: (2025)
von: Peng, Tianfan, et al.
Veröffentlicht: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
von: Shi, Jiapeng, et al.
Veröffentlicht: (2026)
von: Shi, Jiapeng, et al.
Veröffentlicht: (2026)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
von: Zhu, Qihui, et al.
Veröffentlicht: (2026)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
Towards Efficient Automatic Self-Pruning of Large Language Models
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
von: Huang, Weizhong, et al.
Veröffentlicht: (2025)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
von: Zhuang, Jiedong, et al.
Veröffentlicht: (2024)
von: Zhuang, Jiedong, et al.
Veröffentlicht: (2024)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)
von: Luo, Gen, et al.
Veröffentlicht: (2024)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
von: Wang, Shaobo, et al.
Veröffentlicht: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
von: Luo, Yaxin, et al.
Veröffentlicht: (2024)
von: Luo, Yaxin, et al.
Veröffentlicht: (2024)
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
von: Li, Han, et al.
Veröffentlicht: (2026)
von: Li, Han, et al.
Veröffentlicht: (2026)
Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
von: Li, Daiqiang, et al.
Veröffentlicht: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
von: Fan, Rong, et al.
Veröffentlicht: (2026)
von: Fan, Rong, et al.
Veröffentlicht: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
Theoretical and Empirical Advances in Forest Pruning
von: Dorador, Albert
Veröffentlicht: (2024)
von: Dorador, Albert
Veröffentlicht: (2024)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
von: Guo, Yansong, et al.
Veröffentlicht: (2026)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
von: Huang, YiJie, et al.
Veröffentlicht: (2026)
von: Huang, YiJie, et al.
Veröffentlicht: (2026)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
von: Zhang, Qizhe, et al.
Veröffentlicht: (2024)
von: Zhang, Qizhe, et al.
Veröffentlicht: (2024)
Omni-Referring Image Segmentation
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
von: Zheng, Qiancheng, et al.
Veröffentlicht: (2025)
ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference
von: Huang, Zhaohong, et al.
Veröffentlicht: (2026)
von: Huang, Zhaohong, et al.
Veröffentlicht: (2026)
ForestVO: Enhancing Visual Odometry in Forest Environments through ForestGlue
von: Pritchard, Thomas, et al.
Veröffentlicht: (2025)
von: Pritchard, Thomas, et al.
Veröffentlicht: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
von: Zhang, Dingkun, et al.
Veröffentlicht: (2026)
von: Zhang, Dingkun, et al.
Veröffentlicht: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
von: Ma, Jie, et al.
Veröffentlicht: (2026)
von: Ma, Jie, et al.
Veröffentlicht: (2026)
Spatially Varying Drivers of Temporal β Diversity in Forest Avian Communities
von: Jess Dong, et al.
Veröffentlicht: (2025)
von: Jess Dong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion
von: Zhang, Ziyue, et al.
Veröffentlicht: (2026) -
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025) -
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
von: Chen, Tao, et al.
Veröffentlicht: (2026) -
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
von: Chen, Tao, et al.
Veröffentlicht: (2025) -
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
von: Wu, Qiong, et al.
Veröffentlicht: (2024)