Efficient Vision-Language Reasoning via Adaptive Token Pruning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xue, Song, Xiaonan, Hu, Henry |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
di: Baek, Changwoo, et al.
Pubblicazione: (2026)
di: Baek, Changwoo, et al.
Pubblicazione: (2026)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
di: Lin, Zichuan, et al.
Pubblicazione: (2025)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
di: Chen, Yangyi, et al.
Pubblicazione: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
di: Fu, Deqing, et al.
Pubblicazione: (2024)
di: Fu, Deqing, et al.
Pubblicazione: (2024)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
di: Sung, Yi-Lin, et al.
Pubblicazione: (2023)
di: Sung, Yi-Lin, et al.
Pubblicazione: (2023)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
di: Li, Ang, et al.
Pubblicazione: (2025)
di: Li, Ang, et al.
Pubblicazione: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
di: Li, Chengzu, et al.
Pubblicazione: (2024)
di: Li, Chengzu, et al.
Pubblicazione: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
di: Li, Yanghao, et al.
Pubblicazione: (2025)
di: Li, Yanghao, et al.
Pubblicazione: (2025)
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
di: Ding, Yi, et al.
Pubblicazione: (2026)
di: Ding, Yi, et al.
Pubblicazione: (2026)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
di: Xu, Siyu, et al.
Pubblicazione: (2025)
di: Xu, Siyu, et al.
Pubblicazione: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
di: Jie, Shibo, et al.
Pubblicazione: (2024)
di: Jie, Shibo, et al.
Pubblicazione: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
di: Yan, Yuming, et al.
Pubblicazione: (2026)
di: Yan, Yuming, et al.
Pubblicazione: (2026)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
di: Fan, Ziyang, et al.
Pubblicazione: (2026)
di: Fan, Ziyang, et al.
Pubblicazione: (2026)
A General and Efficient Training for Transformer via Token Expansion
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
di: Pathak, Surendra, et al.
Pubblicazione: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
Efficient Pruning of Text-to-Image Models: Insights from Pruning Stable Diffusion
di: Ramesh, Samarth N, et al.
Pubblicazione: (2024)
di: Ramesh, Samarth N, et al.
Pubblicazione: (2024)
The Neglected Tails in Vision-Language Models
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
di: Chen, Yangyi, et al.
Pubblicazione: (2023)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
di: Jiang, Titong, et al.
Pubblicazione: (2025)
di: Jiang, Titong, et al.
Pubblicazione: (2025)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
di: Zhou, Yiyang, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
di: Liang, Mingliang, et al.
Pubblicazione: (2024)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
di: Song, Yuhang, et al.
Pubblicazione: (2024)
di: Song, Yuhang, et al.
Pubblicazione: (2024)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
di: Huang, Wenxuan, et al.
Pubblicazione: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
di: Huang, Wenxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
di: Baek, Changwoo, et al.
Pubblicazione: (2026) -
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
di: Li, Yue, et al.
Pubblicazione: (2025) -
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026) -
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
di: Lin, Zichuan, et al.
Pubblicazione: (2025) -
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
di: Chen, Yangyi, et al.
Pubblicazione: (2025)