Efficient Vision-Language Reasoning via Adaptive Token Pruning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xue, Song, Xiaonan, Hu, Henry |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
von: Baek, Changwoo, et al.
Veröffentlicht: (2026)
von: Baek, Changwoo, et al.
Veröffentlicht: (2026)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
von: Li, Sijie, et al.
Veröffentlicht: (2026)
von: Li, Sijie, et al.
Veröffentlicht: (2026)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
von: Lin, Zichuan, et al.
Veröffentlicht: (2025)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
von: Chen, Yangyi, et al.
Veröffentlicht: (2025)
von: Chen, Yangyi, et al.
Veröffentlicht: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
von: Fu, Deqing, et al.
Veröffentlicht: (2024)
von: Fu, Deqing, et al.
Veröffentlicht: (2024)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
von: Sung, Yi-Lin, et al.
Veröffentlicht: (2023)
von: Sung, Yi-Lin, et al.
Veröffentlicht: (2023)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
von: Li, Ang, et al.
Veröffentlicht: (2025)
von: Li, Ang, et al.
Veröffentlicht: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
von: Ding, Yi, et al.
Veröffentlicht: (2025)
von: Ding, Yi, et al.
Veröffentlicht: (2025)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
von: Li, Chengzu, et al.
Veröffentlicht: (2024)
von: Li, Chengzu, et al.
Veröffentlicht: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
Vision-Language Models Can Self-Improve Reasoning via Reflection
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer
von: Li, Yanghao, et al.
Veröffentlicht: (2025)
von: Li, Yanghao, et al.
Veröffentlicht: (2025)
A Survey on Hallucination in Large Vision-Language Models
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
von: Liu, Hanchao, et al.
Veröffentlicht: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
von: Rajabi, Navid, et al.
Veröffentlicht: (2023)
von: Rajabi, Navid, et al.
Veröffentlicht: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
von: Zhang, Dingkun, et al.
Veröffentlicht: (2026)
von: Zhang, Dingkun, et al.
Veröffentlicht: (2026)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
von: Ding, Yi, et al.
Veröffentlicht: (2026)
von: Ding, Yi, et al.
Veröffentlicht: (2026)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
von: Xu, Siyu, et al.
Veröffentlicht: (2025)
von: Xu, Siyu, et al.
Veröffentlicht: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
von: Hu, Wenbo, et al.
Veröffentlicht: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
von: Jie, Shibo, et al.
Veröffentlicht: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
von: Yan, Yuming, et al.
Veröffentlicht: (2026)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
von: Qi, Yayun, et al.
Veröffentlicht: (2024)
von: Qi, Yayun, et al.
Veröffentlicht: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
von: Hao, Tianxiang, et al.
Veröffentlicht: (2023)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
von: Fan, Ziyang, et al.
Veröffentlicht: (2026)
von: Fan, Ziyang, et al.
Veröffentlicht: (2026)
A General and Efficient Training for Transformer via Token Expansion
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
von: Pathak, Surendra, et al.
Veröffentlicht: (2026)
von: Pathak, Surendra, et al.
Veröffentlicht: (2026)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
von: Chen, Boyuan, et al.
Veröffentlicht: (2024)
Efficient Pruning of Text-to-Image Models: Insights from Pruning Stable Diffusion
von: Ramesh, Samarth N, et al.
Veröffentlicht: (2024)
von: Ramesh, Samarth N, et al.
Veröffentlicht: (2024)
The Neglected Tails in Vision-Language Models
von: Parashar, Shubham, et al.
Veröffentlicht: (2024)
von: Parashar, Shubham, et al.
Veröffentlicht: (2024)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
von: Chen, Yangyi, et al.
Veröffentlicht: (2023)
Vision-Language Model Fine-Tuning via Simple Parameter-Efficient Modification
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
von: Jiang, Titong, et al.
Veröffentlicht: (2025)
von: Jiang, Titong, et al.
Veröffentlicht: (2025)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
von: Song, Yuhang, et al.
Veröffentlicht: (2024)
von: Song, Yuhang, et al.
Veröffentlicht: (2024)
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
von: Baek, Changwoo, et al.
Veröffentlicht: (2026) -
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
von: Li, Yue, et al.
Veröffentlicht: (2025) -
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
von: Li, Sijie, et al.
Veröffentlicht: (2026) -
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
von: Lin, Zichuan, et al.
Veröffentlicht: (2025) -
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
von: Chen, Yangyi, et al.
Veröffentlicht: (2025)