ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Luo, Wen, Chen, Peng, Huang, Xiaotao, Huang, LiQun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2022)
von: You, Haoran, et al.
Veröffentlicht: (2022)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
von: Zhang, Yongheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yongheng, et al.
Veröffentlicht: (2025)
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation
von: Chen, Hanning, et al.
Veröffentlicht: (2025)
von: Chen, Hanning, et al.
Veröffentlicht: (2025)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
von: Ma, Ji, et al.
Veröffentlicht: (2025)
von: Ma, Ji, et al.
Veröffentlicht: (2025)
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
von: Yue, Tongtian, et al.
Veröffentlicht: (2025)
von: Yue, Tongtian, et al.
Veröffentlicht: (2025)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
von: Endo, Mark, et al.
Veröffentlicht: (2024)
von: Endo, Mark, et al.
Veröffentlicht: (2024)
Exploring Textual Semantics Diversity for Image Transmission in Semantic Communication Systems using Visual Language Model
von: Huang, Peishan, et al.
Veröffentlicht: (2025)
von: Huang, Peishan, et al.
Veröffentlicht: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
Collaborative Multi-Mode Pruning for Vision-Language Models
von: Wu, Zimeng, et al.
Veröffentlicht: (2026)
von: Wu, Zimeng, et al.
Veröffentlicht: (2026)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
von: Liu, Yuqi, et al.
Veröffentlicht: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
von: Yan, Siming, et al.
Veröffentlicht: (2024)
von: Yan, Siming, et al.
Veröffentlicht: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
von: Wang, Yahong, et al.
Veröffentlicht: (2026)
Topology-Aware Layer Pruning for Large Vision-Language Models
von: Zheng, Pengcheng, et al.
Veröffentlicht: (2026)
von: Zheng, Pengcheng, et al.
Veröffentlicht: (2026)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
von: Madinei, Parsa, et al.
Veröffentlicht: (2025)
von: Madinei, Parsa, et al.
Veröffentlicht: (2025)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
von: Ma, Jie, et al.
Veröffentlicht: (2026)
von: Ma, Jie, et al.
Veröffentlicht: (2026)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
von: Xu, Jingqi, et al.
Veröffentlicht: (2025)
How Do Optical Flow and Textual Prompts Collaborate to Assist in Audio-Visual Semantic Segmentation?
von: Lee, Yujian, et al.
Veröffentlicht: (2026)
von: Lee, Yujian, et al.
Veröffentlicht: (2026)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
von: Feng, X., et al.
Veröffentlicht: (2024)
von: Feng, X., et al.
Veröffentlicht: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
von: Agrawal, Aakriti, et al.
Veröffentlicht: (2025)
von: Agrawal, Aakriti, et al.
Veröffentlicht: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
von: Xing, Long, et al.
Veröffentlicht: (2024)
von: Xing, Long, et al.
Veröffentlicht: (2024)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
von: Yang, Jiabing, et al.
Veröffentlicht: (2025)
von: Yang, Jiabing, et al.
Veröffentlicht: (2025)
FoPru: Focal Pruning for Efficient Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2024)
von: Jiang, Lei, et al.
Veröffentlicht: (2024)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
von: Liu, Yuchen, et al.
Veröffentlicht: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
von: Zeng, Weili, et al.
Veröffentlicht: (2025)
von: Zeng, Weili, et al.
Veröffentlicht: (2025)
ViTOC: Vision Transformer and Object-aware Captioner
von: Huang, Feiyang
Veröffentlicht: (2024)
von: Huang, Feiyang
Veröffentlicht: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
von: Cao, Jianjian, et al.
Veröffentlicht: (2024)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
von: Suo, Wei, et al.
Veröffentlicht: (2024)
von: Suo, Wei, et al.
Veröffentlicht: (2024)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
von: Liu, Yang, et al.
Veröffentlicht: (2025)
von: Liu, Yang, et al.
Veröffentlicht: (2025)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
von: Zheng, Henry, et al.
Veröffentlicht: (2025)
von: Zheng, Henry, et al.
Veröffentlicht: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
von: Xiong, Minhao, et al.
Veröffentlicht: (2025)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
von: Jin, Peng, et al.
Veröffentlicht: (2023)
von: Jin, Peng, et al.
Veröffentlicht: (2023)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
von: Jeon, Hyunsik, et al.
Veröffentlicht: (2025)
von: Jeon, Hyunsik, et al.
Veröffentlicht: (2025)
Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large Models
von: Ju, Chen, et al.
Veröffentlicht: (2024)
von: Ju, Chen, et al.
Veröffentlicht: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
von: Zeng, Yu, et al.
Veröffentlicht: (2026)
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
von: Fu, Mingyu, et al.
Veröffentlicht: (2025)
von: Fu, Mingyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design
von: You, Haoran, et al.
Veröffentlicht: (2022) -
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
von: Zhang, Yongheng, et al.
Veröffentlicht: (2025) -
LVLM_CSP: Accelerating Large Vision Language Models via Clustering, Scattering, and Pruning for Reasoning Segmentation
von: Chen, Hanning, et al.
Veröffentlicht: (2025) -
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
von: Huang, Xiaohu, et al.
Veröffentlicht: (2024) -
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
von: Ma, Ji, et al.
Veröffentlicht: (2025)