Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Suo, Wei, Ma, Ji, Sun, Mengyang, Wu, Lin Yuanbo, Wang, Peng, Zhang, Yanning |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
por: Fu, Mingyu, et al.
Publicado: (2025)
por: Fu, Mingyu, et al.
Publicado: (2025)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
por: Ma, Ji, et al.
Publicado: (2025)
por: Ma, Ji, et al.
Publicado: (2025)
Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding
por: Suo, Wei, et al.
Publicado: (2025)
por: Suo, Wei, et al.
Publicado: (2025)
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
por: Ma, Ji, et al.
Publicado: (2024)
por: Ma, Ji, et al.
Publicado: (2024)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
por: Ma, Ji, et al.
Publicado: (2026)
por: Ma, Ji, et al.
Publicado: (2026)
Visual Prompt Selection for In-Context Learning Segmentation
por: Suo, Wei, et al.
Publicado: (2024)
por: Suo, Wei, et al.
Publicado: (2024)
Rethinking Model Efficiency: Multi-Agent Inference with Large Models
por: Dong, Sixun, et al.
Publicado: (2026)
por: Dong, Sixun, et al.
Publicado: (2026)
A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap
por: Zhang, Lijun, et al.
Publicado: (2024)
por: Zhang, Lijun, et al.
Publicado: (2024)
Is Nano Banana Pro a Low-Level Vision All-Rounder? A Comprehensive Evaluation on 14 Tasks and 40 Datasets
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Hallucination-aware intermediate representation edit in large vision-language models
por: Suo, Wei, et al.
Publicado: (2026)
por: Suo, Wei, et al.
Publicado: (2026)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
por: Takezoe, Rinyoichi, et al.
Publicado: (2026)
por: Takezoe, Rinyoichi, et al.
Publicado: (2026)
Topology-Aware Layer Pruning for Large Vision-Language Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
por: Zeng, Quan-Sheng, et al.
Publicado: (2025)
por: Zeng, Quan-Sheng, et al.
Publicado: (2025)
Vision and Intention Boost Large Language Model in Long-Term Action Anticipation
por: Cao, Congqi, et al.
Publicado: (2025)
por: Cao, Congqi, et al.
Publicado: (2025)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
por: Li, Ao, et al.
Publicado: (2025)
por: Li, Ao, et al.
Publicado: (2025)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
por: Ma, Jie, et al.
Publicado: (2026)
por: Ma, Jie, et al.
Publicado: (2026)
LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models
por: Wu, Zongyu, et al.
Publicado: (2025)
por: Wu, Zongyu, et al.
Publicado: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
por: Ma, Kexin, et al.
Publicado: (2026)
por: Ma, Kexin, et al.
Publicado: (2026)
Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
por: Wu, Mingrui, et al.
Publicado: (2024)
por: Wu, Mingrui, et al.
Publicado: (2024)
Rethinking Causal Mask Attention for Vision-Language Inference
por: Pei, Xiaohuan, et al.
Publicado: (2025)
por: Pei, Xiaohuan, et al.
Publicado: (2025)
OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
por: Fu, Teng, et al.
Publicado: (2025)
por: Fu, Teng, et al.
Publicado: (2025)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
por: Pei, Ruiguang, et al.
Publicado: (2025)
por: Pei, Ruiguang, et al.
Publicado: (2025)
Rethinking Pruning for Vision-Language Models: Strategies for Effective Sparsity and Performance Restoration
por: He, Shwai, et al.
Publicado: (2024)
por: He, Shwai, et al.
Publicado: (2024)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
por: Shang, Zhenhao, et al.
Publicado: (2026)
por: Shang, Zhenhao, et al.
Publicado: (2026)
Collaborative Multi-Mode Pruning for Vision-Language Models
por: Wu, Zimeng, et al.
Publicado: (2026)
por: Wu, Zimeng, et al.
Publicado: (2026)
Rethinking Token Reduction for Large Vision-Language Models
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
por: Ding, Zongcan, et al.
Publicado: (2025)
por: Ding, Zongcan, et al.
Publicado: (2025)
Automatic Pruning Discovery for Large Language Models
por: Kang, Haidong, et al.
Publicado: (2025)
por: Kang, Haidong, et al.
Publicado: (2025)
DiffV2IR: Visible-to-Infrared Diffusion Model via Vision-Language Understanding
por: Ran, Lingyan, et al.
Publicado: (2025)
por: Ran, Lingyan, et al.
Publicado: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
por: Zhao, Kai, et al.
Publicado: (2025)
por: Zhao, Kai, et al.
Publicado: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
por: Lee, Dong-Jae, et al.
Publicado: (2026)
por: Lee, Dong-Jae, et al.
Publicado: (2026)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
por: Lin, Haokun, et al.
Publicado: (2024)
por: Lin, Haokun, et al.
Publicado: (2024)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
por: Wang, Feng, et al.
Publicado: (2023)
por: Wang, Feng, et al.
Publicado: (2023)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
por: Luo, Wen, et al.
Publicado: (2026)
por: Luo, Wen, et al.
Publicado: (2026)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
por: Wang, Xinhao, et al.
Publicado: (2026)
por: Wang, Xinhao, et al.
Publicado: (2026)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
por: Yuan, Qianhao, et al.
Publicado: (2025)
por: Yuan, Qianhao, et al.
Publicado: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
por: Madinei, Parsa, et al.
Publicado: (2025)
por: Madinei, Parsa, et al.
Publicado: (2025)
Ejemplares similares
-
Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models
por: Fu, Mingyu, et al.
Publicado: (2025) -
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
por: Ma, Ji, et al.
Publicado: (2025) -
Octopus: Alleviating Hallucination via Dynamic Contrastive Decoding
por: Suo, Wei, et al.
Publicado: (2025) -
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
por: Ma, Ji, et al.
Publicado: (2024) -
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
por: Ma, Ji, et al.
Publicado: (2026)