Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Yudong, Sun, Jingwei, Lin, Yueqian, Zhang, Jingyang, Yin, Ming, Wang, Qinsi, Zhang, Jianyi, Li, Hai, Chen, Yiran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
von: Lin, Yueqian, et al.
Veröffentlicht: (2024)
von: Lin, Yueqian, et al.
Veröffentlicht: (2024)
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
von: Wang, Yiheng, et al.
Veröffentlicht: (2026)
von: Wang, Yiheng, et al.
Veröffentlicht: (2026)
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
von: Liu, Yudong, et al.
Veröffentlicht: (2025)
von: Liu, Yudong, et al.
Veröffentlicht: (2025)
HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference
von: Liu, Yudong, et al.
Veröffentlicht: (2026)
von: Liu, Yudong, et al.
Veröffentlicht: (2026)
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
von: Wang, Zhongxi, et al.
Veröffentlicht: (2026)
von: Wang, Zhongxi, et al.
Veröffentlicht: (2026)
SD-NAE: Generating Natural Adversarial Examples with Stable Diffusion
von: Lin, Yueqian, et al.
Veröffentlicht: (2023)
von: Lin, Yueqian, et al.
Veröffentlicht: (2023)
FlashFPS: Efficient Farthest Point Sampling for Large-Scale Point Clouds via Pruning and Caching
von: Fu, Yuzhe, et al.
Veröffentlicht: (2026)
von: Fu, Yuzhe, et al.
Veröffentlicht: (2026)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
von: Yin, Ming, et al.
Veröffentlicht: (2024)
von: Yin, Ming, et al.
Veröffentlicht: (2024)
CoreInfer: Accelerating Large Language Model Inference with Semantics-Inspired Adaptive Sparse Activation
von: Wang, Qinsi, et al.
Veröffentlicht: (2024)
von: Wang, Qinsi, et al.
Veröffentlicht: (2024)
Towards Joint Quantization and Token Pruning of Vision-Language Models
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
von: Li, Xinqing, et al.
Veröffentlicht: (2026)
Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
von: Wei, Chiyue, et al.
Veröffentlicht: (2025)
von: Wei, Chiyue, et al.
Veröffentlicht: (2025)
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
von: Huang, Yiran, et al.
Veröffentlicht: (2026)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
von: Li, Ao, et al.
Veröffentlicht: (2025)
von: Li, Ao, et al.
Veröffentlicht: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
Attention Debiasing for Token Pruning in Vision Language Models
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
von: Zhao, Kai, et al.
Veröffentlicht: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own Signals
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
von: Wang, Qinsi, et al.
Veröffentlicht: (2025)
KFFocus: Highlighting Keyframes for Enhanced Video Understanding
von: Nie, Ming, et al.
Veröffentlicht: (2025)
von: Nie, Ming, et al.
Veröffentlicht: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
von: Zeng, Quan-Sheng, et al.
Veröffentlicht: (2025)
IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
von: Lee, Dong-Jae, et al.
Veröffentlicht: (2026)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
von: Tang, Zicong, et al.
Veröffentlicht: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
von: Ye, Xubing, et al.
Veröffentlicht: (2024)
Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
von: Suo, Wei, et al.
Veröffentlicht: (2024)
von: Suo, Wei, et al.
Veröffentlicht: (2024)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
von: Meng, Yu, et al.
Veröffentlicht: (2025)
von: Meng, Yu, et al.
Veröffentlicht: (2025)
Proactive Privacy Amnesia for Large Language Models: Safeguarding PII with Negligible Impact on Model Utility
von: Kuo, Martin, et al.
Veröffentlicht: (2025)
von: Kuo, Martin, et al.
Veröffentlicht: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
von: Li, Guangyuan, et al.
Veröffentlicht: (2025)
GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
von: Pei, Ruiguang, et al.
Veröffentlicht: (2025)
AsyncVoice Agent: Real-Time Explanation for LLM Planning and Reasoning
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)
KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
von: Ye, Hancheng, et al.
Veröffentlicht: (2025)
von: Ye, Hancheng, et al.
Veröffentlicht: (2025)
SADA: Stability-guided Adaptive Diffusion Acceleration
von: Jiang, Ting, et al.
Veröffentlicht: (2025)
von: Jiang, Ting, et al.
Veröffentlicht: (2025)
Multi-Token Enhancing for Vision Representation Learning
von: Li, Zhong-Yu, et al.
Veröffentlicht: (2024)
von: Li, Zhong-Yu, et al.
Veröffentlicht: (2024)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
von: Miyai, Atsuyuki, et al.
Veröffentlicht: (2024)
von: Miyai, Atsuyuki, et al.
Veröffentlicht: (2024)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models
von: Li, Xu, et al.
Veröffentlicht: (2026)
von: Li, Xu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
von: Lin, Yueqian, et al.
Veröffentlicht: (2024) -
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
von: Wang, Yiheng, et al.
Veröffentlicht: (2026) -
CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models
von: Wang, Qinsi, et al.
Veröffentlicht: (2025) -
LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
von: Liu, Yudong, et al.
Veröffentlicht: (2025) -
HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding
von: Lin, Yueqian, et al.
Veröffentlicht: (2025)