SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yuan, Fan, Chun-Kai, Ma, Junpeng, Zheng, Wenzhao, Huang, Tao, Cheng, Kuan, Gudovskiy, Denis, Okuno, Tomoyuki, Nakata, Yohei, Keutzer, Kurt, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ODE$_t$(ODE$_l$): Shortcutting the Time and the Length in Diffusion and Flow Models for Faster Sampling
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2025)
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2025)
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
von: Jiang, Jerry, et al.
Veröffentlicht: (2026)
von: Jiang, Jerry, et al.
Veröffentlicht: (2026)
ContextFlow++: Generalist-Specialist Flow-based Generative Models with Mixed-Variable Context Encoding
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024)
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024)
DFM: Interpolant-free Dual Flow Matching
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024)
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024)
Fisher-aware Quantization for DETR Detectors with Critical-category Objectives
von: Yang, Huanrui, et al.
Veröffentlicht: (2024)
von: Yang, Huanrui, et al.
Veröffentlicht: (2024)
VeCAF: Vision-language Collaborative Active Finetuning with Training Objective Awareness
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
von: Zhang, Rongyu, et al.
Veröffentlicht: (2024)
Split-Ensemble: Efficient OOD-aware Ensemble via Task and Model Splitting
von: Chen, Anthony, et al.
Veröffentlicht: (2023)
von: Chen, Anthony, et al.
Veröffentlicht: (2023)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
von: Wang, Dongwei, et al.
Veröffentlicht: (2026)
von: Wang, Dongwei, et al.
Veröffentlicht: (2026)
SEED: Targeted Data Selection by Weighted Independent Set
von: Zhang, Yuan, et al.
Veröffentlicht: (2026)
von: Zhang, Yuan, et al.
Veröffentlicht: (2026)
Segment Any Motion in Videos
von: Huang, Nan, et al.
Veröffentlicht: (2025)
von: Huang, Nan, et al.
Veröffentlicht: (2025)
GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
von: Chen, Anthony, et al.
Veröffentlicht: (2025)
von: Chen, Anthony, et al.
Veröffentlicht: (2025)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
von: Chang, Shuning, et al.
Veröffentlicht: (2024)
von: Chang, Shuning, et al.
Veröffentlicht: (2024)
FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models
von: Zhao, Zhongyu, et al.
Veröffentlicht: (2024)
von: Zhao, Zhongyu, et al.
Veröffentlicht: (2024)
UniDrive: Towards Universal Driving Perception Across Camera Configurations
von: Li, Ye, et al.
Veröffentlicht: (2024)
von: Li, Ye, et al.
Veröffentlicht: (2024)
$\textit{S}^3$Gaussian: Self-Supervised Street Gaussians for Autonomous Driving
von: Huang, Nan, et al.
Veröffentlicht: (2024)
von: Huang, Nan, et al.
Veröffentlicht: (2024)
Instruct Large Language Models to Drive like Humans
von: Zhang, Ruijun, et al.
Veröffentlicht: (2024)
von: Zhang, Ruijun, et al.
Veröffentlicht: (2024)
AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
von: Hu, Junshan, et al.
Veröffentlicht: (2025)
von: Hu, Junshan, et al.
Veröffentlicht: (2025)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Unveiling the Tapestry of Consistency in Large Vision-Language Models
von: Zhang, Yuan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuan, et al.
Veröffentlicht: (2024)
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
von: Yang, Kichang, et al.
Veröffentlicht: (2025)
von: Yang, Kichang, et al.
Veröffentlicht: (2025)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
von: Khaki, Samir, et al.
Veröffentlicht: (2025)
von: Khaki, Samir, et al.
Veröffentlicht: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
von: He, Yefei, et al.
Veröffentlicht: (2024)
von: He, Yefei, et al.
Veröffentlicht: (2024)
Exploring $\ell_0$ Sparsification for Inference-free Sparse Retrievers
von: Shen, Xinjie, et al.
Veröffentlicht: (2025)
von: Shen, Xinjie, et al.
Veröffentlicht: (2025)
MoSA: Mixture of Sparse Adapters for Visual Efficient Tuning
von: Zhang, Qizhe, et al.
Veröffentlicht: (2023)
von: Zhang, Qizhe, et al.
Veröffentlicht: (2023)
AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference
von: Feng, Yilin, et al.
Veröffentlicht: (2026)
von: Feng, Yilin, et al.
Veröffentlicht: (2026)
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
von: Ma, Junpeng, et al.
Veröffentlicht: (2025)
von: Ma, Junpeng, et al.
Veröffentlicht: (2025)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2026)
von: Nehrdich, Sebastian, et al.
Veröffentlicht: (2026)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers
von: Schlesinger, Oded, et al.
Veröffentlicht: (2025)
von: Schlesinger, Oded, et al.
Veröffentlicht: (2025)
K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge
von: Li, Zhikai, et al.
Veröffentlicht: (2026)
von: Li, Zhikai, et al.
Veröffentlicht: (2026)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
von: Zhuang, Xianwei, et al.
Veröffentlicht: (2025)
von: Zhuang, Xianwei, et al.
Veröffentlicht: (2025)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
von: Qian, Chen, et al.
Veröffentlicht: (2026)
von: Qian, Chen, et al.
Veröffentlicht: (2026)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
von: Singh, Aditya Kumar, et al.
Veröffentlicht: (2026)
von: Singh, Aditya Kumar, et al.
Veröffentlicht: (2026)
DeSparsify: Adversarial Attack Against Token Sparsification Mechanisms in Vision Transformers
von: Yehezkel, Oryan, et al.
Veröffentlicht: (2024)
von: Yehezkel, Oryan, et al.
Veröffentlicht: (2024)
PixelGaussian: Generalizable 3D Gaussian Reconstruction from Arbitrary Views
von: Fei, Xin, et al.
Veröffentlicht: (2024)
von: Fei, Xin, et al.
Veröffentlicht: (2024)
Driv3R: Learning Dense 4D Reconstruction for Autonomous Driving
von: Fei, Xin, et al.
Veröffentlicht: (2024)
von: Fei, Xin, et al.
Veröffentlicht: (2024)
FreeKD: Knowledge Distillation via Semantic Frequency Prompt
von: Zhang, Yuan, et al.
Veröffentlicht: (2023)
von: Zhang, Yuan, et al.
Veröffentlicht: (2023)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
von: Bagrov, Natan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ODE$_t$(ODE$_l$): Shortcutting the Time and the Length in Diffusion and Flow Models for Faster Sampling
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2025) -
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
von: Jiang, Jerry, et al.
Veröffentlicht: (2026) -
ContextFlow++: Generalist-Specialist Flow-based Generative Models with Mixed-Variable Context Encoding
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024) -
DFM: Interpolant-free Dual Flow Matching
von: Gudovskiy, Denis, et al.
Veröffentlicht: (2024) -
Fisher-aware Quantization for DETR Detectors with Critical-category Objectives
von: Yang, Huanrui, et al.
Veröffentlicht: (2024)