VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Kichang, Kim, Seonjun, Kim, Minjae, Zhang, Nairan, Zhang, Chi, Lee, Youngki |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mondrian: On-Device High-Performance Video Analytics with Compressive Packed Inference
by: Jeon, Changmin, et al.
Published: (2024)
by: Jeon, Changmin, et al.
Published: (2024)
Resource-Efficient RGB-Only Action Recognition for Edge Deployment
by: Yoon, Dongsik, et al.
Published: (2026)
by: Yoon, Dongsik, et al.
Published: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
by: Zhang, Yuan, et al.
Published: (2024)
by: Zhang, Yuan, et al.
Published: (2024)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
by: Cheng, Hao, et al.
Published: (2024)
by: Cheng, Hao, et al.
Published: (2024)
A Diffusion-Based Framework for Configurable and Realistic Multi-Storage Trace Generation
by: Kim, Seohyun, et al.
Published: (2025)
by: Kim, Seohyun, et al.
Published: (2025)
EO-VLM: VLM-Guided Energy Overload Attacks on Vision Models
by: Seo, Minjae, et al.
Published: (2025)
by: Seo, Minjae, et al.
Published: (2025)
PEVLM: Parallel Encoding for Vision-Language Models
by: Kang, Letian, et al.
Published: (2025)
by: Kang, Letian, et al.
Published: (2025)
Towards Efficient Multi-Scale Deformable Attention on NPU
by: Huang, Chenghuan, et al.
Published: (2025)
by: Huang, Chenghuan, et al.
Published: (2025)
CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment
by: Zhang, Yan, et al.
Published: (2026)
by: Zhang, Yan, et al.
Published: (2026)
Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded Devices
by: Ghafouri, Saeid, et al.
Published: (2025)
by: Ghafouri, Saeid, et al.
Published: (2025)
TakuNet: an Energy-Efficient CNN for Real-Time Inference on Embedded UAV systems in Emergency Response Scenarios
by: Rossi, Daniel, et al.
Published: (2025)
by: Rossi, Daniel, et al.
Published: (2025)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
by: Sai, Vishnu, et al.
Published: (2026)
by: Sai, Vishnu, et al.
Published: (2026)
Performance is not All You Need: Sustainability Considerations for Algorithms
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization
by: Zhong, Chonghao, et al.
Published: (2026)
by: Zhong, Chonghao, et al.
Published: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
by: Li, Zhuojin, et al.
Published: (2025)
by: Li, Zhuojin, et al.
Published: (2025)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
by: Qian, Chen, et al.
Published: (2026)
by: Qian, Chen, et al.
Published: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
by: He, Yefei, et al.
Published: (2024)
by: He, Yefei, et al.
Published: (2024)
VLM-PL: Advanced Pseudo Labeling Approach for Class Incremental Object Detection via Vision-Language Model
by: Kim, Junsu, et al.
Published: (2024)
by: Kim, Junsu, et al.
Published: (2024)
A Methodology to Evaluate Strategies Predicting Rankings on Unseen Domains
by: Piérard, Sébastien, et al.
Published: (2025)
by: Piérard, Sébastien, et al.
Published: (2025)
Enhancing Traffic Sign Recognition On The Performance Based On Yolov8
by: Ibrahim, Baba, et al.
Published: (2025)
by: Ibrahim, Baba, et al.
Published: (2025)
ConvBench: A Comprehensive Benchmark for 2D Convolution Primitive Evaluation
by: Alvarenga, Lucas, et al.
Published: (2024)
by: Alvarenga, Lucas, et al.
Published: (2024)
How Cars Move: Analyzing Driving Dynamics for Safer Urban Traffic
by: Qian, Kangan, et al.
Published: (2024)
by: Qian, Kangan, et al.
Published: (2024)
QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference
by: Zhang, Miao, et al.
Published: (2026)
by: Zhang, Miao, et al.
Published: (2026)
ProfilingAgent: Profiling-Guided Agentic Reasoning for Adaptive Model Optimization
by: Jafari, Sadegh, et al.
Published: (2025)
by: Jafari, Sadegh, et al.
Published: (2025)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
by: Du, Dayou, et al.
Published: (2024)
by: Du, Dayou, et al.
Published: (2024)
DISTWAR: Fast Differentiable Rendering on Raster-based Rendering Pipelines
by: Durvasula, Sankeerth, et al.
Published: (2023)
by: Durvasula, Sankeerth, et al.
Published: (2023)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
by: Zhang, Jintao, et al.
Published: (2025)
by: Zhang, Jintao, et al.
Published: (2025)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
by: Ko, Dohwan, et al.
Published: (2025)
by: Ko, Dohwan, et al.
Published: (2025)
AutoChunk: Automated Activation Chunk for Memory-Efficient Long Sequence Inference
by: Zhao, Xuanlei, et al.
Published: (2024)
by: Zhao, Xuanlei, et al.
Published: (2024)
Evaluation of Resource-Efficient Crater Detectors on Embedded Systems
by: Vellas, Simon, et al.
Published: (2024)
by: Vellas, Simon, et al.
Published: (2024)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
by: Tu, Dezhan, et al.
Published: (2024)
by: Tu, Dezhan, et al.
Published: (2024)
U-VLM: Hierarchical Vision Language Modeling for Report Generation
by: Shi, Pengcheng, et al.
Published: (2026)
by: Shi, Pengcheng, et al.
Published: (2026)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
by: Sarowar, Md Selim, et al.
Published: (2025)
by: Sarowar, Md Selim, et al.
Published: (2025)
Fast-SEnSeI: Lightweight Sensor-Independent Cloud Masking for On-board Multispectral Sensors
by: Kněžík, Jan, et al.
Published: (2025)
by: Kněžík, Jan, et al.
Published: (2025)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
by: Kang, Donggoo, et al.
Published: (2024)
by: Kang, Donggoo, et al.
Published: (2024)
Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU
by: Ning, Zhenyu, et al.
Published: (2024)
by: Ning, Zhenyu, et al.
Published: (2024)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
by: Kang, Shuhao, et al.
Published: (2026)
by: Kang, Shuhao, et al.
Published: (2026)
SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization
by: Zhang, Jintao, et al.
Published: (2024)
by: Zhang, Jintao, et al.
Published: (2024)
Neural Architecture Search of Hybrid Models for NPU-CIM Heterogeneous AR/VR Devices
by: Zhao, Yiwei, et al.
Published: (2024)
by: Zhao, Yiwei, et al.
Published: (2024)
Similar Items
-
Mondrian: On-Device High-Performance Video Analytics with Compressive Packed Inference
by: Jeon, Changmin, et al.
Published: (2024) -
Resource-Efficient RGB-Only Action Recognition for Edge Deployment
by: Yoon, Dongsik, et al.
Published: (2026) -
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
by: Zhang, Yuan, et al.
Published: (2024) -
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
by: Cheng, Hao, et al.
Published: (2024) -
A Diffusion-Based Framework for Configurable and Realistic Multi-Storage Trace Generation
by: Kim, Seohyun, et al.
Published: (2025)