PEVLM: Parallel Encoding for Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kang, Letian, Luo, Shixian, Li, Yiqiang, Yin, Yuxin, Zhou, Shenxuan, Yu, Xiaoyang, Yang, Jin, Wu, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
by: Cheng, Hao, et al.
Published: (2024)
by: Cheng, Hao, et al.
Published: (2024)
PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
by: Fang, Jiarui, et al.
Published: (2024)
by: Fang, Jiarui, et al.
Published: (2024)
Enhancing Traffic Sign Recognition On The Performance Based On Yolov8
by: Ibrahim, Baba, et al.
Published: (2025)
by: Ibrahim, Baba, et al.
Published: (2025)
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
by: Yang, Kichang, et al.
Published: (2025)
by: Yang, Kichang, et al.
Published: (2025)
Performance is not All You Need: Sustainability Considerations for Algorithms
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
How Cars Move: Analyzing Driving Dynamics for Safer Urban Traffic
by: Qian, Kangan, et al.
Published: (2024)
by: Qian, Kangan, et al.
Published: (2024)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
by: Sai, Vishnu, et al.
Published: (2026)
by: Sai, Vishnu, et al.
Published: (2026)
A Study on Inference Latency for Vision Transformers on Mobile Devices
by: Li, Zhuojin, et al.
Published: (2025)
by: Li, Zhuojin, et al.
Published: (2025)
A Methodology to Evaluate Strategies Predicting Rankings on Unseen Domains
by: Piérard, Sébastien, et al.
Published: (2025)
by: Piérard, Sébastien, et al.
Published: (2025)
TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization
by: Zhong, Chonghao, et al.
Published: (2026)
by: Zhong, Chonghao, et al.
Published: (2026)
A Diffusion-Based Framework for Configurable and Realistic Multi-Storage Trace Generation
by: Kim, Seohyun, et al.
Published: (2025)
by: Kim, Seohyun, et al.
Published: (2025)
Polymorph: Energy-Efficient Multi-Label Classification for Video Streams on Embedded Devices
by: Ghafouri, Saeid, et al.
Published: (2025)
by: Ghafouri, Saeid, et al.
Published: (2025)
Resource-Efficient RGB-Only Action Recognition for Edge Deployment
by: Yoon, Dongsik, et al.
Published: (2026)
by: Yoon, Dongsik, et al.
Published: (2026)
Towards Efficient Multi-Scale Deformable Attention on NPU
by: Huang, Chenghuan, et al.
Published: (2025)
by: Huang, Chenghuan, et al.
Published: (2025)
CPU Optimization of a Monocular 3D Biomechanics Pipeline for Low-Resource Deployment
by: Zhang, Yan, et al.
Published: (2026)
by: Zhang, Yan, et al.
Published: (2026)
TakuNet: an Energy-Efficient CNN for Real-Time Inference on Embedded UAV systems in Emergency Response Scenarios
by: Rossi, Daniel, et al.
Published: (2025)
by: Rossi, Daniel, et al.
Published: (2025)
ConvBench: A Comprehensive Benchmark for 2D Convolution Primitive Evaluation
by: Alvarenga, Lucas, et al.
Published: (2024)
by: Alvarenga, Lucas, et al.
Published: (2024)
ProfilingAgent: Profiling-Guided Agentic Reasoning for Adaptive Model Optimization
by: Jafari, Sadegh, et al.
Published: (2025)
by: Jafari, Sadegh, et al.
Published: (2025)
DISTWAR: Fast Differentiable Rendering on Raster-based Rendering Pipelines
by: Durvasula, Sankeerth, et al.
Published: (2023)
by: Durvasula, Sankeerth, et al.
Published: (2023)
Model Quantization and Hardware Acceleration for Vision Transformers: A Comprehensive Survey
by: Du, Dayou, et al.
Published: (2024)
by: Du, Dayou, et al.
Published: (2024)
Revisiting 16-bit Neural Network Training: A Practical Approach for Resource-Limited Learning
by: Yun, Juyoung, et al.
Published: (2023)
by: Yun, Juyoung, et al.
Published: (2023)
A Hitchhiker's Guide to Understanding Performances of Two-Class Classifiers
by: Halin, Anaïs, et al.
Published: (2024)
by: Halin, Anaïs, et al.
Published: (2024)
Using MLIR Transform to Design Sliced Convolution Algorithm
by: Ferrari, Victor, et al.
Published: (2025)
by: Ferrari, Victor, et al.
Published: (2025)
Foundations of the Theory of Performance-Based Ranking
by: Piérard, Sébastien, et al.
Published: (2024)
by: Piérard, Sébastien, et al.
Published: (2024)
The Tile: A 2D Map of Ranking Scores for Two-Class Classification
by: Piérard, Sébastien, et al.
Published: (2024)
by: Piérard, Sébastien, et al.
Published: (2024)
CRAM: Large-scale Video Continual Learning with Bootstrapped Compression
by: Mall, Shivani, et al.
Published: (2025)
by: Mall, Shivani, et al.
Published: (2025)
Optimizing Methane Detection On Board Satellites: Speed, Accuracy, and Low-Power Solutions for Resource-Constrained Hardware
by: Herec, Jonáš, et al.
Published: (2025)
by: Herec, Jonáš, et al.
Published: (2025)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
by: Tu, Dezhan, et al.
Published: (2024)
by: Tu, Dezhan, et al.
Published: (2024)
Conflict Adaptation in Vision-Language Models
by: Hu, Xiaoyang
Published: (2025)
by: Hu, Xiaoyang
Published: (2025)
Cost-Effective Model Evaluation with Meta-Learning
by: Pham, Trinh, et al.
Published: (2026)
by: Pham, Trinh, et al.
Published: (2026)
Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
by: Xu, Wei
Published: (2026)
by: Xu, Wei
Published: (2026)
SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device
by: Wu, Yushu, et al.
Published: (2024)
by: Wu, Yushu, et al.
Published: (2024)
FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
by: Liu, Dong, et al.
Published: (2025)
by: Liu, Dong, et al.
Published: (2025)
Neural Architecture Search of Hybrid Models for NPU-CIM Heterogeneous AR/VR Devices
by: Zhao, Yiwei, et al.
Published: (2024)
by: Zhao, Yiwei, et al.
Published: (2024)
SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
by: Zhang, Jintao, et al.
Published: (2025)
by: Zhang, Jintao, et al.
Published: (2025)
Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU
by: Ning, Zhenyu, et al.
Published: (2024)
by: Ning, Zhenyu, et al.
Published: (2024)
M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision
by: Zhou, Kailai, et al.
Published: (2025)
by: Zhou, Kailai, et al.
Published: (2025)
Efficient Brain Imaging Analysis for Alzheimer's and Dementia Detection Using Convolution-Derivative Operations
by: Mustafa, Yasmine, et al.
Published: (2024)
by: Mustafa, Yasmine, et al.
Published: (2024)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
by: Guo, Xiaoyang, et al.
Published: (2025)
by: Guo, Xiaoyang, et al.
Published: (2025)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
by: Deng, Huilin, et al.
Published: (2025)
by: Deng, Huilin, et al.
Published: (2025)
Similar Items
-
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
by: Cheng, Hao, et al.
Published: (2024) -
PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
by: Fang, Jiarui, et al.
Published: (2024) -
Enhancing Traffic Sign Recognition On The Performance Based On Yolov8
by: Ibrahim, Baba, et al.
Published: (2025) -
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
by: Yang, Kichang, et al.
Published: (2025) -
Performance is not All You Need: Sustainability Considerations for Algorithms
by: Li, Xiang, et al.
Published: (2025)