OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Wei, Li, Zhiyuan, Xin, Shuo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)
par: Qian, Chen, et autres
Publié: (2026)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025)
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
par: Tan, Xudong, et autres
Publié: (2025)
par: Tan, Xudong, et autres
Publié: (2025)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
CS-VLM: Compressed Sensing Attention for Efficient Vision-Language Representation Learning
par: Kiruluta, Andrew, et autres
Publié: (2025)
par: Kiruluta, Andrew, et autres
Publié: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025)
par: Li, Juncheng, et autres
Publié: (2025)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
par: Cui, Cheng, et autres
Publié: (2026)
par: Cui, Cheng, et autres
Publié: (2026)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
par: Chu, Xiangxiang, et autres
Publié: (2023)
par: Chu, Xiangxiang, et autres
Publié: (2023)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
par: Zhang, Haokui, et autres
Publié: (2026)
par: Zhang, Haokui, et autres
Publié: (2026)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
par: Bagrov, Natan, et autres
Publié: (2025)
par: Bagrov, Natan, et autres
Publié: (2025)
LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
par: Hu, Lianyu, et autres
Publié: (2025)
par: Hu, Lianyu, et autres
Publié: (2025)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
par: Singh, Aditya Kumar, et autres
Publié: (2026)
par: Singh, Aditya Kumar, et autres
Publié: (2026)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
par: Cao, Sihan, et autres
Publié: (2026)
par: Cao, Sihan, et autres
Publié: (2026)
Scaling Learned Image Compression Models up to 1 Billion
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
par: Hu, Junshan, et autres
Publié: (2025)
par: Hu, Junshan, et autres
Publié: (2025)
GigaTok: Scaling Visual Tokenizers to 3 Billion Parameters for Autoregressive Image Generation
par: Xiong, Tianwei, et autres
Publié: (2025)
par: Xiong, Tianwei, et autres
Publié: (2025)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
par: Shi, Liang, et autres
Publié: (2026)
par: Shi, Liang, et autres
Publié: (2026)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm
par: Wu, Zhenkai, et autres
Publié: (2025)
par: Wu, Zhenkai, et autres
Publié: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models
par: Lu, Hongyu, et autres
Publié: (2026)
par: Lu, Hongyu, et autres
Publié: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
par: Liu, Yuanqing, et autres
Publié: (2026)
par: Liu, Yuanqing, et autres
Publié: (2026)
Scaling Diffusion Transformers to 16 Billion Parameters
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
par: Huang, Mingzhe, et autres
Publié: (2026)
par: Huang, Mingzhe, et autres
Publié: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
par: Shao, Kele, et autres
Publié: (2025)
par: Shao, Kele, et autres
Publié: (2025)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
par: Wang, Mengyue, et autres
Publié: (2025)
par: Wang, Mengyue, et autres
Publié: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
par: She, Chaoyin, et autres
Publié: (2025)
par: She, Chaoyin, et autres
Publié: (2025)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
par: Shao, Rui, et autres
Publié: (2025)
par: Shao, Rui, et autres
Publié: (2025)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
par: Tanvir, Md Tasnin, et autres
Publié: (2025)
par: Tanvir, Md Tasnin, et autres
Publié: (2025)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
par: Liu, Jizhihui, et autres
Publié: (2025)
par: Liu, Jizhihui, et autres
Publié: (2025)
FastVLM: Efficient Vision Encoding for Vision Language Models
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2024)
Documents similaires
-
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024) -
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026) -
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
par: Zhang, Jusheng, et autres
Publié: (2025) -
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
par: Ranjbar, Sepehr Kazemi, et autres
Publié: (2025)