MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Chu, Xiangxiang, Qiao, Limeng, Zhang, Xinyu, Xu, Shuang, Wei, Fei, Yang, Yang, Sun, Xiaofei, Hu, Yiming, Lin, Xinyang, Zhang, Bo, Shen, Chunhua |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
by: Chu, Xiangxiang, et al.
Published: (2023)
by: Chu, Xiangxiang, et al.
Published: (2023)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
by: Wu, Qinzhuo, et al.
Published: (2024)
by: Wu, Qinzhuo, et al.
Published: (2024)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
by: Chu, Xiangxiang, et al.
Published: (2024)
by: Chu, Xiangxiang, et al.
Published: (2024)
PLUG: Revisiting Amodal Segmentation with Foundation Model and Hierarchical Focus
by: Liu, Zhaochen, et al.
Published: (2024)
by: Liu, Zhaochen, et al.
Published: (2024)
Point Transformer V3: Simpler, Faster, Stronger
by: Wu, Xiaoyang, et al.
Published: (2023)
by: Wu, Xiaoyang, et al.
Published: (2023)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
by: Xu, Wanting, et al.
Published: (2024)
by: Xu, Wanting, et al.
Published: (2024)
GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning
by: Chu, Xiangxiang, et al.
Published: (2025)
by: Chu, Xiangxiang, et al.
Published: (2025)
AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models
by: Tian, Beitong, et al.
Published: (2025)
by: Tian, Beitong, et al.
Published: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
by: Li, YuQian, et al.
Published: (2025)
by: Li, YuQian, et al.
Published: (2025)
Robust MAE-Driven NAS: From Mask Reconstruction to Architecture Innovation
by: Hu, Yiming, et al.
Published: (2023)
by: Hu, Yiming, et al.
Published: (2023)
UniViTAR: Unified Vision Transformer with Native Resolution
by: Qiao, Limeng, et al.
Published: (2025)
by: Qiao, Limeng, et al.
Published: (2025)
Stronger Random Baselines for In-Context Learning
by: Yauney, Gregory, et al.
Published: (2024)
by: Yauney, Gregory, et al.
Published: (2024)
AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model
by: Chen, Xiang
Published: (2026)
by: Chen, Xiang
Published: (2026)
M-RAG: Making RAG Faster, Stronger, and More Efficient
by: Xu, Sun, et al.
Published: (2026)
by: Xu, Sun, et al.
Published: (2026)
FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs
by: Wan, Yingjia, et al.
Published: (2025)
by: Wan, Yingjia, et al.
Published: (2025)
REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation
by: Xue, Xizhe, et al.
Published: (2024)
by: Xue, Xizhe, et al.
Published: (2024)
Stronger Baselines for Retrieval-Augmented Generation with Long-Context Language Models
by: Laitenberger, Alex, et al.
Published: (2025)
by: Laitenberger, Alex, et al.
Published: (2025)
RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
by: Liao, Dacheng, et al.
Published: (2025)
by: Liao, Dacheng, et al.
Published: (2025)
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
by: Zhuo, Le, et al.
Published: (2024)
by: Zhuo, Le, et al.
Published: (2024)
Finding 4-Additive Spanners: Faster, Stronger, and Simpler
by: Qi, Chuhan
Published: (2025)
by: Qi, Chuhan
Published: (2025)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
by: Liu, Yuanqing, et al.
Published: (2026)
by: Liu, Yuanqing, et al.
Published: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
by: Zhang, Jianke, et al.
Published: (2026)
by: Zhang, Jianke, et al.
Published: (2026)
Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance
by: Lin, Liting, et al.
Published: (2024)
by: Lin, Liting, et al.
Published: (2024)
Faster and Stronger: When ANN-SNN Conversion Meets Parallel Spiking Calculation
by: Hao, Zecheng, et al.
Published: (2024)
by: Hao, Zecheng, et al.
Published: (2024)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
RGM: A Robust Generalizable Matching Model
by: Zhang, Songyan, et al.
Published: (2023)
by: Zhang, Songyan, et al.
Published: (2023)
Blar-SQL: Faster, Stronger, Smaller NL2SQL
by: Domínguez, José Manuel, et al.
Published: (2024)
by: Domínguez, José Manuel, et al.
Published: (2024)
Dyn-Adapter: Towards Disentangled Representation for Efficient Visual Recognition
by: Zhang, Yurong, et al.
Published: (2024)
by: Zhang, Yurong, et al.
Published: (2024)
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
by: Wang, Ziteng, et al.
Published: (2025)
by: Wang, Ziteng, et al.
Published: (2025)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
by: Huang, Ting, et al.
Published: (2025)
by: Huang, Ting, et al.
Published: (2025)
SGMAGNet: A Baseline Model for 3D Cloud Phase Structure Reconstruction on a New Passive Active Satellite Benchmark
by: Yang, Chi, et al.
Published: (2025)
by: Yang, Chi, et al.
Published: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
by: Yang, Hongji, et al.
Published: (2026)
by: Yang, Hongji, et al.
Published: (2026)
AdaFedFR: Federated Face Recognition with Adaptive Inter-Class Representation Learning
by: Qiu, Di, et al.
Published: (2024)
by: Qiu, Di, et al.
Published: (2024)
VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
by: Su, Yuetong, et al.
Published: (2025)
by: Su, Yuetong, et al.
Published: (2025)
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
by: Yang, Kichang, et al.
Published: (2025)
by: Yang, Kichang, et al.
Published: (2025)
U-VLM: Hierarchical Vision Language Modeling for Report Generation
by: Shi, Pengcheng, et al.
Published: (2026)
by: Shi, Pengcheng, et al.
Published: (2026)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
by: Ding, Kun, et al.
Published: (2024)
by: Ding, Kun, et al.
Published: (2024)
Transversal tilings in k-partite graphs without large holes
by: He, Xinyu, et al.
Published: (2026)
by: He, Xinyu, et al.
Published: (2026)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
by: Li, Yuliang, et al.
Published: (2026)
by: Li, Yuliang, et al.
Published: (2026)
Similar Items
-
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
by: Chu, Xiangxiang, et al.
Published: (2023) -
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
by: Wu, Qinzhuo, et al.
Published: (2024) -
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
by: Chu, Xiangxiang, et al.
Published: (2024) -
PLUG: Revisiting Amodal Segmentation with Foundation Model and Hierarchical Focus
by: Liu, Zhaochen, et al.
Published: (2024) -
Point Transformer V3: Simpler, Faster, Stronger
by: Wu, Xiaoyang, et al.
Published: (2023)