MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yi, Xu, Xiao, Xu, Zeyu, Zhang, Meng, Li, Yibo, Chen, Haoyu, Zhang, Junkang, Wang, Qiang, Sun, Jifa, Lin, Siling, Cheng, Shengxun, Zhang, Lingshu, Wang, Kang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
par: Xu, Zeyu, et autres
Publié: (2025)
par: Xu, Zeyu, et autres
Publié: (2025)
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
par: Zhang, Boqiang, et autres
Publié: (2026)
par: Zhang, Boqiang, et autres
Publié: (2026)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
par: Yuan, Ruifeng, et autres
Publié: (2025)
par: Yuan, Ruifeng, et autres
Publié: (2025)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
JW-VL: A Vision-Language Model for Solar Physics
par: Shao, Mingfu, et autres
Publié: (2026)
par: Shao, Mingfu, et autres
Publié: (2026)
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
par: Zhang, Letian, et autres
Publié: (2026)
par: Zhang, Letian, et autres
Publié: (2026)
Recall: Empowering Multimodal Embedding for Edge Devices
par: Cai, Dongqi, et autres
Publié: (2024)
par: Cai, Dongqi, et autres
Publié: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
DeepSeek-VL: Towards Real-World Vision-Language Understanding
par: Lu, Haoyu, et autres
Publié: (2024)
par: Lu, Haoyu, et autres
Publié: (2024)
VL-Explore: Zero-shot Vision-Language Exploration and Target Discovery by Mobile Robots
par: Zhang, Yuxuan, et autres
Publié: (2025)
par: Zhang, Yuxuan, et autres
Publié: (2025)
A Cross-Hierarchical Difference Feature Fusion Network Based on Multiscale Encoder-Decoder for Hyperspectral Change Detection
par: Sheng, Mingshuai, et autres
Publié: (2025)
par: Sheng, Mingshuai, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices
par: Yi, Rongjie, et autres
Publié: (2023)
par: Yi, Rongjie, et autres
Publié: (2023)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
par: Chen, Jiuhai, et autres
Publié: (2024)
par: Chen, Jiuhai, et autres
Publié: (2024)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
par: Yang, Bo, et autres
Publié: (2025)
par: Yang, Bo, et autres
Publié: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
Towards Lightweight Graph Neural Network Search with Curriculum Graph Sparsification
par: Xie, Beini, et autres
Publié: (2024)
par: Xie, Beini, et autres
Publié: (2024)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
par: Zhang, Jipeng, et autres
Publié: (2025)
par: Zhang, Jipeng, et autres
Publié: (2025)
ReDas: A Lightweight Architecture for Supporting Fine-Grained Reshaping and Multiple Dataflows on Systolic Array
par: Han, Meng, et autres
Publié: (2023)
par: Han, Meng, et autres
Publié: (2023)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
par: Chu, Xiangxiang, et autres
Publié: (2023)
par: Chu, Xiangxiang, et autres
Publié: (2023)
Image Recognition with Online Lightweight Vision Transformer: A Survey
par: Zhang, Zherui, et autres
Publié: (2025)
par: Zhang, Zherui, et autres
Publié: (2025)
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
MobileIE: An Extremely Lightweight and Effective ConvNet for Real-Time Image Enhancement on Mobile Devices
par: Yan, Hailong, et autres
Publié: (2025)
par: Yan, Hailong, et autres
Publié: (2025)
TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks
par: Zhao, Xuanle, et autres
Publié: (2025)
par: Zhao, Xuanle, et autres
Publié: (2025)
Transformers in Pseudo-Random Number Generation: A Dual Perspective on Theory and Practice
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving
par: Xu, Zhefan, et autres
Publié: (2026)
par: Xu, Zhefan, et autres
Publié: (2026)
A Novel ViDAR Device With Visual Inertial Encoder Odometry and Reinforcement Learning-Based Active SLAM Method
par: Xin, Zhanhua, et autres
Publié: (2025)
par: Xin, Zhanhua, et autres
Publié: (2025)
Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision
par: Wei, Zhixiang, et autres
Publié: (2026)
par: Wei, Zhixiang, et autres
Publié: (2026)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
par: Meng, Desen, et autres
Publié: (2025)
par: Meng, Desen, et autres
Publié: (2025)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
par: Yi, Jingwei, et autres
Publié: (2025)
par: Yi, Jingwei, et autres
Publié: (2025)
Explicit Semantic-Base-Empowered Communications for 6G Mobile Networks
par: Wang, Fengyu, et autres
Publié: (2024)
par: Wang, Fengyu, et autres
Publié: (2024)
Multiple Information Prompt Learning for Cloth-Changing Person Re-Identification
par: Wei, Shengxun, et autres
Publié: (2024)
par: Wei, Shengxun, et autres
Publié: (2024)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
par: Dong, Daxiang, et autres
Publié: (2025)
par: Dong, Daxiang, et autres
Publié: (2025)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
par: Lu, Dongchen, et autres
Publié: (2025)
par: Lu, Dongchen, et autres
Publié: (2025)
Code2Worlds: Empowering Coding LLMs for 4D World Generation
par: Zhang, Yi, et autres
Publié: (2026)
par: Zhang, Yi, et autres
Publié: (2026)
Re-Parameterization of Lightweight Transformer for On-Device Speech Emotion Recognition
par: Zhang, Zixing, et autres
Publié: (2024)
par: Zhang, Zixing, et autres
Publié: (2024)
Uniform large deviations and metastability of random dynamical systems
par: Jiang, Jifa, et autres
Publié: (2024)
par: Jiang, Jifa, et autres
Publié: (2024)
A-VL: Adaptive Attention for Large Vision-Language Models
par: Zhang, Junyang, et autres
Publié: (2024)
par: Zhang, Junyang, et autres
Publié: (2024)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
par: Chen, Zhe, et autres
Publié: (2023)
par: Chen, Zhe, et autres
Publié: (2023)
Documents similaires
-
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
par: Xu, Zeyu, et autres
Publié: (2025) -
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
par: Wang, Chaoyang, et autres
Publié: (2025) -
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
par: Zhang, Boqiang, et autres
Publié: (2026) -
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
par: Yuan, Ruifeng, et autres
Publié: (2025) -
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)