Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Zhangwei, Chen, Zhe, Cui, Erfei, Ren, Yiming, Wang, Weiyun, Zhu, Jinguo, Tian, Hao, Ye, Shenglong, He, Junjun, Zhu, Xizhou, Lu, Lewei, Lu, Tong, Qiao, Yu, Dai, Jifeng, Wang, Wenhai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023)
por: Chen, Zhe, et al.
Publicado: (2023)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
por: Zhu, Jinguo, et al.
Publicado: (2025)
por: Zhu, Jinguo, et al.
Publicado: (2025)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
por: Lu, Dongchen, et al.
Publicado: (2025)
por: Lu, Dongchen, et al.
Publicado: (2025)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
por: Liu, Yangzhou, et al.
Publicado: (2024)
por: Liu, Yangzhou, et al.
Publicado: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
por: Duan, Yuchen, et al.
Publicado: (2024)
por: Duan, Yuchen, et al.
Publicado: (2024)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
por: Tian, Changyao, et al.
Publicado: (2026)
por: Tian, Changyao, et al.
Publicado: (2026)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
Driving with InternVL: Oustanding Champion in the Track on Driving with Language of the Autonomous Grand Challenge at CVPR 2024
por: Li, Jiahan, et al.
Publicado: (2024)
por: Li, Jiahan, et al.
Publicado: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
por: Cui, Erfei, et al.
Publicado: (2023)
por: Cui, Erfei, et al.
Publicado: (2023)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
Demystify Transformers & Convolutions in Modern Image Deep Networks
por: Hu, Xiaowei, et al.
Publicado: (2022)
por: Hu, Xiaowei, et al.
Publicado: (2022)
Parameter-Inverted Image Pyramid Networks
por: Zhu, Xizhou, et al.
Publicado: (2024)
por: Zhu, Xizhou, et al.
Publicado: (2024)
Docopilot: Improving Multimodal Models for Document-Level Understanding
por: Duan, Yuchen, et al.
Publicado: (2025)
por: Duan, Yuchen, et al.
Publicado: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
por: Tao, Chenxin, et al.
Publicado: (2024)
por: Tao, Chenxin, et al.
Publicado: (2024)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
CoMemo: LVLMs Need Image Context with Image Memory
por: Liu, Shi, et al.
Publicado: (2025)
por: Liu, Shi, et al.
Publicado: (2025)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
por: Tian, Changyao, et al.
Publicado: (2025)
por: Tian, Changyao, et al.
Publicado: (2025)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)
por: Wu, Jiannan, et al.
Publicado: (2024)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
por: Wang, Zhaokai, et al.
Publicado: (2025)
por: Wang, Zhaokai, et al.
Publicado: (2025)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
por: Xiong, Yuwen, et al.
Publicado: (2024)
por: Xiong, Yuwen, et al.
Publicado: (2024)
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
por: Wang, Haomin, et al.
Publicado: (2025)
por: Wang, Haomin, et al.
Publicado: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
por: Ge, Junqi, et al.
Publicado: (2024)
por: Ge, Junqi, et al.
Publicado: (2024)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
por: Chen, Zhe, et al.
Publicado: (2024)
por: Chen, Zhe, et al.
Publicado: (2024)
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
por: Chen, Zhe, et al.
Publicado: (2024)
por: Chen, Zhe, et al.
Publicado: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
por: Yang, Chenyu, et al.
Publicado: (2025)
por: Yang, Chenyu, et al.
Publicado: (2025)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
por: Li, Qingyun, et al.
Publicado: (2024)
por: Li, Qingyun, et al.
Publicado: (2024)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
por: Lei, Zhenxin, et al.
Publicado: (2025)
por: Lei, Zhenxin, et al.
Publicado: (2025)
ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process
por: Tian, Changyao, et al.
Publicado: (2023)
por: Tian, Changyao, et al.
Publicado: (2023)
Ejemplares similares
-
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023) -
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2025) -
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
por: Zhu, Jinguo, et al.
Publicado: (2025) -
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
por: Wang, Weiyun, et al.
Publicado: (2024) -
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
por: Luo, Gen, et al.
Publicado: (2024)