Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zhe, Wang, Weiyun, Cao, Yue, Liu, Yangzhou, Gao, Zhangwei, Cui, Erfei, Zhu, Jinguo, Ye, Shenglong, Tian, Hao, Liu, Zhaoyang, Gu, Lixin, Wang, Xuehui, Li, Qingyun, Ren, Yiming, Chen, Zixuan, Luo, Jiapeng, Wang, Jiahao, Jiang, Tan, Wang, Bo, He, Conghui, Shi, Botian, Zhang, Xingcheng, Lv, Han, Wang, Yi, Shao, Wenqi, Chu, Pei, Tu, Zhongying, He, Tong, Wu, Zhiyong, Deng, Huipeng, Ge, Jiaye, Chen, Kai, Zhang, Kaipeng, Wang, Limin, Dou, Min, Lu, Lewei, Zhu, Xizhou, Lu, Tong, Lin, Dahua, Qiao, Yu, Dai, Jifeng, Wang, Wenhai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
par: Gao, Zhangwei, et autres
Publié: (2024)
par: Gao, Zhangwei, et autres
Publié: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024)
par: Liu, Yangzhou, et autres
Publié: (2024)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)
par: Duan, Yuchen, et autres
Publié: (2024)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
par: Zhu, Jinguo, et autres
Publié: (2025)
par: Zhu, Jinguo, et autres
Publié: (2025)
Docopilot: Improving Multimodal Models for Document-Level Understanding
par: Duan, Yuchen, et autres
Publié: (2025)
par: Duan, Yuchen, et autres
Publié: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
par: Chen, Zhe, et autres
Publié: (2024)
par: Chen, Zhe, et autres
Publié: (2024)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
par: Li, Qingyun, et autres
Publié: (2024)
par: Li, Qingyun, et autres
Publié: (2024)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
par: Xiong, Yuwen, et autres
Publié: (2024)
par: Xiong, Yuwen, et autres
Publié: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
par: Cui, Erfei, et autres
Publié: (2023)
par: Cui, Erfei, et autres
Publié: (2023)
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
par: Luo, Gen, et autres
Publié: (2025)
par: Luo, Gen, et autres
Publié: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
par: Hu, Xiaowei, et autres
Publié: (2022)
par: Hu, Xiaowei, et autres
Publié: (2022)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
par: Cao, Yue, et autres
Publié: (2024)
par: Cao, Yue, et autres
Publié: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Needle In A Multimodal Haystack
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
par: Lei, Zhenxin, et autres
Publié: (2025)
par: Lei, Zhenxin, et autres
Publié: (2025)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
par: Tian, Changyao, et autres
Publié: (2025)
par: Tian, Changyao, et autres
Publié: (2025)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
par: Chen, Zhe, et autres
Publié: (2023)
par: Chen, Zhe, et autres
Publié: (2023)
CoMemo: LVLMs Need Image Context with Image Memory
par: Liu, Shi, et autres
Publié: (2025)
par: Liu, Shi, et autres
Publié: (2025)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
par: Yang, Chenyu, et autres
Publié: (2025)
par: Yang, Chenyu, et autres
Publié: (2025)
Vanadium Oxide Clusters Mediated Bismuth‐Tin Alloy for Accelerated Dynamics of Electrocatalytic CO2 Conversion
par: Jiaye Zhu, et autres
Publié: (2024)
par: Jiaye Zhu, et autres
Publié: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2025)
par: Luo, Gen, et autres
Publié: (2025)
Sequential Diffusion Language Models
par: Liu, Yangzhou, et autres
Publié: (2025)
par: Liu, Yangzhou, et autres
Publié: (2025)
LLM-Align: Utilizing Large Language Models for Entity Alignment in Knowledge Graphs
par: Chen, Xuan, et autres
Publié: (2024)
par: Chen, Xuan, et autres
Publié: (2024)
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding
par: Lu, Hao, et autres
Publié: (2025)
par: Lu, Hao, et autres
Publié: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
The Fréchet correlation coefficient for heterogeneous random objects
par: He, Shuaida, et autres
Publié: (2026)
par: He, Shuaida, et autres
Publié: (2026)
Large-Scale Asset Selection via Metric Dependence with Enriched High Frequency Information
par: Chen, Yangzhou, et autres
Publié: (2026)
par: Chen, Yangzhou, et autres
Publié: (2026)
Utilize the Flow before Stepping into the Same River Twice: Certainty Represented Knowledge Flow for Refusal-Aware Instruction Tuning
par: Zhu, Runchuan, et autres
Publié: (2024)
par: Zhu, Runchuan, et autres
Publié: (2024)
Documents similaires
-
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
par: Gao, Zhangwei, et autres
Publié: (2024) -
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024) -
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024) -
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025) -
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)