Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Weizhi, Tian, Yu, Yang, Linjie, Wang, Heng, Yan, Xifeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
por: Wang, Weizhi, et al.
Publicado: (2024)
por: Wang, Weizhi, et al.
Publicado: (2024)
Adaptive Layer-skipping in Pre-trained LLMs
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
por: Li, Mingxin, et al.
Publicado: (2026)
por: Li, Mingxin, et al.
Publicado: (2026)
Qwen2.5-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025)
por: Bai, Shuai, et al.
Publicado: (2025)
DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models
por: Wang, Chengyu, et al.
Publicado: (2025)
por: Wang, Chengyu, et al.
Publicado: (2025)
Direct Multi-Token Decoding
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Bot or Human? Detecting ChatGPT Imposters with A Single Question
por: Wang, Hong, et al.
Publicado: (2023)
por: Wang, Hong, et al.
Publicado: (2023)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
por: Wang, Weizhi, et al.
Publicado: (2025)
por: Wang, Weizhi, et al.
Publicado: (2025)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
por: Chen, Feilong, et al.
Publicado: (2025)
por: Chen, Feilong, et al.
Publicado: (2025)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
por: Huang, Jimin, et al.
Publicado: (2024)
por: Huang, Jimin, et al.
Publicado: (2024)
OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas
por: Wang, Xiaoyang, et al.
Publicado: (2025)
por: Wang, Xiaoyang, et al.
Publicado: (2025)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
por: Du, Yuwen, et al.
Publicado: (2026)
por: Du, Yuwen, et al.
Publicado: (2026)
Qwen2.5 Technical Report
por: Qwen, et al.
Publicado: (2024)
por: Qwen, et al.
Publicado: (2024)
Qwen2 Technical Report
por: Yang, An, et al.
Publicado: (2024)
por: Yang, An, et al.
Publicado: (2024)
ImplicitAVE: An Open-Source Dataset and Multimodal LLMs Benchmark for Implicit Attribute Value Extraction
por: Zou, Henry Peng, et al.
Publicado: (2024)
por: Zou, Henry Peng, et al.
Publicado: (2024)
Qwen3 Technical Report
por: Yang, An, et al.
Publicado: (2025)
por: Yang, An, et al.
Publicado: (2025)
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
por: Shen, Weizhou, et al.
Publicado: (2025)
por: Shen, Weizhou, et al.
Publicado: (2025)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
por: Yao, Yuan, et al.
Publicado: (2026)
por: Yao, Yuan, et al.
Publicado: (2026)
Qwen3-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025)
por: Bai, Shuai, et al.
Publicado: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
por: Dai, Wenliang, et al.
Publicado: (2024)
por: Dai, Wenliang, et al.
Publicado: (2024)
AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use
por: Lyu, Yuanjie, et al.
Publicado: (2026)
por: Lyu, Yuanjie, et al.
Publicado: (2026)
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
por: Yue, Xiang, et al.
Publicado: (2024)
por: Yue, Xiang, et al.
Publicado: (2024)
Toxicity of the Commons: Curating Open-Source Pre-Training Data
por: Arnett, Catherine, et al.
Publicado: (2024)
por: Arnett, Catherine, et al.
Publicado: (2024)
$100K or 100 Days: Trade-offs when Pre-Training with Academic Resources
por: Khandelwal, Apoorv, et al.
Publicado: (2024)
por: Khandelwal, Apoorv, et al.
Publicado: (2024)
Qwen2.5-Coder Technical Report
por: Hui, Binyuan, et al.
Publicado: (2024)
por: Hui, Binyuan, et al.
Publicado: (2024)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
por: Wang, Chen, et al.
Publicado: (2025)
por: Wang, Chen, et al.
Publicado: (2025)
Qwen2.5-1M Technical Report
por: Yang, An, et al.
Publicado: (2025)
por: Yang, An, et al.
Publicado: (2025)
Qwen3Guard Technical Report
por: Zhao, Haiquan, et al.
Publicado: (2025)
por: Zhao, Haiquan, et al.
Publicado: (2025)
SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution
por: Xie, Chengxing, et al.
Publicado: (2025)
por: Xie, Chengxing, et al.
Publicado: (2025)
How to Train Your Fact Verifier: Knowledge Transfer with Multimodal Open Models
por: Lee, Jaeyoung, et al.
Publicado: (2024)
por: Lee, Jaeyoung, et al.
Publicado: (2024)
A Status Quo Investigation of Large Language Models towards Cost-Effective CFD Automation with OpenFOAMGPT: ChatGPT vs. Qwen vs. Deepseek
por: Wang, Wenkang, et al.
Publicado: (2025)
por: Wang, Wenkang, et al.
Publicado: (2025)
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
por: Zhang, Kaichen, et al.
Publicado: (2025)
por: Zhang, Kaichen, et al.
Publicado: (2025)
MiMo-VL Technical Report
por: Core Team, et al.
Publicado: (2025)
por: Core Team, et al.
Publicado: (2025)
EEG2TEXT: Open Vocabulary EEG-to-Text Decoding with EEG Pre-Training and Multi-View Transformer
por: Liu, Hanwen, et al.
Publicado: (2024)
por: Liu, Hanwen, et al.
Publicado: (2024)
Are LLMs Aware that Some Questions are not Open-ended?
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
por: Tang, Shengkun, et al.
Publicado: (2026)
por: Tang, Shengkun, et al.
Publicado: (2026)
Ejemplares similares
-
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
por: Wang, Weizhi, et al.
Publicado: (2024) -
Adaptive Layer-skipping in Pre-trained LLMs
por: Luo, Xuan, et al.
Publicado: (2025) -
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
por: Li, Mingxin, et al.
Publicado: (2026) -
Qwen2.5-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025) -
DistilQwen2.5: Industrial Practices of Training Distilled Open Lightweight Language Models
por: Wang, Chengyu, et al.
Publicado: (2025)