Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Peng, Bai, Shuai, Tan, Sinan, Wang, Shijie, Fan, Zhihao, Bai, Jinze, Chen, Keqin, Liu, Xuejing, Wang, Jialin, Ge, Wenbin, Fan, Yang, Dang, Kai, Du, Mengfei, Ren, Xuancheng, Men, Rui, Liu, Dayiheng, Zhou, Chang, Zhou, Jingren, Lin, Junyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
di: Li, Mingxin, et al.
Pubblicazione: (2026)
di: Li, Mingxin, et al.
Pubblicazione: (2026)
Qwen2.5-VL Technical Report
di: Bai, Shuai, et al.
Pubblicazione: (2025)
di: Bai, Shuai, et al.
Pubblicazione: (2025)
Qwen3-VL Technical Report
di: Bai, Shuai, et al.
Pubblicazione: (2025)
di: Bai, Shuai, et al.
Pubblicazione: (2025)
Qwen2 Technical Report
di: Yang, An, et al.
Pubblicazione: (2024)
di: Yang, An, et al.
Pubblicazione: (2024)
Qwen2.5-Omni Technical Report
di: Xu, Jin, et al.
Pubblicazione: (2025)
di: Xu, Jin, et al.
Pubblicazione: (2025)
Qwen2.5-Coder Technical Report
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
Qwen3-Omni Technical Report
di: Xu, Jin, et al.
Pubblicazione: (2025)
di: Xu, Jin, et al.
Pubblicazione: (2025)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
di: Yao, Yuan, et al.
Pubblicazione: (2026)
di: Yao, Yuan, et al.
Pubblicazione: (2026)
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
di: Zhang, Yanzhao, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhao, et al.
Pubblicazione: (2025)
Qwen3 Technical Report
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
Qwen2.5 Technical Report
di: Qwen, et al.
Pubblicazione: (2024)
di: Qwen, et al.
Pubblicazione: (2024)
Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
di: Deng, Boyi, et al.
Pubblicazione: (2026)
di: Deng, Boyi, et al.
Pubblicazione: (2026)
Demons in the Detail: On Implementing Load Balancing Loss for Training Specialized Mixture-of-Expert Models
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
Qwen3-ASR Technical Report
di: Shi, Xian, et al.
Pubblicazione: (2026)
di: Shi, Xian, et al.
Pubblicazione: (2026)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
di: Tang, Shengkun, et al.
Pubblicazione: (2026)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Qwen-Image Technical Report
di: Wu, Chenfei, et al.
Pubblicazione: (2025)
di: Wu, Chenfei, et al.
Pubblicazione: (2025)
Qwen2-Audio Technical Report
di: Chu, Yunfei, et al.
Pubblicazione: (2024)
di: Chu, Yunfei, et al.
Pubblicazione: (2024)
Qwen2.5-1M Technical Report
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
di: Wang, Qiuyue, et al.
Pubblicazione: (2026)
di: Wang, Qiuyue, et al.
Pubblicazione: (2026)
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
di: Yang, An, et al.
Pubblicazione: (2024)
di: Yang, An, et al.
Pubblicazione: (2024)
Qwen3-TTS Technical Report
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
Qwen-Image-2.0 Technical Report
di: Zhao, Bing, et al.
Pubblicazione: (2026)
di: Zhao, Bing, et al.
Pubblicazione: (2026)
Soft Adaptive Policy Optimization
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2026)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
Qwen3Guard Technical Report
di: Zhao, Haiquan, et al.
Pubblicazione: (2025)
di: Zhao, Haiquan, et al.
Pubblicazione: (2025)
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
di: Shen, Weizhou, et al.
Pubblicazione: (2025)
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
di: Zhang, Zhenru, et al.
Pubblicazione: (2025)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
di: Wang, Bowen, et al.
Pubblicazione: (2026)
di: Wang, Bowen, et al.
Pubblicazione: (2026)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
AnimateAnyMesh++: A Flexible 4D Foundation Model for High-Fidelity Text-Driven Mesh Animation
di: Wu, Zijie, et al.
Pubblicazione: (2026)
di: Wu, Zijie, et al.
Pubblicazione: (2026)
AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
di: Wu, Zijie, et al.
Pubblicazione: (2025)
di: Wu, Zijie, et al.
Pubblicazione: (2025)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
di: Zeng, Lunbin, et al.
Pubblicazione: (2025)
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
di: Yin, Shengming, et al.
Pubblicazione: (2025)
di: Yin, Shengming, et al.
Pubblicazione: (2025)
Language Models can Self-Lengthen to Generate Long Texts
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
di: Li, Mingxin, et al.
Pubblicazione: (2026) -
Qwen2.5-VL Technical Report
di: Bai, Shuai, et al.
Pubblicazione: (2025) -
Qwen3-VL Technical Report
di: Bai, Shuai, et al.
Pubblicazione: (2025) -
Qwen2 Technical Report
di: Yang, An, et al.
Pubblicazione: (2024) -
Qwen2.5-Omni Technical Report
di: Xu, Jin, et al.
Pubblicazione: (2025)