VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Jiannan, Zhong, Muyan, Xing, Sen, Lai, Zeqiang, Liu, Zhaoyang, Chen, Zhe, Wang, Wenhai, Zhu, Xizhou, Lu, Lewei, Lu, Tong, Luo, Ping, Qiao, Yu, Dai, Jifeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
von: Chen, Zhe, et al.
Veröffentlicht: (2023)
von: Chen, Zhe, et al.
Veröffentlicht: (2023)
MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost
von: Xing, Sen, et al.
Veröffentlicht: (2024)
von: Xing, Sen, et al.
Veröffentlicht: (2024)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
von: Tao, Chenxin, et al.
Veröffentlicht: (2024)
von: Tao, Chenxin, et al.
Veröffentlicht: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
von: Duan, Yuchen, et al.
Veröffentlicht: (2024)
von: Duan, Yuchen, et al.
Veröffentlicht: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
von: Hou, Zhi, et al.
Veröffentlicht: (2025)
von: Hou, Zhi, et al.
Veröffentlicht: (2025)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
von: Xiong, Yuwen, et al.
Veröffentlicht: (2024)
von: Xiong, Yuwen, et al.
Veröffentlicht: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
von: Qiu, Han, et al.
Veröffentlicht: (2024)
von: Qiu, Han, et al.
Veröffentlicht: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
von: Liu, Yangzhou, et al.
Veröffentlicht: (2024)
von: Liu, Yangzhou, et al.
Veröffentlicht: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
von: Cui, Erfei, et al.
Veröffentlicht: (2023)
von: Cui, Erfei, et al.
Veröffentlicht: (2023)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
von: Tian, Changyao, et al.
Veröffentlicht: (2024)
von: Tian, Changyao, et al.
Veröffentlicht: (2024)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
von: Xu, Weiye, et al.
Veröffentlicht: (2025)
von: Xu, Weiye, et al.
Veröffentlicht: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
von: Yu, Haiyang, et al.
Veröffentlicht: (2025)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
von: Hu, Xiaowei, et al.
Veröffentlicht: (2022)
von: Hu, Xiaowei, et al.
Veröffentlicht: (2022)
End-to-End Vision Tokenizer Tuning
von: Wang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2025)
CoMemo: LVLMs Need Image Context with Image Memory
von: Liu, Shi, et al.
Veröffentlicht: (2025)
von: Liu, Shi, et al.
Veröffentlicht: (2025)
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
von: Gao, Zhangwei, et al.
Veröffentlicht: (2024)
von: Gao, Zhangwei, et al.
Veröffentlicht: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
von: Li, Hao, et al.
Veröffentlicht: (2024)
von: Li, Hao, et al.
Veröffentlicht: (2024)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
von: Cao, Yue, et al.
Veröffentlicht: (2024)
von: Cao, Yue, et al.
Veröffentlicht: (2024)
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks
von: Su, Shiqian, et al.
Veröffentlicht: (2026)
von: Su, Shiqian, et al.
Veröffentlicht: (2026)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
von: Luo, Gen, et al.
Veröffentlicht: (2025)
von: Luo, Gen, et al.
Veröffentlicht: (2025)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
von: Ge, Junqi, et al.
Veröffentlicht: (2024)
von: Ge, Junqi, et al.
Veröffentlicht: (2024)
SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving
von: Chen, Xuesong, et al.
Veröffentlicht: (2025)
von: Chen, Xuesong, et al.
Veröffentlicht: (2025)
OCRVerse: Towards Holistic OCR in End-to-End Vision-Language Models
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2026)
UAV-VLN: End-to-End Vision Language guided Navigation for UAVs
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
von: Saxena, Pranav, et al.
Veröffentlicht: (2025)
VisionLLM-based Multimodal Fusion Network for Glottic Carcinoma Early Detection
von: Jin, Zhaohui, et al.
Veröffentlicht: (2024)
von: Jin, Zhaohui, et al.
Veröffentlicht: (2024)
Parameter-Inverted Image Pyramid Networks
von: Zhu, Xizhou, et al.
Veröffentlicht: (2024)
von: Zhu, Xizhou, et al.
Veröffentlicht: (2024)
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
von: Jiang, Bo, et al.
Veröffentlicht: (2024)
von: Jiang, Bo, et al.
Veröffentlicht: (2024)
LMAD: Integrated End-to-End Vision-Language Model for Explainable Autonomous Driving
von: Song, Nan, et al.
Veröffentlicht: (2025)
von: Song, Nan, et al.
Veröffentlicht: (2025)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
von: Tian, Changyao, et al.
Veröffentlicht: (2025)
von: Tian, Changyao, et al.
Veröffentlicht: (2025)
ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints
von: Huang, Kaili, et al.
Veröffentlicht: (2026)
von: Huang, Kaili, et al.
Veröffentlicht: (2026)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
von: Zhang, Yaolun, et al.
Veröffentlicht: (2026)
von: Zhang, Yaolun, et al.
Veröffentlicht: (2026)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
von: Wang, Xiao, et al.
Veröffentlicht: (2025)
Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets
von: Koran, Alex, et al.
Veröffentlicht: (2026)
von: Koran, Alex, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
von: Chen, Zhe, et al.
Veröffentlicht: (2023) -
MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost
von: Xing, Sen, et al.
Veröffentlicht: (2024) -
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
von: Tao, Chenxin, et al.
Veröffentlicht: (2024) -
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
von: Duan, Yuchen, et al.
Veröffentlicht: (2024) -
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)