mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Qinghao, Xu, Haiyang, Xu, Guohai, Ye, Jiabo, Yan, Ming, Zhou, Yiyang, Wang, Junyang, Hu, Anwen, Shi, Pengcheng, Shi, Yaya, Li, Chenliang, Xu, Yuanhong, Chen, Hehong, Tian, Junfeng, Qian, Qi, Zhang, Ji, Huang, Fei, Zhou, Jingren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
por: Hu, Anwen, et al.
Publicado: (2023)
por: Hu, Anwen, et al.
Publicado: (2023)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
por: Ye, Jiabo, et al.
Publicado: (2024)
por: Ye, Jiabo, et al.
Publicado: (2024)
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024)
por: Hu, Anwen, et al.
Publicado: (2024)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024)
por: Hu, Anwen, et al.
Publicado: (2024)
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
por: Benmahane, Yahya, et al.
Publicado: (2025)
por: Benmahane, Yahya, et al.
Publicado: (2025)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
por: Wang, Junyang, et al.
Publicado: (2024)
por: Wang, Junyang, et al.
Publicado: (2024)
SocialBench: Sociality Evaluation of Role-Playing Conversational Agents
por: Chen, Hongzhan, et al.
Publicado: (2024)
por: Chen, Hongzhan, et al.
Publicado: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
por: Wang, Junyang, et al.
Publicado: (2023)
por: Wang, Junyang, et al.
Publicado: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
por: Zhang, Liang, et al.
Publicado: (2024)
por: Zhang, Liang, et al.
Publicado: (2024)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
por: Wang, Junyang, et al.
Publicado: (2026)
por: Wang, Junyang, et al.
Publicado: (2026)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Ye, Wei, et al.
Publicado: (2024)
por: Ye, Wei, et al.
Publicado: (2024)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
por: Xu, Shihao, et al.
Publicado: (2024)
por: Xu, Shihao, et al.
Publicado: (2024)
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
por: Wan, Fanqi, et al.
Publicado: (2025)
por: Wan, Fanqi, et al.
Publicado: (2025)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
por: Wang, Junyang, et al.
Publicado: (2025)
por: Wang, Junyang, et al.
Publicado: (2025)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
por: Sheng, Zihao, et al.
Publicado: (2025)
por: Sheng, Zihao, et al.
Publicado: (2025)
WebLeaper: Empowering Efficiency and Efficacy in WebAgent via Enabling Info-Rich Seeking
por: Tao, Zhengwei, et al.
Publicado: (2025)
por: Tao, Zhengwei, et al.
Publicado: (2025)
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
por: Shen, Weizhou, et al.
Publicado: (2024)
por: Shen, Weizhou, et al.
Publicado: (2024)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
Designing Algorithms Empowered by Language Models: An Analytical Framework, Case Studies, and Insights
por: Chen, Yanxi, et al.
Publicado: (2024)
por: Chen, Yanxi, et al.
Publicado: (2024)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
por: Wang, Zhenhailong, et al.
Publicado: (2025)
por: Wang, Zhenhailong, et al.
Publicado: (2025)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Enhanced Automated Quality Assessment Network for Interactive Building Segmentation in High-Resolution Remote Sensing Imagery
por: Zhang, Zhili, et al.
Publicado: (2024)
por: Zhang, Zhili, et al.
Publicado: (2024)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
por: Zhang, Zhihan, et al.
Publicado: (2023)
por: Zhang, Zhihan, et al.
Publicado: (2023)
A Model Fusion Approach for Enhancing Credit Approval Decision Making
por: Wu, Yuanhong, et al.
Publicado: (2026)
por: Wu, Yuanhong, et al.
Publicado: (2026)
Bitcoin Price Prediction using Machine Learning and Combinatorial Fusion Analysis
por: Wu, Yuanhong, et al.
Publicado: (2026)
por: Wu, Yuanhong, et al.
Publicado: (2026)
Accurate GPU Memory Prediction for Deep Learning Jobs through Dynamic Analysis
por: Shi, Jiabo, et al.
Publicado: (2025)
por: Shi, Jiabo, et al.
Publicado: (2025)
StreamME: Simplify 3D Gaussian Avatar within Live Stream
por: Song, Luchuan, et al.
Publicado: (2025)
por: Song, Luchuan, et al.
Publicado: (2025)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
por: Wang, Junyang, et al.
Publicado: (2025)
por: Wang, Junyang, et al.
Publicado: (2025)
Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents
por: Xu, Haiyang, et al.
Publicado: (2026)
por: Xu, Haiyang, et al.
Publicado: (2026)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
por: Liu, Haowei, et al.
Publicado: (2024)
por: Liu, Haowei, et al.
Publicado: (2024)
PLUG: Revisiting Amodal Segmentation with Foundation Model and Hierarchical Focus
por: Liu, Zhaochen, et al.
Publicado: (2024)
por: Liu, Zhaochen, et al.
Publicado: (2024)
How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States
por: Zhou, Zhenhong, et al.
Publicado: (2024)
por: Zhou, Zhenhong, et al.
Publicado: (2024)
P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
por: Zhang, Yidan, et al.
Publicado: (2024)
por: Zhang, Yidan, et al.
Publicado: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
por: Bi, Jing, et al.
Publicado: (2025)
por: Bi, Jing, et al.
Publicado: (2025)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
Ejemplares similares
-
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
por: Hu, Anwen, et al.
Publicado: (2023) -
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
por: Ye, Jiabo, et al.
Publicado: (2024) -
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024) -
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
por: Hu, Anwen, et al.
Publicado: (2024) -
Parameter-Efficient Adaptation of mPLUG-Owl2 via Pixel-Level Visual Prompts for NR-IQA
por: Benmahane, Yahya, et al.
Publicado: (2025)