InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Cao, Yuhang, Wang, Bin, Ouyang, Linke, Wei, Xilin, Zhang, Songyang, Duan, Haodong, Cao, Maosong, Zhang, Wenwei, Li, Yining, Yan, Hang, Gao, Yang, Zhang, Xinyue, Li, Wei, Li, Jingwen, Chen, Kai, He, Conghui, Zhang, Xingcheng, Qiao, Yu, Lin, Dahua, Wang, Jiaqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
di: Zhang, Pan, et al.
Pubblicazione: (2024)
di: Zhang, Pan, et al.
Pubblicazione: (2024)
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
di: Dong, Xiaoyi, et al.
Pubblicazione: (2024)
di: Dong, Xiaoyi, et al.
Pubblicazione: (2024)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
di: Zhang, Pan, et al.
Pubblicazione: (2024)
di: Zhang, Pan, et al.
Pubblicazione: (2024)
InternLM-Law: An Open Source Chinese Legal Large Language Model
di: Fei, Zhiwei, et al.
Pubblicazione: (2024)
di: Fei, Zhiwei, et al.
Pubblicazione: (2024)
InternLM2 Technical Report
di: Cai, Zheng, et al.
Pubblicazione: (2024)
di: Cai, Zheng, et al.
Pubblicazione: (2024)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
InternLM2.5-StepProver: Advancing Automated Theorem Proving via Critic-Guided Search
di: Wu, Zijian, et al.
Pubblicazione: (2024)
di: Wu, Zijian, et al.
Pubblicazione: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
SIM-CoT: Supervised Implicit Chain-of-Thought
di: Wei, Xilin, et al.
Pubblicazione: (2025)
di: Wei, Xilin, et al.
Pubblicazione: (2025)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
di: Li, Jinsong, et al.
Pubblicazione: (2026)
di: Li, Jinsong, et al.
Pubblicazione: (2026)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
di: Li, Jinsong, et al.
Pubblicazione: (2025)
di: Li, Jinsong, et al.
Pubblicazione: (2025)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
di: Wei, Xilin, et al.
Pubblicazione: (2025)
di: Wei, Xilin, et al.
Pubblicazione: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
di: Cao, Yuhang, et al.
Pubblicazione: (2024)
di: Cao, Yuhang, et al.
Pubblicazione: (2024)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
di: Xing, Long, et al.
Pubblicazione: (2024)
di: Xing, Long, et al.
Pubblicazione: (2024)
Visual Agentic Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
di: Ding, Shuangrui, et al.
Pubblicazione: (2024)
di: Ding, Shuangrui, et al.
Pubblicazione: (2024)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
di: Bu, Jiazi, et al.
Pubblicazione: (2024)
di: Bu, Jiazi, et al.
Pubblicazione: (2024)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
di: Ma, Yubo, et al.
Pubblicazione: (2025)
di: Ma, Yubo, et al.
Pubblicazione: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and Refinement
di: Cao, Maosong, et al.
Pubblicazione: (2025)
di: Cao, Maosong, et al.
Pubblicazione: (2025)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
ETCHR: Editing To Clarify and Harness Reasoning
di: Zhang, Beichen, et al.
Pubblicazione: (2026)
di: Zhang, Beichen, et al.
Pubblicazione: (2026)
Rethinking Verification for LLM Code Generation: From Generation to Testing
di: Ma, Zihan, et al.
Pubblicazione: (2025)
di: Ma, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
di: Zhang, Pan, et al.
Pubblicazione: (2024) -
InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD
di: Dong, Xiaoyi, et al.
Pubblicazione: (2024) -
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025) -
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
di: Zhang, Pan, et al.
Pubblicazione: (2024) -
InternLM-Law: An Open Source Chinese Legal Large Language Model
di: Fei, Zhiwei, et al.
Pubblicazione: (2024)