SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hao, Tian, Changyao, Shao, Jie, Zhu, Xizhou, Wang, Zhaokai, Zhu, Jinguo, Dou, Wenhan, Wang, Xiaogang, Li, Hongsheng, Lu, Lewei, Dai, Jifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SynerGen: Contextualized Generative Recommender for Unified Search and Recommendation
par: Gao, Vianne R., et autres
Publié: (2025)
par: Gao, Vianne R., et autres
Publié: (2025)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2025)
par: Luo, Gen, et autres
Publié: (2025)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process
par: Tian, Changyao, et autres
Publié: (2023)
par: Tian, Changyao, et autres
Publié: (2023)
Parameter-Inverted Image Pyramid Networks
par: Zhu, Xizhou, et autres
Publié: (2024)
par: Zhu, Xizhou, et autres
Publié: (2024)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
par: Tian, Changyao, et autres
Publié: (2025)
par: Tian, Changyao, et autres
Publié: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)
par: Duan, Yuchen, et autres
Publié: (2024)
GenExam: A Multidisciplinary Text-to-Image Exam
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
Learning 1D Causal Visual Representation with De-focus Attention Networks
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
par: Gao, Zhangwei, et autres
Publié: (2024)
par: Gao, Zhangwei, et autres
Publié: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)
par: Ge, Junqi, et autres
Publié: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
par: Chen, Zhe, et autres
Publié: (2023)
par: Chen, Zhe, et autres
Publié: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
par: Xiong, Yuwen, et autres
Publié: (2024)
par: Xiong, Yuwen, et autres
Publié: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space
par: Li, Yan, et autres
Publié: (2025)
par: Li, Yan, et autres
Publié: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment
par: Zhao, Weiren, et autres
Publié: (2026)
par: Zhao, Weiren, et autres
Publié: (2026)
CoMemo: LVLMs Need Image Context with Image Memory
par: Liu, Shi, et autres
Publié: (2025)
par: Liu, Shi, et autres
Publié: (2025)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
par: Zhang, Jipeng, et autres
Publié: (2025)
par: Zhang, Jipeng, et autres
Publié: (2025)
Demystify Transformers & Convolutions in Modern Image Deep Networks
par: Hu, Xiaowei, et autres
Publié: (2022)
par: Hu, Xiaowei, et autres
Publié: (2022)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
par: Cui, Erfei, et autres
Publié: (2023)
par: Cui, Erfei, et autres
Publié: (2023)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
par: Tian, Changyao, et autres
Publié: (2026)
par: Tian, Changyao, et autres
Publié: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
LangBridge: Interpreting Image as a Combination of Language Embeddings
par: Liao, Jiaqi, et autres
Publié: (2025)
par: Liao, Jiaqi, et autres
Publié: (2025)
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
Docopilot: Improving Multimodal Models for Document-Level Understanding
par: Duan, Yuchen, et autres
Publié: (2025)
par: Duan, Yuchen, et autres
Publié: (2025)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
par: Zhu, Jinguo, et autres
Publié: (2025)
par: Zhu, Jinguo, et autres
Publié: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
par: Yang, Chenyu, et autres
Publié: (2025)
par: Yang, Chenyu, et autres
Publié: (2025)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024)
par: Liu, Yangzhou, et autres
Publié: (2024)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
par: Li, Jianjian, et autres
Publié: (2025)
par: Li, Jianjian, et autres
Publié: (2025)
Documents similaires
-
SynerGen: Contextualized Generative Recommender for Unified Search and Recommendation
par: Gao, Vianne R., et autres
Publié: (2025) -
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
par: Wang, Zhaokai, et autres
Publié: (2025) -
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
par: Luo, Gen, et autres
Publié: (2025) -
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
par: Luo, Gen, et autres
Publié: (2024) -
ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process
par: Tian, Changyao, et autres
Publié: (2023)