DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Dianyi, Li, Ruihang, Han, Feng, Ma, Chaofan, Song, Wei, Wang, Siyuan, Wang, Yibin, Xin, Yi, Liu, Hongjian, Zhang, Zhixiong, Ding, Shengyuan, Wang, Tianhang, Cheng, Zhenglin, Lin, Tao, Jin, Cheng, Yu, Kaicheng, Chen, Jingjing, Wang, Wenjie, Wei, Zhongyu, Wang, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
par: Wang, Dianyi, et autres
Publié: (2026)
par: Wang, Dianyi, et autres
Publié: (2026)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
par: Han, Feng, et autres
Publié: (2025)
par: Han, Feng, et autres
Publié: (2025)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization
par: Wang, Yikun, et autres
Publié: (2025)
par: Wang, Yikun, et autres
Publié: (2025)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
par: Han, Feng, et autres
Publié: (2026)
par: Han, Feng, et autres
Publié: (2026)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Skeletal Editing of Isoindolines to Tetralins
par: Bowei Huang, et autres
Publié: (2025)
par: Bowei Huang, et autres
Publié: (2025)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Channel-wise Vector Quantization
par: Song, Wei, et autres
Publié: (2026)
par: Song, Wei, et autres
Publié: (2026)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
par: Liu, Shujun, et autres
Publié: (2025)
par: Liu, Shujun, et autres
Publié: (2025)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026)
par: Zhang, Zhixiong, et autres
Publié: (2026)
Unified Personalized Reward Model for Vision Generation
par: Wang, Yibin, et autres
Publié: (2026)
par: Wang, Yibin, et autres
Publié: (2026)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
par: Li, Ruihang, et autres
Publié: (2026)
par: Li, Ruihang, et autres
Publié: (2026)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
par: Tang, Tao, et autres
Publié: (2025)
par: Tang, Tao, et autres
Publié: (2025)
Phenazine‐Based Ultra‐Narrow Bandgap Acceptors for Efficient Transparent Organic Photovoltaic
par: Yibin Zhou, et autres
Publié: (2025)
par: Yibin Zhou, et autres
Publié: (2025)
Photoactivable CRISPR for Biosensing and Cancer Therapy
par: Siyuan Wang, et autres
Publié: (2024)
par: Siyuan Wang, et autres
Publié: (2024)
Characterization of NiCas12b for In Vivo Genome Editing
par: Yunqian Zhang, et autres
Publié: (2024)
par: Yunqian Zhang, et autres
Publié: (2024)
OmniGen: Unified Image Generation
par: Xiao, Shitao, et autres
Publié: (2024)
par: Xiao, Shitao, et autres
Publié: (2024)
Identity-Driven Hierarchical Role-Playing Agents
par: Sun, Libo, et autres
Publié: (2024)
par: Sun, Libo, et autres
Publié: (2024)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
par: Sun, Libo, et autres
Publié: (2026)
par: Sun, Libo, et autres
Publié: (2026)
Stepwise Informativeness Search for Efficient and Effective LLM Reasoning
par: Wang, Siyuan, et autres
Publié: (2025)
par: Wang, Siyuan, et autres
Publié: (2025)
Symbolic Working Memory Enhances Language Models for Complex Rule Application
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders
par: Wang, Tianhang, et autres
Publié: (2026)
par: Wang, Tianhang, et autres
Publié: (2026)
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
par: Yue, Shengbin, et autres
Publié: (2024)
par: Yue, Shengbin, et autres
Publié: (2024)
DPDEdit: Detail-Preserved Diffusion Models for Multimodal Fashion Image Editing
par: Wang, Xiaolong, et autres
Publié: (2024)
par: Wang, Xiaolong, et autres
Publié: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
EtCon: Edit-then-Consolidate for Reliable Knowledge Editing
par: Li, Ruilin, et autres
Publié: (2025)
par: Li, Ruilin, et autres
Publié: (2025)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
par: Chen, Yuqing, et autres
Publié: (2025)
par: Chen, Yuqing, et autres
Publié: (2025)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
par: Cheng, Dongjie, et autres
Publié: (2026)
par: Cheng, Dongjie, et autres
Publié: (2026)
UDD: Dataset Distillation via Mining Underutilized Regions
par: Wang, Shiguang, et autres
Publié: (2024)
par: Wang, Shiguang, et autres
Publié: (2024)
A Fast, Performant, Secure Distributed Training Framework For Large Language Model
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
MagicFace: Training-free Universal-Style Human Image Customized Synthesis
par: Wang, Yibin, et autres
Publié: (2024)
par: Wang, Yibin, et autres
Publié: (2024)
Documents similaires
-
UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
par: Wang, Dianyi, et autres
Publié: (2026) -
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025) -
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
par: Han, Feng, et autres
Publié: (2025) -
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025) -
GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization
par: Wang, Yikun, et autres
Publié: (2025)