WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Zhipeng, Zhuang, Shaobin, Fu, Canmiao, Yang, Binxin, Zhang, Ying, Sun, Chong, Zhang, Zhizheng, Wang, Yali, Li, Chen, Zha, Zheng-Jun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Get In Video: Add Anything You Want to the Video
by: Zhuang, Shaobin, et al.
Published: (2025)
by: Zhuang, Shaobin, et al.
Published: (2025)
Video-GPT via Next Clip Diffusion
by: Zhuang, Shaobin, et al.
Published: (2025)
by: Zhuang, Shaobin, et al.
Published: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
by: Zhuang, Shaobin, et al.
Published: (2025)
by: Zhuang, Shaobin, et al.
Published: (2025)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
by: Guo, Yiwei, et al.
Published: (2026)
by: Guo, Yiwei, et al.
Published: (2026)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
by: Zhuang, Shaobin, et al.
Published: (2026)
by: Zhuang, Shaobin, et al.
Published: (2026)
Text-guided Visual Prompt DINO for Generic Segmentation
by: Guan, Yuchen, et al.
Published: (2025)
by: Guan, Yuchen, et al.
Published: (2025)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
by: Liu, Qingyang, et al.
Published: (2026)
by: Liu, Qingyang, et al.
Published: (2026)
VisualCritic: Making LMMs Perceive Visual Quality Like Humans
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
by: Xu, Pusheng, et al.
Published: (2025)
by: Xu, Pusheng, et al.
Published: (2025)
Automated Prompt Generation for Code Intelligence: An Empirical study and Experience in WeChat
by: Ji, Kexing, et al.
Published: (2025)
by: Ji, Kexing, et al.
Published: (2025)
Application of WeChat in University Libraries in China
by: Xi, Qingkui, et al.
Published: (2017)
by: Xi, Qingkui, et al.
Published: (2017)
WeChat and the Chinese Diaspora
Published: (2023)
Published: (2023)
Mini-Game Lifetime Value Prediction in WeChat
by: Chen, Aochuan, et al.
Published: (2025)
by: Chen, Aochuan, et al.
Published: (2025)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
A Deep Dive into Retrieval-Augmented Generation for Code Completion: Experience on WeChat
by: Yang, Zezhou, et al.
Published: (2025)
by: Yang, Zezhou, et al.
Published: (2025)
WeChat‐as‐a‐Police Service
by: Ausma Bernot
Published: (2025)
by: Ausma Bernot
Published: (2025)
Fluorescence Guided Surgery in Gastric Cancer: What Do We Have and What Can We Do?
by: Chun Zhuang, et al.
Published: (2025)
by: Chun Zhuang, et al.
Published: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
by: Yue, Zhengrong, et al.
Published: (2025)
by: Yue, Zhengrong, et al.
Published: (2025)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
by: Zhuang, Chenyi, et al.
Published: (2024)
by: Zhuang, Chenyi, et al.
Published: (2024)
When ChatGPT Meets Smart Contract Vulnerability Detection: How Far Are We?
by: Chen, Chong, et al.
Published: (2023)
by: Chen, Chong, et al.
Published: (2023)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
by: Li, Ruihang, et al.
Published: (2026)
by: Li, Ruihang, et al.
Published: (2026)
A General Theory for Compositional Generalization
by: Fu, Jingwen, et al.
Published: (2024)
by: Fu, Jingwen, et al.
Published: (2024)
Chapter 2 WeChat as migration infrastructure
by: Ryzhova, Natalia, et al.
Published: (2023)
by: Ryzhova, Natalia, et al.
Published: (2023)
UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits
by: Ye, Keming, et al.
Published: (2025)
by: Ye, Keming, et al.
Published: (2025)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
by: Ding, Yanbo, et al.
Published: (2024)
by: Ding, Yanbo, et al.
Published: (2024)
ChatUIE: Exploring Chat-based Unified Information Extraction using Large Language Models
by: Xu, Jun, et al.
Published: (2024)
by: Xu, Jun, et al.
Published: (2024)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
by: Yue, Zhengrong, et al.
Published: (2025)
by: Yue, Zhengrong, et al.
Published: (2025)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
by: Guo, Yiwei, et al.
Published: (2024)
by: Guo, Yiwei, et al.
Published: (2024)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
by: Li, Sifei, et al.
Published: (2024)
by: Li, Sifei, et al.
Published: (2024)
All We Do Is Chat Chat: Social Networking for the Electronic Resources Librarian
by: Emery, Jill
Published: (2008)
by: Emery, Jill
Published: (2008)
ChatGPT Inaccuracy Mitigation during Technical Report Understanding: Are We There Yet?
by: Tamanna, Salma Begum, et al.
Published: (2024)
by: Tamanna, Salma Begum, et al.
Published: (2024)
OneGen: Efficient One-Pass Unified Generation and Retrieval for LLMs
by: Zhang, Jintian, et al.
Published: (2024)
by: Zhang, Jintian, et al.
Published: (2024)
Caregivers experiences in the WeChat groups of the WHO iSupport online course in China
by: Mengmeng Xia, et al.
Published: (2025)
by: Mengmeng Xia, et al.
Published: (2025)
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens
by: Yang, Jian, et al.
Published: (2025)
by: Yang, Jian, et al.
Published: (2025)
ChatTime: A Unified Multimodal Time Series Foundation Model Bridging Numerical and Textual Data
by: Wang, Chengsen, et al.
Published: (2024)
by: Wang, Chengsen, et al.
Published: (2024)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
by: Tang, Tao, et al.
Published: (2025)
by: Tang, Tao, et al.
Published: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
by: Wang, Le, et al.
Published: (2025)
by: Wang, Le, et al.
Published: (2025)
UEval: A Benchmark for Unified Multimodal Generation
by: Li, Bo, et al.
Published: (2026)
by: Li, Bo, et al.
Published: (2026)
Can We Edit Multimodal Large Language Models?
by: Cheng, Siyuan, et al.
Published: (2023)
by: Cheng, Siyuan, et al.
Published: (2023)
Similar Items
-
Get In Video: Add Anything You Want to the Video
by: Zhuang, Shaobin, et al.
Published: (2025) -
Video-GPT via Next Clip Diffusion
by: Zhuang, Shaobin, et al.
Published: (2025) -
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
by: Zhuang, Shaobin, et al.
Published: (2025) -
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
by: Guo, Yiwei, et al.
Published: (2026) -
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
by: Zhuang, Shaobin, et al.
Published: (2026)