GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhenyu, Li, Aoxue, Li, Zhenguo, Liu, Xihui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation
di: Wang, Zhenyu, et al.
Pubblicazione: (2024)
di: Wang, Zhenyu, et al.
Pubblicazione: (2024)
Enhancing Text-to-Image Editing via Hybrid Mask-Informed Fusion
di: Li, Aoxue, et al.
Pubblicazione: (2024)
di: Li, Aoxue, et al.
Pubblicazione: (2024)
Efficient Transferability Assessment for Selection of Pre-trained Detectors
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model
di: Yi, Mingyang, et al.
Pubblicazione: (2024)
di: Yi, Mingyang, et al.
Pubblicazione: (2024)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
di: Jin, Weiyang, et al.
Pubblicazione: (2025)
DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing
di: Wang, Dianyi, et al.
Pubblicazione: (2026)
di: Wang, Dianyi, et al.
Pubblicazione: (2026)
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
Editing Massive Concepts in Text-to-Image Diffusion Models
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities
di: Wang, Jin, et al.
Pubblicazione: (2025)
di: Wang, Jin, et al.
Pubblicazione: (2025)
Open-Vocabulary Object Detection with Meta Prompt Representation and Instance Contrastive Optimization
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration
di: Huang, Kaiyi, et al.
Pubblicazione: (2024)
di: Huang, Kaiyi, et al.
Pubblicazione: (2024)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
di: Jiang, Kaixun, et al.
Pubblicazione: (2026)
di: Jiang, Kaixun, et al.
Pubblicazione: (2026)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
di: Song, Yuxin, et al.
Pubblicazione: (2025)
di: Song, Yuxin, et al.
Pubblicazione: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding
di: Teng, Yao, et al.
Pubblicazione: (2024)
di: Teng, Yao, et al.
Pubblicazione: (2024)
DreamOmni: Unified Image Generation and Editing
di: Xia, Bin, et al.
Pubblicazione: (2024)
di: Xia, Bin, et al.
Pubblicazione: (2024)
OmniGen: Unified Image Generation
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
di: Huang, Kaiyi, et al.
Pubblicazione: (2023)
di: Huang, Kaiyi, et al.
Pubblicazione: (2023)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026)
di: Liu, Jialun, et al.
Pubblicazione: (2026)
MeshPad: Interactive Sketch-Conditioned Artist-Reminiscent Mesh Generation and Editing
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation
di: Teng, Yao, et al.
Pubblicazione: (2025)
di: Teng, Yao, et al.
Pubblicazione: (2025)
AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?
di: Yan, Hailong, et al.
Pubblicazione: (2026)
di: Yan, Hailong, et al.
Pubblicazione: (2026)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation
di: Sun, Kaiyue, et al.
Pubblicazione: (2024)
di: Sun, Kaiyue, et al.
Pubblicazione: (2024)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis
di: Teng, Yao, et al.
Pubblicazione: (2024)
di: Teng, Yao, et al.
Pubblicazione: (2024)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation
di: Li, Yanfeng, et al.
Pubblicazione: (2026)
di: Li, Yanfeng, et al.
Pubblicazione: (2026)
MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing
di: Tian, Xueyun, et al.
Pubblicazione: (2025)
di: Tian, Xueyun, et al.
Pubblicazione: (2025)
Identifying Prompted Artist Names from Generated Images
di: Su, Grace, et al.
Pubblicazione: (2025)
di: Su, Grace, et al.
Pubblicazione: (2025)
Task-Generalized Adaptive Cross-Domain Learning for Multimodal Image Fusion
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts
di: Zhao, Yuyang, et al.
Pubblicazione: (2023)
di: Zhao, Yuyang, et al.
Pubblicazione: (2023)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
di: Zhang, Hong, et al.
Pubblicazione: (2025)
di: Zhang, Hong, et al.
Pubblicazione: (2025)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation
di: Wang, Zhenyu, et al.
Pubblicazione: (2024) -
Enhancing Text-to-Image Editing via Hybrid Mask-Informed Fusion
di: Li, Aoxue, et al.
Pubblicazione: (2024) -
Efficient Transferability Assessment for Selection of Pre-trained Detectors
di: Wang, Zhao, et al.
Pubblicazione: (2024) -
Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model
di: Yi, Mingyang, et al.
Pubblicazione: (2024) -
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
di: Jin, Weiyang, et al.
Pubblicazione: (2025)