UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Tsu-Jui, Qian, Yusu, Chen, Chen, Hu, Wenze, Gan, Zhe, Yang, Yinfei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
par: Fu, Tsu-Jui, et autres
Publié: (2023)
par: Fu, Tsu-Jui, et autres
Publié: (2023)
UniVG: Towards UNIfied-modal Video Generation
par: Ruan, Ludan, et autres
Publié: (2024)
par: Ruan, Ludan, et autres
Publié: (2024)
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
par: Bai, Sule, et autres
Publié: (2025)
par: Bai, Sule, et autres
Publié: (2025)
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
par: Qian, Yusu, et autres
Publié: (2025)
par: Qian, Yusu, et autres
Publié: (2025)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
Taming Outlier Tokens in Diffusion Transformers
par: Wu, Xiaoyu, et autres
Publié: (2026)
par: Wu, Xiaoyu, et autres
Publié: (2026)
UniHuman: A Unified Model for Editing Human Images in the Wild
par: Li, Nannan, et autres
Publié: (2023)
par: Li, Nannan, et autres
Publié: (2023)
SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning
par: Fu, Tsu-Jui, et autres
Publié: (2020)
par: Fu, Tsu-Jui, et autres
Publié: (2020)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
par: Xu, Junzhe, et autres
Publié: (2025)
par: Xu, Junzhe, et autres
Publié: (2025)
STIV: Scalable Text and Image Conditioned Video Generation
par: Lin, Zongyu, et autres
Publié: (2024)
par: Lin, Zongyu, et autres
Publié: (2024)
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
par: Bai, Chengyu, et autres
Publié: (2025)
par: Bai, Chengyu, et autres
Publié: (2025)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
par: Han, Feng, et autres
Publié: (2025)
par: Han, Feng, et autres
Publié: (2025)
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
par: Jiang, Hong, et autres
Publié: (2026)
par: Jiang, Hong, et autres
Publié: (2026)
Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
par: Bai, Xiyue, et autres
Publié: (2025)
par: Bai, Xiyue, et autres
Publié: (2025)
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
par: Feng, Kailai, et autres
Publié: (2026)
par: Feng, Kailai, et autres
Publié: (2026)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
par: Zheng, Dian, et autres
Publié: (2026)
par: Zheng, Dian, et autres
Publié: (2026)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists
par: Gan, Yulu, et autres
Publié: (2023)
par: Gan, Yulu, et autres
Publié: (2023)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
par: AI, Inclusion, et autres
Publié: (2026)
par: AI, Inclusion, et autres
Publié: (2026)
UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
par: Mao, Qi, et autres
Publié: (2025)
par: Mao, Qi, et autres
Publié: (2025)
Med-LEGO: Editing and Adapting toward Generalist Medical Image Diagnosis
par: Zhu, Yitao, et autres
Publié: (2025)
par: Zhu, Yitao, et autres
Publié: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
par: Wang, Peiyu, et autres
Publié: (2025)
par: Wang, Peiyu, et autres
Publié: (2025)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
par: Guo, Qin, et autres
Publié: (2025)
par: Guo, Qin, et autres
Publié: (2025)
Image Editing As Programs with Diffusion Models
par: Hu, Yujia, et autres
Publié: (2025)
par: Hu, Yujia, et autres
Publié: (2025)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
par: Wei, Hongyang, et autres
Publié: (2026)
par: Wei, Hongyang, et autres
Publié: (2026)
Diffusion Model as a Generalist Segmentation Learner
par: Wang, Haoxiao, et autres
Publié: (2026)
par: Wang, Haoxiao, et autres
Publié: (2026)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
par: Li, Yiheng, et autres
Publié: (2024)
par: Li, Yiheng, et autres
Publié: (2024)
Documents similaires
-
GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
par: Qian, Yusu, et autres
Publié: (2025) -
Guiding Instruction-based Image Editing via Multimodal Large Language Models
par: Fu, Tsu-Jui, et autres
Publié: (2023) -
UniVG: Towards UNIfied-modal Video Generation
par: Ruan, Ludan, et autres
Publié: (2024) -
DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation
par: Chen, Chen, et autres
Publié: (2025) -
UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
par: Bai, Sule, et autres
Publié: (2025)