Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
Fuente:
arXiv
Saved in:
| Main Authors: | Mao, Qi, Chen, Lan, Gu, Yuchao, Shou, Mike Zheng, Yang, Ming-Hsuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Edit Transfer: Learning Image Editing via Vision In-Context Relations
by: Chen, Lan, et al.
Published: (2025)
by: Chen, Lan, et al.
Published: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
by: Gu, Yuchao, et al.
Published: (2025)
by: Gu, Yuchao, et al.
Published: (2025)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
by: Chen, Lan, et al.
Published: (2025)
by: Chen, Lan, et al.
Published: (2025)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
by: Chen, Lan, et al.
Published: (2026)
by: Chen, Lan, et al.
Published: (2026)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
by: Shi, Yiqing, et al.
Published: (2025)
by: Shi, Yiqing, et al.
Published: (2025)
Olaf-World: Orienting Latent Actions for Video World Modeling
by: Jiang, Yuxin, et al.
Published: (2026)
by: Jiang, Yuxin, et al.
Published: (2026)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
by: Zhang, David Junhao, et al.
Published: (2023)
by: Zhang, David Junhao, et al.
Published: (2023)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
D-AR: Diffusion via Autoregressive Models
by: Gao, Ziteng, et al.
Published: (2025)
by: Gao, Ziteng, et al.
Published: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
by: Zhao, Rui, et al.
Published: (2025)
by: Zhao, Rui, et al.
Published: (2025)
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
by: Gu, Yuchao, et al.
Published: (2026)
by: Gu, Yuchao, et al.
Published: (2026)
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
by: Zeng, Ziyun, et al.
Published: (2025)
by: Zeng, Ziyun, et al.
Published: (2025)
Show-o2: Improved Native Unified Multimodal Models
by: Xie, Jinheng, et al.
Published: (2025)
by: Xie, Jinheng, et al.
Published: (2025)
TPDiff: Temporal Pyramid Video Diffusion Model
by: Ran, Lingmin, et al.
Published: (2025)
by: Ran, Lingmin, et al.
Published: (2025)
Personalized Vision via Visual In-Context Learning
by: Jiang, Yuxin, et al.
Published: (2025)
by: Jiang, Yuxin, et al.
Published: (2025)
SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution
by: Song, Yiren, et al.
Published: (2026)
by: Song, Yiren, et al.
Published: (2026)
FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing
by: Chen, Ze, et al.
Published: (2026)
by: Chen, Ze, et al.
Published: (2026)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Customized Generation Reimagined: Fidelity and Editability Harmonized
by: Jin, Jian, et al.
Published: (2024)
by: Jin, Jian, et al.
Published: (2024)
WMAdapter: Adding WaterMark Control to Latent Diffusion Models
by: Ci, Hai, et al.
Published: (2024)
by: Ci, Hai, et al.
Published: (2024)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
by: Xie, Jinheng, et al.
Published: (2024)
by: Xie, Jinheng, et al.
Published: (2024)
Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing
by: Wu, Xiaodong, et al.
Published: (2026)
by: Wu, Xiaodong, et al.
Published: (2026)
DiffSeg30k: A Multi-Turn Diffusion Editing Benchmark for Localized AIGC Detection
by: Ci, Hai, et al.
Published: (2025)
by: Ci, Hai, et al.
Published: (2025)
LSAP: Rethinking Inversion Fidelity, Perception and Editability in GAN Latent Space
by: Zhao, Xuekun, et al.
Published: (2022)
by: Zhao, Xuekun, et al.
Published: (2022)
Guided Image Synthesis via Initial Image Editing in Diffusion Model
by: Mao, Jiafeng, et al.
Published: (2023)
by: Mao, Jiafeng, et al.
Published: (2023)
Mitty: Diffusion-based Human-to-Robot Video Generation
by: Song, Yiren, et al.
Published: (2025)
by: Song, Yiren, et al.
Published: (2025)
High-Fidelity Diffusion-based Image Editing
by: Hou, Chen, et al.
Published: (2023)
by: Hou, Chen, et al.
Published: (2023)
ColonNeRF: High-Fidelity Neural Reconstruction of Long Colonoscopy
by: Shi, Yufei, et al.
Published: (2023)
by: Shi, Yufei, et al.
Published: (2023)
Unified Dense Prediction of Video Diffusion
by: Yang, Lehan, et al.
Published: (2025)
by: Yang, Lehan, et al.
Published: (2025)
LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer
by: Song, Yiren, et al.
Published: (2025)
by: Song, Yiren, et al.
Published: (2025)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
by: Song, Yiren, et al.
Published: (2024)
by: Song, Yiren, et al.
Published: (2024)
Dual-Latent Collaborative Decoding for Fidelity-Perception Balanced Image Compression
by: Mao, Qi, et al.
Published: (2026)
by: Mao, Qi, et al.
Published: (2026)
FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion Models
by: Wu, Wei, et al.
Published: (2024)
by: Wu, Wei, et al.
Published: (2024)
Frequency Domain-Based Diffusion Model for Unpaired Image Dehazing
by: Liu, Chengxu, et al.
Published: (2025)
by: Liu, Chengxu, et al.
Published: (2025)
Multimodal-Conditioned Latent Diffusion Models for Fashion Image Editing
by: Baldrati, Alberto, et al.
Published: (2024)
by: Baldrati, Alberto, et al.
Published: (2024)
Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation
by: Li, Weijie, et al.
Published: (2024)
by: Li, Weijie, et al.
Published: (2024)
DirectDrag: High-Fidelity, Mask-Free, Prompt-Free Drag-based Image Editing via Readout-Guided Feature Alignment
by: Liao, Sheng-Hao, et al.
Published: (2025)
by: Liao, Sheng-Hao, et al.
Published: (2025)
FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition
by: Endo, Taichi, et al.
Published: (2026)
by: Endo, Taichi, et al.
Published: (2026)
DrivingGaussian++: Towards Realistic Reconstruction and Editable Simulation for Surrounding Dynamic Driving Scenes
by: Xiong, Yajiao, et al.
Published: (2025)
by: Xiong, Yajiao, et al.
Published: (2025)
Similar Items
-
Edit Transfer: Learning Image Editing via Vision In-Context Relations
by: Chen, Lan, et al.
Published: (2025) -
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
by: Gu, Yuchao, et al.
Published: (2025) -
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
by: Chen, Lan, et al.
Published: (2025) -
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
by: Mao, Weijia, et al.
Published: (2025) -
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
by: Chen, Lan, et al.
Published: (2026)