ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Zhen, Jiang, Zeyinzi, Pan, Yulin, Zhang, Jingfeng, Mao, Chaojie, Xie, Chenwei, Liu, Yu, Zhou, Jingren |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
par: Mao, Chaojie, et autres
Publié: (2025)
par: Mao, Chaojie, et autres
Publié: (2025)
StyleBooth: Image Style Editing with Multimodal Instruction
par: Han, Zhen, et autres
Publié: (2024)
par: Han, Zhen, et autres
Publié: (2024)
VACE: All-in-One Video Creation and Editing
par: Jiang, Zeyinzi, et autres
Publié: (2025)
par: Jiang, Zeyinzi, et autres
Publié: (2025)
Locate, Assign, Refine: Taming Customized Promptable Image Inpainting
par: Pan, Yulin, et autres
Publié: (2024)
par: Pan, Yulin, et autres
Publié: (2024)
ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing
par: Pan, Yulin, et autres
Publié: (2025)
par: Pan, Yulin, et autres
Publié: (2025)
Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training
par: Xing, Jinbo, et autres
Publié: (2026)
par: Xing, Jinbo, et autres
Publié: (2026)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
par: Feng, Yutong, et autres
Publié: (2023)
par: Feng, Yutong, et autres
Publié: (2023)
Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation
par: Zhao, Shihao, et autres
Publié: (2025)
par: Zhao, Shihao, et autres
Publié: (2025)
VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Amber-Image: Efficient Compression of Large-Scale Diffusion Transformers
par: Yang, Chaojie, et autres
Publié: (2026)
par: Yang, Chaojie, et autres
Publié: (2026)
GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation
par: Yu, Jinze, et autres
Publié: (2026)
par: Yu, Jinze, et autres
Publié: (2026)
In-Context LoRA for Diffusion Transformers
par: Huang, Lianghua, et autres
Publié: (2024)
par: Huang, Lianghua, et autres
Publié: (2024)
Group Diffusion Transformers are Unsupervised Multitask Learners
par: Huang, Lianghua, et autres
Publié: (2024)
par: Huang, Lianghua, et autres
Publié: (2024)
ViTGaze: Gaze Following with Interaction Features in Vision Transformers
par: Song, Yuehao, et autres
Publié: (2024)
par: Song, Yuehao, et autres
Publié: (2024)
ACE: Attentional Concept Erasure in Diffusion Models
par: Carter, Finn
Publié: (2025)
par: Carter, Finn
Publié: (2025)
MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
par: Tu, Shuyuan, et autres
Publié: (2024)
par: Tu, Shuyuan, et autres
Publié: (2024)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
par: Huang, Lianghua, et autres
Publié: (2024)
par: Huang, Lianghua, et autres
Publié: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
par: Li, Shihao, et autres
Publié: (2025)
par: Li, Shihao, et autres
Publié: (2025)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
AllRestorer: All-in-One Transformer for Image Restoration under Composite Degradations
par: Mao, Jiawei, et autres
Publié: (2024)
par: Mao, Jiawei, et autres
Publié: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Precise Zero-shot Semantic Editing
par: Shuai, Zitao, et autres
Publié: (2024)
par: Shuai, Zitao, et autres
Publié: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing
par: Shuai, Zitao, et autres
Publié: (2024)
par: Shuai, Zitao, et autres
Publié: (2024)
Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
par: Zhou, Chao, et autres
Publié: (2025)
par: Zhou, Chao, et autres
Publié: (2025)
MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control
par: Zhou, Enshen, et autres
Publié: (2024)
par: Zhou, Enshen, et autres
Publié: (2024)
ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
par: Hu, Zichao, et autres
Publié: (2025)
par: Hu, Zichao, et autres
Publié: (2025)
ACE: Concept Editing in Diffusion Models without Performance Degradation
par: Wang, Ruipeng, et autres
Publié: (2025)
par: Wang, Ruipeng, et autres
Publié: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
FunEditor: Achieving Complex Image Edits via Function Aggregation with Diffusion Models
par: Samadi, Mohammadreza, et autres
Publié: (2024)
par: Samadi, Mohammadreza, et autres
Publié: (2024)
InsightEdit: Towards Better Instruction Following for Image Editing
par: Xu, Yingjing, et autres
Publié: (2024)
par: Xu, Yingjing, et autres
Publié: (2024)
Lipschitz Singularities in Diffusion Models
par: Yang, Zhantao, et autres
Publié: (2023)
par: Yang, Zhantao, et autres
Publié: (2023)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
par: Huang, Nisha, et autres
Publié: (2026)
par: Huang, Nisha, et autres
Publié: (2026)
Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
ArbiViewGen: Controllable Arbitrary Viewpoint Camera Data Generation for Autonomous Driving via Stable Diffusion Models
par: Lan, Yatong, et autres
Publié: (2025)
par: Lan, Yatong, et autres
Publié: (2025)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
par: Xing, Zhen, et autres
Publié: (2024)
par: Xing, Zhen, et autres
Publié: (2024)
GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
par: Wang, Junjie, et autres
Publié: (2023)
par: Wang, Junjie, et autres
Publié: (2023)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
par: Zhao, Yuyang, et autres
Publié: (2026)
par: Zhao, Yuyang, et autres
Publié: (2026)
Infinite Motion: Extended Motion Generation via Long Text Instructions
par: Li, Mengtian, et autres
Publié: (2024)
par: Li, Mengtian, et autres
Publié: (2024)
Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance
par: Jiang, Zhou, et autres
Publié: (2026)
par: Jiang, Zhou, et autres
Publié: (2026)
Documents similaires
-
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
par: Mao, Chaojie, et autres
Publié: (2025) -
StyleBooth: Image Style Editing with Multimodal Instruction
par: Han, Zhen, et autres
Publié: (2024) -
VACE: All-in-One Video Creation and Editing
par: Jiang, Zeyinzi, et autres
Publié: (2025) -
Locate, Assign, Refine: Taming Customized Promptable Image Inpainting
par: Pan, Yulin, et autres
Publié: (2024) -
ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing
par: Pan, Yulin, et autres
Publié: (2025)