ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Zhen, Jiang, Zeyinzi, Pan, Yulin, Zhang, Jingfeng, Mao, Chaojie, Xie, Chenwei, Liu, Yu, Zhou, Jingren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
por: Mao, Chaojie, et al.
Publicado: (2025)
por: Mao, Chaojie, et al.
Publicado: (2025)
StyleBooth: Image Style Editing with Multimodal Instruction
por: Han, Zhen, et al.
Publicado: (2024)
por: Han, Zhen, et al.
Publicado: (2024)
VACE: All-in-One Video Creation and Editing
por: Jiang, Zeyinzi, et al.
Publicado: (2025)
por: Jiang, Zeyinzi, et al.
Publicado: (2025)
Locate, Assign, Refine: Taming Customized Promptable Image Inpainting
por: Pan, Yulin, et al.
Publicado: (2024)
por: Pan, Yulin, et al.
Publicado: (2024)
ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing
por: Pan, Yulin, et al.
Publicado: (2025)
por: Pan, Yulin, et al.
Publicado: (2025)
Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training
por: Xing, Jinbo, et al.
Publicado: (2026)
por: Xing, Jinbo, et al.
Publicado: (2026)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
por: Feng, Yutong, et al.
Publicado: (2023)
por: Feng, Yutong, et al.
Publicado: (2023)
Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation
por: Zhao, Shihao, et al.
Publicado: (2025)
por: Zhao, Shihao, et al.
Publicado: (2025)
VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Amber-Image: Efficient Compression of Large-Scale Diffusion Transformers
por: Yang, Chaojie, et al.
Publicado: (2026)
por: Yang, Chaojie, et al.
Publicado: (2026)
GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation
por: Yu, Jinze, et al.
Publicado: (2026)
por: Yu, Jinze, et al.
Publicado: (2026)
In-Context LoRA for Diffusion Transformers
por: Huang, Lianghua, et al.
Publicado: (2024)
por: Huang, Lianghua, et al.
Publicado: (2024)
Group Diffusion Transformers are Unsupervised Multitask Learners
por: Huang, Lianghua, et al.
Publicado: (2024)
por: Huang, Lianghua, et al.
Publicado: (2024)
ViTGaze: Gaze Following with Interaction Features in Vision Transformers
por: Song, Yuehao, et al.
Publicado: (2024)
por: Song, Yuehao, et al.
Publicado: (2024)
ACE: Attentional Concept Erasure in Diffusion Models
por: Carter, Finn
Publicado: (2025)
por: Carter, Finn
Publicado: (2025)
MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
por: Tu, Shuyuan, et al.
Publicado: (2024)
por: Tu, Shuyuan, et al.
Publicado: (2024)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
por: Huang, Lianghua, et al.
Publicado: (2024)
por: Huang, Lianghua, et al.
Publicado: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
por: Yao, Jingfeng, et al.
Publicado: (2024)
por: Yao, Jingfeng, et al.
Publicado: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
por: Li, Shihao, et al.
Publicado: (2025)
por: Li, Shihao, et al.
Publicado: (2025)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
por: Zhang, Zechuan, et al.
Publicado: (2025)
por: Zhang, Zechuan, et al.
Publicado: (2025)
AllRestorer: All-in-One Transformer for Image Restoration under Composite Degradations
por: Mao, Jiawei, et al.
Publicado: (2024)
por: Mao, Jiawei, et al.
Publicado: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Precise Zero-shot Semantic Editing
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
Latent Space Disentanglement in Diffusion Transformers Enables Zero-shot Fine-grained Semantic Editing
por: Shuai, Zitao, et al.
Publicado: (2024)
por: Shuai, Zitao, et al.
Publicado: (2024)
Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
por: Zhou, Chao, et al.
Publicado: (2025)
por: Zhou, Chao, et al.
Publicado: (2025)
MineDreamer: Learning to Follow Instructions via Chain-of-Imagination for Simulated-World Control
por: Zhou, Enshen, et al.
Publicado: (2024)
por: Zhou, Enshen, et al.
Publicado: (2024)
ComposableNav: Instruction-Following Navigation in Dynamic Environments via Composable Diffusion
por: Hu, Zichao, et al.
Publicado: (2025)
por: Hu, Zichao, et al.
Publicado: (2025)
ACE: Concept Editing in Diffusion Models without Performance Degradation
por: Wang, Ruipeng, et al.
Publicado: (2025)
por: Wang, Ruipeng, et al.
Publicado: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
FunEditor: Achieving Complex Image Edits via Function Aggregation with Diffusion Models
por: Samadi, Mohammadreza, et al.
Publicado: (2024)
por: Samadi, Mohammadreza, et al.
Publicado: (2024)
InsightEdit: Towards Better Instruction Following for Image Editing
por: Xu, Yingjing, et al.
Publicado: (2024)
por: Xu, Yingjing, et al.
Publicado: (2024)
Lipschitz Singularities in Diffusion Models
por: Yang, Zhantao, et al.
Publicado: (2023)
por: Yang, Zhantao, et al.
Publicado: (2023)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
por: Huang, Nisha, et al.
Publicado: (2026)
por: Huang, Nisha, et al.
Publicado: (2026)
Disentangling Instruction Influence in Diffusion Transformers for Parallel Multi-Instruction-Guided Image Editing
por: Liu, Hui, et al.
Publicado: (2025)
por: Liu, Hui, et al.
Publicado: (2025)
Robust Noisy Correspondence Learning via Self-Drop and Dual-Weight
por: Liu, Fan, et al.
Publicado: (2024)
por: Liu, Fan, et al.
Publicado: (2024)
ArbiViewGen: Controllable Arbitrary Viewpoint Camera Data Generation for Autonomous Driving via Stable Diffusion Models
por: Lan, Yatong, et al.
Publicado: (2025)
por: Lan, Yatong, et al.
Publicado: (2025)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024)
por: Xing, Zhen, et al.
Publicado: (2024)
GaussianEditor: Editing 3D Gaussians Delicately with Text Instructions
por: Wang, Junjie, et al.
Publicado: (2023)
por: Wang, Junjie, et al.
Publicado: (2023)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
por: Zhao, Yuyang, et al.
Publicado: (2026)
por: Zhao, Yuyang, et al.
Publicado: (2026)
Infinite Motion: Extended Motion Generation via Long Text Instructions
por: Li, Mengtian, et al.
Publicado: (2024)
por: Li, Mengtian, et al.
Publicado: (2024)
Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance
por: Jiang, Zhou, et al.
Publicado: (2026)
por: Jiang, Zhou, et al.
Publicado: (2026)
Ejemplares similares
-
ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
por: Mao, Chaojie, et al.
Publicado: (2025) -
StyleBooth: Image Style Editing with Multimodal Instruction
por: Han, Zhen, et al.
Publicado: (2024) -
VACE: All-in-One Video Creation and Editing
por: Jiang, Zeyinzi, et al.
Publicado: (2025) -
Locate, Assign, Refine: Taming Customized Promptable Image Inpainting
por: Pan, Yulin, et al.
Publicado: (2024) -
ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing
por: Pan, Yulin, et al.
Publicado: (2025)