Towards Efficient Diffusion-Based Image Editing with Instant Attention Masks
Fuente:
arXiv
Salvato in:
| Autori principali: | Zou, Siyu, Tang, Jiji, Zhou, Yiyi, He, Jing, Zhao, Chaoyi, Zhang, Rongsheng, Hu, Zhipeng, Sun, Xiaoshuai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
di: Zhang, Jinlu, et al.
Pubblicazione: (2024)
di: Zhang, Jinlu, et al.
Pubblicazione: (2024)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
Character-Adapter: Prompt-Guided Region Control for High-Fidelity Character Customization
di: Ma, Yuhang, et al.
Pubblicazione: (2024)
di: Ma, Yuhang, et al.
Pubblicazione: (2024)
MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion
di: Zhan, Zechao, et al.
Pubblicazione: (2024)
di: Zhan, Zechao, et al.
Pubblicazione: (2024)
InstantFamily: Masked Attention for Zero-shot Multi-ID Image Generation
di: Kim, Chanran, et al.
Pubblicazione: (2024)
di: Kim, Chanran, et al.
Pubblicazione: (2024)
Beyond First Impressions: Integrating Joint Multi-modal Cues for Comprehensive 3D Representation
di: Wang, Haowei, et al.
Pubblicazione: (2023)
di: Wang, Haowei, et al.
Pubblicazione: (2023)
3DGS-Enhancer: Enhancing Unbounded 3D Gaussian Splatting with View-consistent 2D Diffusion Priors
di: Liu, Xi, et al.
Pubblicazione: (2024)
di: Liu, Xi, et al.
Pubblicazione: (2024)
EfficientDreamer: High-Fidelity and Robust 3D Creation via Orthogonal-view Diffusion Prior
di: Hu, Zhipeng, et al.
Pubblicazione: (2023)
di: Hu, Zhipeng, et al.
Pubblicazione: (2023)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
di: Zang, Chuanqi, et al.
Pubblicazione: (2024)
DiffusionFace: Towards a Comprehensive Dataset for Diffusion-Based Face Forgery Analysis
di: Chen, Zhongxi, et al.
Pubblicazione: (2024)
di: Chen, Zhongxi, et al.
Pubblicazione: (2024)
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
di: He, Qingdong, et al.
Pubblicazione: (2026)
di: He, Qingdong, et al.
Pubblicazione: (2026)
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
di: Zhou, Ziyin, et al.
Pubblicazione: (2024)
di: Zhou, Ziyin, et al.
Pubblicazione: (2024)
Image Captioning via Dynamic Path Customization
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
di: Ma, Yiwei, et al.
Pubblicazione: (2024)
InstantDrag: Improving Interactivity in Drag-based Image Editing
di: Shin, Joonghyuk, et al.
Pubblicazione: (2024)
di: Shin, Joonghyuk, et al.
Pubblicazione: (2024)
Omni-Referring Image Segmentation
di: Zheng, Qiancheng, et al.
Pubblicazione: (2025)
di: Zheng, Qiancheng, et al.
Pubblicazione: (2025)
Efficient Masked Image Compression with Position-Indexed Self-Attention
di: Dai, Chengjie, et al.
Pubblicazione: (2025)
di: Dai, Chengjie, et al.
Pubblicazione: (2025)
Instant Preference Alignment for Text-to-Image Diffusion Models
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
di: Tang, Zhicong, et al.
Pubblicazione: (2026)
di: Tang, Zhicong, et al.
Pubblicazione: (2026)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
di: Cai, Lingling, et al.
Pubblicazione: (2024)
di: Cai, Lingling, et al.
Pubblicazione: (2024)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
di: He, Qingdong, et al.
Pubblicazione: (2025)
di: He, Qingdong, et al.
Pubblicazione: (2025)
MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
di: Ma, Haoyu, et al.
Pubblicazione: (2023)
MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
di: Zhao, Yang, et al.
Pubblicazione: (2023)
di: Zhao, Yang, et al.
Pubblicazione: (2023)
Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
di: Liu, Bingyan, et al.
Pubblicazione: (2024)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
di: Zhu, Hongyang, et al.
Pubblicazione: (2025)
di: Zhu, Hongyang, et al.
Pubblicazione: (2025)
Diffusion Attention Expert Model for Predicting and Semi-automatic Localizing STAS in Lung Cancer Histopathological Images
di: Pan, Liangrui, et al.
Pubblicazione: (2026)
di: Pan, Liangrui, et al.
Pubblicazione: (2026)
Bezier Splatting for Fast and Differentiable Vector Graphics Rendering
di: Liu, Xi, et al.
Pubblicazione: (2025)
di: Liu, Xi, et al.
Pubblicazione: (2025)
$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation
di: Hu, Jucheng, et al.
Pubblicazione: (2025)
di: Hu, Jucheng, et al.
Pubblicazione: (2025)
Towards Efficient Exemplar Based Image Editing with Multimodal VLMs
di: Jadhav, Avadhoot, et al.
Pubblicazione: (2025)
di: Jadhav, Avadhoot, et al.
Pubblicazione: (2025)
Free-Mask: A Novel Paradigm of Integration Between the Segmentation Diffusion Model and Image Editing
di: Gao, Bo, et al.
Pubblicazione: (2024)
di: Gao, Bo, et al.
Pubblicazione: (2024)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
di: Xiao, Changming, et al.
Pubblicazione: (2023)
di: Xiao, Changming, et al.
Pubblicazione: (2023)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
InstructGIE: Towards Generalizable Image Editing
di: Meng, Zichong, et al.
Pubblicazione: (2024)
di: Meng, Zichong, et al.
Pubblicazione: (2024)
Patch-Based Stochastic Attention for Image Editing
di: Cherel, Nicolas, et al.
Pubblicazione: (2022)
di: Cherel, Nicolas, et al.
Pubblicazione: (2022)
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
di: Xu, Jiayang, et al.
Pubblicazione: (2026)
di: Xu, Jiayang, et al.
Pubblicazione: (2026)
Fast 2DGS: Efficient Image Representation with Deep Gaussian Prior
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation
di: Rao, Zhefan, et al.
Pubblicazione: (2026)
di: Rao, Zhefan, et al.
Pubblicazione: (2026)
InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow
di: Gong, Yiming, et al.
Pubblicazione: (2025)
di: Gong, Yiming, et al.
Pubblicazione: (2025)
EasyCraft: A Robust and Efficient Framework for Automatic Avatar Crafting
di: Wang, Suzhen, et al.
Pubblicazione: (2025)
di: Wang, Suzhen, et al.
Pubblicazione: (2025)
Persistent Story World Simulation with Continuous Character Customization
di: Zhang, Jinlu, et al.
Pubblicazione: (2026)
di: Zhang, Jinlu, et al.
Pubblicazione: (2026)
Diffusion Model-Based Image Editing: A Survey
di: Huang, Yi, et al.
Pubblicazione: (2024)
di: Huang, Yi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StoryWeaver: A Unified World Model for Knowledge-Enhanced Story Character Customization
di: Zhang, Jinlu, et al.
Pubblicazione: (2024) -
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
di: Zhang, Shuheng, et al.
Pubblicazione: (2025) -
Character-Adapter: Prompt-Guided Region Control for High-Fidelity Character Customization
di: Ma, Yuhang, et al.
Pubblicazione: (2024) -
MADiff: Text-Guided Fashion Image Editing with Mask Prediction and Attention-Enhanced Diffusion
di: Zhan, Zechao, et al.
Pubblicazione: (2024) -
InstantFamily: Masked Attention for Zero-shot Multi-ID Image Generation
di: Kim, Chanran, et al.
Pubblicazione: (2024)