Diffusion Model with Cross Attention as an Inductive Bias for Disentanglement
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Tao, Lan, Cuiling, Lu, Yan, zheng, Nanning |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Distilling Cross-Modal Knowledge via Feature Disentanglement
by: Liu, Junhong, et al.
Published: (2025)
by: Liu, Junhong, et al.
Published: (2025)
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
by: Chen, Haohan, et al.
Published: (2025)
by: Chen, Haohan, et al.
Published: (2025)
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
by: Yang, Panqi, et al.
Published: (2025)
by: Yang, Panqi, et al.
Published: (2025)
Unmasking Bias in Diffusion Model Training
by: Yu, Hu, et al.
Published: (2023)
by: Yu, Hu, et al.
Published: (2023)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
by: Yan, Xin, et al.
Published: (2024)
by: Yan, Xin, et al.
Published: (2024)
ConceptScope: Characterizing Dataset Bias via Disentangled Visual Concepts
by: Choi, Jinho, et al.
Published: (2025)
by: Choi, Jinho, et al.
Published: (2025)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
by: Yang, Yiming, et al.
Published: (2025)
by: Yang, Yiming, et al.
Published: (2025)
AnimateDiff-Lightning: Cross-Model Diffusion Distillation
by: Lin, Shanchuan, et al.
Published: (2024)
by: Lin, Shanchuan, et al.
Published: (2024)
Structure-Level Disentangled Diffusion for Few-Shot Chinese Font Generation
by: Li, Jie, et al.
Published: (2026)
by: Li, Jie, et al.
Published: (2026)
Rethinking Cross-Layer Information Routing in Diffusion Transformers
by: Xu, Chao, et al.
Published: (2026)
by: Xu, Chao, et al.
Published: (2026)
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
by: Zhu, Lianghui, et al.
Published: (2024)
by: Zhu, Lianghui, et al.
Published: (2024)
CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion
by: Huang, Nisha, et al.
Published: (2024)
by: Huang, Nisha, et al.
Published: (2024)
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis
by: Bi, Tianci, et al.
Published: (2024)
by: Bi, Tianci, et al.
Published: (2024)
BENet: A Cross-domain Robust Network for Detecting Face Forgeries via Bias Expansion and Latent-space Attention
by: Liu, Weihua, et al.
Published: (2024)
by: Liu, Weihua, et al.
Published: (2024)
DecomPose: Disentangling Cross-Category Optimization Contention for Category-Level 6D Object Pose Estimation
by: Gao, Yifan, et al.
Published: (2026)
by: Gao, Yifan, et al.
Published: (2026)
Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods
by: Cho, Wonwoong, et al.
Published: (2023)
by: Cho, Wonwoong, et al.
Published: (2023)
Heat Diffusion Models -- Interpixel Attention Mechanism
by: Zhang, Pengfei, et al.
Published: (2025)
by: Zhang, Pengfei, et al.
Published: (2025)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
by: Liang, Cheng, et al.
Published: (2026)
by: Liang, Cheng, et al.
Published: (2026)
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
by: Wang, Yuhan, et al.
Published: (2025)
by: Wang, Yuhan, et al.
Published: (2025)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
by: Shen, Yichao, et al.
Published: (2025)
by: Shen, Yichao, et al.
Published: (2025)
StarVid: Enhancing Semantic Alignment in Video Diffusion Models via Spatial and SynTactic Guided Attention Refocusing
by: Li, Yuanhang, et al.
Published: (2024)
by: Li, Yuanhang, et al.
Published: (2024)
Cross-Camera Cow Identification via Disentangled Representation Learning
by: Wang, Runcheng, et al.
Published: (2026)
by: Wang, Runcheng, et al.
Published: (2026)
Disentangling Disentangled Representations: Towards Improved Latent Units via Diffusion Models
by: Jun, Youngjun, et al.
Published: (2024)
by: Jun, Youngjun, et al.
Published: (2024)
Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models
by: Ko, Donggeun, et al.
Published: (2024)
by: Ko, Donggeun, et al.
Published: (2024)
Implicit Bias Injection Attacks against Text-to-Image Diffusion Models
by: Huang, Huayang, et al.
Published: (2025)
by: Huang, Huayang, et al.
Published: (2025)
Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models
by: Moon, Saemi, et al.
Published: (2026)
by: Moon, Saemi, et al.
Published: (2026)
Diffusion-Based Cross-Modal Feature Extraction for Multi-Label Classification
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
DICE: Disentangling Artist Style from Content via Contrastive Subspace Decomposition in Diffusion Models
by: Zhang, Tong, et al.
Published: (2026)
by: Zhang, Tong, et al.
Published: (2026)
Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning
by: Wang, Haoyu, et al.
Published: (2026)
by: Wang, Haoyu, et al.
Published: (2026)
Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation
by: Yang, Xiaochen, et al.
Published: (2026)
by: Yang, Xiaochen, et al.
Published: (2026)
Object-level Cross-view Geo-localization with Location Enhancement and Multi-Head Cross Attention
by: Huang, Zheyang, et al.
Published: (2025)
by: Huang, Zheyang, et al.
Published: (2025)
CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition
by: Yu, Ying, et al.
Published: (2025)
by: Yu, Ying, et al.
Published: (2025)
CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention
by: Lin, Gaojie, et al.
Published: (2024)
by: Lin, Gaojie, et al.
Published: (2024)
MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models
by: Yesiltepe, Hidir, et al.
Published: (2024)
by: Yesiltepe, Hidir, et al.
Published: (2024)
Robust Noisy Label Learning via Two-Stream Sample Distillation
by: Bai, Sihan, et al.
Published: (2024)
by: Bai, Sihan, et al.
Published: (2024)
USAD: End-to-End Human Activity Recognition via Diffusion Model with Spatiotemporal Attention
by: Xiao, Hang, et al.
Published: (2025)
by: Xiao, Hang, et al.
Published: (2025)
Fast Sampling Through The Reuse Of Attention Maps In Diffusion Models
by: Hunter, Rosco, et al.
Published: (2023)
by: Hunter, Rosco, et al.
Published: (2023)
Can Diffusion Models Disentangle? A Theoretical Perspective
by: Wang, Liming, et al.
Published: (2025)
by: Wang, Liming, et al.
Published: (2025)
Repairing Catastrophic-Neglect in Text-to-Image Diffusion Models via Attention-Guided Feature Enhancement
by: Chang, Zhiyuan, et al.
Published: (2024)
by: Chang, Zhiyuan, et al.
Published: (2024)
Similar Items
-
Distilling Cross-Modal Knowledge via Feature Disentanglement
by: Liu, Junhong, et al.
Published: (2025) -
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
by: Chen, Haohan, et al.
Published: (2025) -
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model
by: Liu, Kangwei, et al.
Published: (2025) -
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
by: Yang, Panqi, et al.
Published: (2025) -
Unmasking Bias in Diffusion Model Training
by: Yu, Hu, et al.
Published: (2023)