Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Yushe, Shi, Dianxi, Fu, Xing, Zou, Xuechao, Peng, Haikuo, Li, Xueqi, Yu, Chun, Xing, Junliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
por: Zou, Xuechao, et al.
Publicado: (2025)
por: Zou, Xuechao, et al.
Publicado: (2025)
High-Fidelity Lake Extraction via Two-Stage Prompt Enhancement: Establishing a Novel Baseline and Benchmark
por: Chen, Ben, et al.
Publicado: (2023)
por: Chen, Ben, et al.
Publicado: (2023)
A Parallel Attention Network for Cattle Face Recognition
por: Li, Jiayu, et al.
Publicado: (2024)
por: Li, Jiayu, et al.
Publicado: (2024)
UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
por: Li, Lulin, et al.
Publicado: (2024)
por: Li, Lulin, et al.
Publicado: (2024)
LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery
por: Chen, Ben, et al.
Publicado: (2023)
por: Chen, Ben, et al.
Publicado: (2023)
ARFA: An Asymmetric Receptive Field Autoencoder Model for Spatiotemporal Prediction
por: Zhang, Wenxuan, et al.
Publicado: (2023)
por: Zhang, Wenxuan, et al.
Publicado: (2023)
Hierarchical Fusion of Local and Global Visual Features with Mixture-of-Experts for Remote Sensing Image Scene Classification
por: Tang, Yuanhao, et al.
Publicado: (2025)
por: Tang, Yuanhao, et al.
Publicado: (2025)
DeCoDe: Defer-and-Complement Decision-Making via Decoupled Concept Bottleneck Models
por: He, Chengbo, et al.
Publicado: (2025)
por: He, Chengbo, et al.
Publicado: (2025)
MDiffFR: Modality-Guided Diffusion Generation for Cold-start Items in Federated Recommendation
por: Fu, Kang, et al.
Publicado: (2025)
por: Fu, Kang, et al.
Publicado: (2025)
CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
por: Yang, Mingyue, et al.
Publicado: (2025)
por: Yang, Mingyue, et al.
Publicado: (2025)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
por: Li, Lijiang, et al.
Publicado: (2026)
por: Li, Lijiang, et al.
Publicado: (2026)
Adapting Vision Foundation Models for Robust Cloud Segmentation in Remote Sensing Images
por: Zou, Xuechao, et al.
Publicado: (2024)
por: Zou, Xuechao, et al.
Publicado: (2024)
Dynamic Dictionary Learning for Remote Sensing Image Segmentation
por: Zou, Xuechao, et al.
Publicado: (2025)
por: Zou, Xuechao, et al.
Publicado: (2025)
Enhancing LLM Reasoning with Multi-Path Collaborative Reactive and Reflection agents
por: He, Chengbo, et al.
Publicado: (2024)
por: He, Chengbo, et al.
Publicado: (2024)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
por: Kang, Wonjun, et al.
Publicado: (2025)
por: Kang, Wonjun, et al.
Publicado: (2025)
Masked Diffusion Generative Recommendation
por: Mu, Lingyu, et al.
Publicado: (2026)
por: Mu, Lingyu, et al.
Publicado: (2026)
CA-Edit: Causality-Aware Condition Adapter for High-Fidelity Local Facial Attribute Editing
por: Xian, Xiaole, et al.
Publicado: (2024)
por: Xian, Xiaole, et al.
Publicado: (2024)
High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model
por: Guo, Mingtao, et al.
Publicado: (2025)
por: Guo, Mingtao, et al.
Publicado: (2025)
Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation
por: Dai, Dawei, et al.
Publicado: (2025)
por: Dai, Dawei, et al.
Publicado: (2025)
FundusGAN: A Hierarchical Feature-Aware Generative Framework for High-Fidelity Fundus Image Generation
por: Hou, Qingshan, et al.
Publicado: (2025)
por: Hou, Qingshan, et al.
Publicado: (2025)
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning
por: He, Dailan, et al.
Publicado: (2025)
por: He, Dailan, et al.
Publicado: (2025)
Nonlinear Optical Second Harmonic Generation Characteristics in Cylindrical GaAs/Ga1–ηAlηAs Quantum Dots
por: Xiaolong Yan, et al.
Publicado: (2024)
por: Xiaolong Yan, et al.
Publicado: (2024)
Domain Adaptive Attention Learning for Unsupervised Person Re-Identification
por: Huang, Yangru, et al.
Publicado: (2019)
por: Huang, Yangru, et al.
Publicado: (2019)
MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and Editing
por: Zhao, Haoyu, et al.
Publicado: (2023)
por: Zhao, Haoyu, et al.
Publicado: (2023)
GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data
por: Li, Yudong, et al.
Publicado: (2025)
por: Li, Yudong, et al.
Publicado: (2025)
Text-Conditioned Diffusion Model for High-Fidelity Korean Font Generation
por: Sami, Abdul, et al.
Publicado: (2025)
por: Sami, Abdul, et al.
Publicado: (2025)
Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model
por: Guo, Mingtao, et al.
Publicado: (2025)
por: Guo, Mingtao, et al.
Publicado: (2025)
PACT: Proactive Asking for Continual Task Assistance in Human-Robot Collaboration
por: He, Chengbo, et al.
Publicado: (2026)
por: He, Chengbo, et al.
Publicado: (2026)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
por: Shao, Haikuo, et al.
Publicado: (2024)
por: Shao, Haikuo, et al.
Publicado: (2024)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
por: Chung, HaeChun
Publicado: (2025)
por: Chung, HaeChun
Publicado: (2025)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
por: Shi, Huihong, et al.
Publicado: (2024)
por: Shi, Huihong, et al.
Publicado: (2024)
Unifying and Enhancing Graph Transformers via a Hierarchical Mask Framework
por: Xing, Yujie, et al.
Publicado: (2025)
por: Xing, Yujie, et al.
Publicado: (2025)
MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning
por: Wu, Cuiling, et al.
Publicado: (2025)
por: Wu, Cuiling, et al.
Publicado: (2025)
LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba
por: Fu, Yunxiang, et al.
Publicado: (2024)
por: Fu, Yunxiang, et al.
Publicado: (2024)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
por: Xiao, Changming, et al.
Publicado: (2023)
por: Xiao, Changming, et al.
Publicado: (2023)
FreEformer: Frequency Enhanced Transformer for Multivariate Time Series Forecasting
por: Yue, Wenzhen, et al.
Publicado: (2025)
por: Yue, Wenzhen, et al.
Publicado: (2025)
Emotic Masked Autoencoder with Attention Fusion for Facial Expression Recognition
por: Nguyen-Xuan, Bach, et al.
Publicado: (2024)
por: Nguyen-Xuan, Bach, et al.
Publicado: (2024)
Multivariate Fidelities
por: Nuradha, Theshani, et al.
Publicado: (2024)
por: Nuradha, Theshani, et al.
Publicado: (2024)
High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer
por: Zheng, Shen, et al.
Publicado: (2025)
por: Zheng, Shen, et al.
Publicado: (2025)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
por: Yao, Ziyu, et al.
Publicado: (2024)
por: Yao, Ziyu, et al.
Publicado: (2024)
Ejemplares similares
-
Mixture of Global and Local Experts with Diffusion Transformer for Controllable Face Generation
por: Zou, Xuechao, et al.
Publicado: (2025) -
High-Fidelity Lake Extraction via Two-Stage Prompt Enhancement: Establishing a Novel Baseline and Benchmark
por: Chen, Ben, et al.
Publicado: (2023) -
A Parallel Attention Network for Cattle Face Recognition
por: Li, Jiayu, et al.
Publicado: (2024) -
UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
por: Li, Lulin, et al.
Publicado: (2024) -
LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery
por: Chen, Ben, et al.
Publicado: (2023)