Cross-view Masked Diffusion Transformers for Person Image Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Pham, Trung X., Kang, Zhang, Yoo, Chang D. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On
di: Hong, Ji Woo, et al.
Pubblicazione: (2025)
di: Hong, Ji Woo, et al.
Pubblicazione: (2025)
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
di: Pham, Trung X., et al.
Pubblicazione: (2024)
di: Pham, Trung X., et al.
Pubblicazione: (2024)
A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers
di: Pham, Trung X., et al.
Pubblicazione: (2026)
di: Pham, Trung X., et al.
Pubblicazione: (2026)
E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization
di: Pham, Trung X., et al.
Pubblicazione: (2025)
di: Pham, Trung X., et al.
Pubblicazione: (2025)
Geometry-guided Cross-view Diffusion for One-to-many Cross-view Image Synthesis
di: Lin, Tao Jun, et al.
Pubblicazione: (2024)
di: Lin, Tao Jun, et al.
Pubblicazione: (2024)
MFP-VTON: Enhancing Mask-Free Person-to-Person Virtual Try-On via Diffusion Transformer
di: Shen, Le, et al.
Pubblicazione: (2025)
di: Shen, Le, et al.
Pubblicazione: (2025)
FLAME Diffuser: Wildfire Image Synthesis using Mask Guided Diffusion
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Wavelet-Guided Acceleration of Text Inversion in Diffusion-Based Image Editing
di: Koo, Gwanhyeong, et al.
Pubblicazione: (2024)
di: Koo, Gwanhyeong, et al.
Pubblicazione: (2024)
Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
di: Zhang, Yancheng, et al.
Pubblicazione: (2026)
di: Zhang, Yancheng, et al.
Pubblicazione: (2026)
Multi-focal Conditioned Latent Diffusion for Person Image Synthesis
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
Retrieval-guided Cross-view Image Synthesis
di: Yang, Hongji, et al.
Pubblicazione: (2024)
di: Yang, Hongji, et al.
Pubblicazione: (2024)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
di: Gao, Shanghua, et al.
Pubblicazione: (2023)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
di: Xie, Liping, et al.
Pubblicazione: (2025)
di: Xie, Liping, et al.
Pubblicazione: (2025)
TPC: Test-time Procrustes Calibration for Diffusion-based Human Image Animation
di: Yoon, Sunjae, et al.
Pubblicazione: (2024)
di: Yoon, Sunjae, et al.
Pubblicazione: (2024)
IIDM: Image-to-Image Diffusion Model for Semantic Image Synthesis
di: Liu, Feng, et al.
Pubblicazione: (2024)
di: Liu, Feng, et al.
Pubblicazione: (2024)
Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image Synthesis
di: Lu, Yanzuo, et al.
Pubblicazione: (2024)
di: Lu, Yanzuo, et al.
Pubblicazione: (2024)
View-aware Cross-modal Distillation for Multi-view Action Recognition
di: Nguyen, Trung Thanh, et al.
Pubblicazione: (2025)
di: Nguyen, Trung Thanh, et al.
Pubblicazione: (2025)
Fine Tuning Text-to-Image Diffusion Models for Correcting Anomalous Images
di: Yoo, Hyunwoo
Pubblicazione: (2024)
di: Yoo, Hyunwoo
Pubblicazione: (2024)
Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction
di: Kilian, Maciej, et al.
Pubblicazione: (2024)
di: Kilian, Maciej, et al.
Pubblicazione: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
di: Fang, Xueji, et al.
Pubblicazione: (2026)
di: Fang, Xueji, et al.
Pubblicazione: (2026)
Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts
di: Nguyen, Viet, et al.
Pubblicazione: (2024)
di: Nguyen, Viet, et al.
Pubblicazione: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
MaskDiff: Modeling Mask Distribution with Diffusion Probabilistic Model for Few-Shot Instance Segmentation
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
di: Le, Minh-Quan, et al.
Pubblicazione: (2023)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
VICI: VLM-Instructed Cross-view Image-localisation
di: Zhang, Xiaohan, et al.
Pubblicazione: (2025)
di: Zhang, Xiaohan, et al.
Pubblicazione: (2025)
Cross-view Localization and Synthesis -- Datasets, Challenges and Opportunities
di: Xu, Ningli, et al.
Pubblicazione: (2025)
di: Xu, Ningli, et al.
Pubblicazione: (2025)
Cross-View Meets Diffusion: Aerial Image Synthesis with Geometry and Text Guidance
di: Arrabi, Ahmad, et al.
Pubblicazione: (2024)
di: Arrabi, Ahmad, et al.
Pubblicazione: (2024)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
A Survey on Personalized Content Synthesis with Diffusion Models
di: Zhang, Xulu, et al.
Pubblicazione: (2024)
di: Zhang, Xulu, et al.
Pubblicazione: (2024)
Learning Mask Invariant Mutual Information for Masked Image Modeling
di: Huang, Tao, et al.
Pubblicazione: (2025)
di: Huang, Tao, et al.
Pubblicazione: (2025)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
di: Xie, Enze, et al.
Pubblicazione: (2024)
di: Xie, Enze, et al.
Pubblicazione: (2024)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
Generative Active Learning for Image Synthesis Personalization
di: Zhang, Xulu, et al.
Pubblicazione: (2024)
di: Zhang, Xulu, et al.
Pubblicazione: (2024)
Halton Scheduler For Masked Generative Image Transformer
di: Besnier, Victor, et al.
Pubblicazione: (2025)
di: Besnier, Victor, et al.
Pubblicazione: (2025)
PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-Guidance
di: Liu, Aoming, et al.
Pubblicazione: (2024)
di: Liu, Aoming, et al.
Pubblicazione: (2024)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
di: Chen, Wenchao, et al.
Pubblicazione: (2024)
di: Chen, Wenchao, et al.
Pubblicazione: (2024)
Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis
di: Lee, Jonghyun, et al.
Pubblicazione: (2024)
di: Lee, Jonghyun, et al.
Pubblicazione: (2024)
Personalize Anything for Free with Diffusion Transformer
di: Feng, Haoran, et al.
Pubblicazione: (2025)
di: Feng, Haoran, et al.
Pubblicazione: (2025)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
PAFormer: Part Aware Transformer for Person Re-identification
di: Jung, Hyeono, et al.
Pubblicazione: (2024)
di: Jung, Hyeono, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On
di: Hong, Ji Woo, et al.
Pubblicazione: (2025) -
MDSGen: Fast and Efficient Masked Diffusion Temporal-Aware Transformers for Open-Domain Sound Generation
di: Pham, Trung X., et al.
Pubblicazione: (2024) -
A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers
di: Pham, Trung X., et al.
Pubblicazione: (2026) -
E-MD3C: Taming Masked Diffusion Transformers for Efficient Zero-Shot Object Customization
di: Pham, Trung X., et al.
Pubblicazione: (2025) -
Geometry-guided Cross-view Diffusion for One-to-many Cross-view Image Synthesis
di: Lin, Tao Jun, et al.
Pubblicazione: (2024)