Saved in:
| Main Authors: | Gao, Shanghua, Zhou, Pan, Cheng, Ming-Ming, Yan, Shuicheng |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2303.14389 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
by: Wu, Ge, et al.
Published: (2025)
by: Wu, Ge, et al.
Published: (2025)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
by: Bai, Jinbin, et al.
Published: (2024)
by: Bai, Jinbin, et al.
Published: (2024)
PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
by: Li, Zhong-Yu, et al.
Published: (2024)
by: Li, Zhong-Yu, et al.
Published: (2024)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
by: Zhou, Yupeng, et al.
Published: (2024)
by: Zhou, Yupeng, et al.
Published: (2024)
DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
by: Wu, Weijia, et al.
Published: (2023)
by: Wu, Weijia, et al.
Published: (2023)
ITVTON: Virtual Try-On Diffusion Transformer Based on Integrated Image and Text
by: Ni, Haifeng, et al.
Published: (2025)
by: Ni, Haifeng, et al.
Published: (2025)
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
by: Zeng, Quan-Sheng, et al.
Published: (2024)
by: Zeng, Quan-Sheng, et al.
Published: (2024)
RAM++: Robust Representation Learning via Adaptive Mask for All-in-One Image Restoration
by: Zhang, Zilong, et al.
Published: (2025)
by: Zhang, Zilong, et al.
Published: (2025)
MoExtend: Tuning New Experts for Modality and Task Extension
by: Zhong, Shanshan, et al.
Published: (2024)
by: Zhong, Shanshan, et al.
Published: (2024)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
by: Gao, Jin, et al.
Published: (2024)
by: Gao, Jin, et al.
Published: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
by: Fang, Xueji, et al.
Published: (2026)
by: Fang, Xueji, et al.
Published: (2026)
PiCo: Enhancing Text-Image Alignment with Improved Noise Selection and Precise Mask Control in Diffusion Models
by: Xie, Chang, et al.
Published: (2025)
by: Xie, Chang, et al.
Published: (2025)
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
by: Zhan, Wengyi, et al.
Published: (2024)
by: Zhan, Wengyi, et al.
Published: (2024)
Cross-view Masked Diffusion Transformers for Person Image Synthesis
by: Pham, Trung X., et al.
Published: (2024)
by: Pham, Trung X., et al.
Published: (2024)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
by: Huang, Kuan-Chih, et al.
Published: (2024)
by: Huang, Kuan-Chih, et al.
Published: (2024)
QPT V2: Masked Image Modeling Advances Visual Scoring
by: Xie, Qizhi, et al.
Published: (2024)
by: Xie, Qizhi, et al.
Published: (2024)
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
by: Wu, Meihan, et al.
Published: (2024)
by: Wu, Meihan, et al.
Published: (2024)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
by: Qi, Tianhao, et al.
Published: (2025)
by: Qi, Tianhao, et al.
Published: (2025)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
by: Chen, Wenchao, et al.
Published: (2024)
by: Chen, Wenchao, et al.
Published: (2024)
Video Virtual Try-on with Conditional Diffusion Transformer Inpainter
by: Zou, Cheng, et al.
Published: (2025)
by: Zou, Cheng, et al.
Published: (2025)
Contrastive Masked Autoencoders are Stronger Vision Learners
by: Huang, Zhicheng, et al.
Published: (2022)
by: Huang, Zhicheng, et al.
Published: (2022)
Morphing Tokens Draw Strong Masked Image Models
by: Kim, Taekyung, et al.
Published: (2023)
by: Kim, Taekyung, et al.
Published: (2023)
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
by: Zhou, Yupeng, et al.
Published: (2023)
by: Zhou, Yupeng, et al.
Published: (2023)
A Simple Detector with Frame Dynamics is a Strong Tracker
by: Peng, Chenxu, et al.
Published: (2025)
by: Peng, Chenxu, et al.
Published: (2025)
InceptionNeXt: When Inception Meets ConvNeXt
by: Yu, Weihao, et al.
Published: (2023)
by: Yu, Weihao, et al.
Published: (2023)
Frequency Domain-Based Diffusion Model for Unpaired Image Dehazing
by: Liu, Chengxu, et al.
Published: (2025)
by: Liu, Chengxu, et al.
Published: (2025)
MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation
by: Zheng, Longtao, et al.
Published: (2024)
by: Zheng, Longtao, et al.
Published: (2024)
MaTe3D: Mask-guided Text-based 3D-aware Portrait Editing
by: Zhou, Kangneng, et al.
Published: (2023)
by: Zhou, Kangneng, et al.
Published: (2023)
Correlation Matching Transformation Transformers for UHD Image Restoration
by: Wang, Cong, et al.
Published: (2024)
by: Wang, Cong, et al.
Published: (2024)
ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution
by: Wan, Yuhao, et al.
Published: (2024)
by: Wan, Yuhao, et al.
Published: (2024)
ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On
by: Hong, Ji Woo, et al.
Published: (2025)
by: Hong, Ji Woo, et al.
Published: (2025)
Interactive Masked Image Modeling for Multimodal Object Detection in Remote Sensing
by: Vu, Minh-Duc, et al.
Published: (2024)
by: Vu, Minh-Duc, et al.
Published: (2024)
Diffusion-Guided Mask-Consistent Paired Mixing for Endoscopic Image Segmentation
by: Jie, Pengyu, et al.
Published: (2025)
by: Jie, Pengyu, et al.
Published: (2025)
Masked Diffusion as Self-supervised Representation Learner
by: Pan, Zixuan, et al.
Published: (2023)
by: Pan, Zixuan, et al.
Published: (2023)
Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation
by: Zhong, Shanshan, et al.
Published: (2023)
by: Zhong, Shanshan, et al.
Published: (2023)
Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
by: Dai, Gang, et al.
Published: (2025)
by: Dai, Gang, et al.
Published: (2025)
Towards Saner Deep Image Registration
by: Duan, Bin, et al.
Published: (2023)
by: Duan, Bin, et al.
Published: (2023)
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
by: Liu, Baolin, et al.
Published: (2023)
by: Liu, Baolin, et al.
Published: (2023)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
by: Liu, Jinyang, et al.
Published: (2024)
by: Liu, Jinyang, et al.
Published: (2024)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
by: Yang, Zhuoyi, et al.
Published: (2024)
by: Yang, Zhuoyi, et al.
Published: (2024)
Similar Items
-
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
by: Wu, Ge, et al.
Published: (2025) -
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
by: Bai, Jinbin, et al.
Published: (2024) -
PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
by: Li, Zhong-Yu, et al.
Published: (2024) -
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
by: Zhou, Yupeng, et al.
Published: (2024) -
DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
by: Wu, Weijia, et al.
Published: (2023)