Group Diffusion Transformers are Unsupervised Multitask Learners
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Lianghua, Wang, Wei, Wu, Zhi-Fan, Dou, Huanzhang, Shi, Yupeng, Feng, Yutong, Liang, Chen, Liu, Yu, Zhou, Jingren |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
IDEA-Bench: How Far are Generative Models from Professional Designing?
by: Liang, Chen, et al.
Published: (2024)
by: Liang, Chen, et al.
Published: (2024)
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
by: Dou, Huanzhang, et al.
Published: (2024)
by: Dou, Huanzhang, et al.
Published: (2024)
Lipschitz Singularities in Diffusion Models
by: Yang, Zhantao, et al.
Published: (2023)
by: Yang, Zhantao, et al.
Published: (2023)
Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following
by: Feng, Yutong, et al.
Published: (2023)
by: Feng, Yutong, et al.
Published: (2023)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
by: Su, Wei, et al.
Published: (2024)
by: Su, Wei, et al.
Published: (2024)
Video Diffusion Transformers are In-Context Learners
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
FlashFace: Human Image Personalization with High-fidelity Identity Preservation
by: Zhang, Shilong, et al.
Published: (2024)
by: Zhang, Shilong, et al.
Published: (2024)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
by: Zhou, Yupeng, et al.
Published: (2026)
by: Zhou, Yupeng, et al.
Published: (2026)
SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation
by: Yuan, Yike, et al.
Published: (2024)
by: Yuan, Yike, et al.
Published: (2024)
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
by: Zhang, Wenhu, et al.
Published: (2026)
by: Zhang, Wenhu, et al.
Published: (2026)
CLASH: Complementary Learning with Neural Architecture Search for Gait Recognition
by: Dou, Huanzhang, et al.
Published: (2024)
by: Dou, Huanzhang, et al.
Published: (2024)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
EgoM2P: Egocentric Multimodal Multitask Pretraining
by: Li, Gen, et al.
Published: (2025)
by: Li, Gen, et al.
Published: (2025)
Unsupervised Anomaly Detection via Masked Diffusion Posterior Sampling
by: Wu, Di, et al.
Published: (2024)
by: Wu, Di, et al.
Published: (2024)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
by: Ren, Sucheng, et al.
Published: (2025)
by: Ren, Sucheng, et al.
Published: (2025)
Devil is in the Uniformity: Exploring Diverse Learners within Transformer for Image Restoration
by: Zhou, Shihao, et al.
Published: (2025)
by: Zhou, Shihao, et al.
Published: (2025)
Masked Diffusion as Self-supervised Representation Learner
by: Pan, Zixuan, et al.
Published: (2023)
by: Pan, Zixuan, et al.
Published: (2023)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
by: Zhang, Yupeng, et al.
Published: (2025)
by: Zhang, Yupeng, et al.
Published: (2025)
Vision Transformers are Circulant Attention Learners
by: Han, Dongchen, et al.
Published: (2025)
by: Han, Dongchen, et al.
Published: (2025)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
by: Zhou, Yupeng, et al.
Published: (2024)
by: Zhou, Yupeng, et al.
Published: (2024)
Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation
by: Xia, Ruihao, et al.
Published: (2024)
by: Xia, Ruihao, et al.
Published: (2024)
ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer
by: Han, Zhen, et al.
Published: (2024)
by: Han, Zhen, et al.
Published: (2024)
Efficient Inter-Task Attention for Multitask Transformer Models
by: Bohn, Christian, et al.
Published: (2025)
by: Bohn, Christian, et al.
Published: (2025)
Scaling Diffusion Transformers to 16 Billion Parameters
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
MLP Can Be A Good Transformer Learner
by: Lin, Sihao, et al.
Published: (2024)
by: Lin, Sihao, et al.
Published: (2024)
Dimba: Transformer-Mamba Diffusion Models
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
Prototypical Transformer as Unified Motion Learners
by: Han, Cheng, et al.
Published: (2024)
by: Han, Cheng, et al.
Published: (2024)
Fine-Grained Zero-Shot Learning: Advances, Challenges, and Prospects
by: Guo, Jingcai, et al.
Published: (2024)
by: Guo, Jingcai, et al.
Published: (2024)
Transformer-based Multimodal Change Detection with Multitask Consistency Constraints
by: Liu, Biyuan, et al.
Published: (2023)
by: Liu, Biyuan, et al.
Published: (2023)
Causal Diffusion Transformers for Generative Modeling
by: Deng, Chaorui, et al.
Published: (2024)
by: Deng, Chaorui, et al.
Published: (2024)
Few-shot Learner Parameterization by Diffusion Time-steps
by: Yue, Zhongqi, et al.
Published: (2024)
by: Yue, Zhongqi, et al.
Published: (2024)
Learning Streaming Video Representation via Multitask Training
by: Yan, Yibin, et al.
Published: (2025)
by: Yan, Yibin, et al.
Published: (2025)
Hierarchical Salient Patch Identification for Interpretable Fundus Disease Localization
by: Peng, Yitao, et al.
Published: (2024)
by: Peng, Yitao, et al.
Published: (2024)
ProtoSolo: Interpretable Image Classification via Single-Prototype Activation
by: Peng, Yitao, et al.
Published: (2025)
by: Peng, Yitao, et al.
Published: (2025)
Diffusion Model as a Generalist Segmentation Learner
by: Wang, Haoxiao, et al.
Published: (2026)
by: Wang, Haoxiao, et al.
Published: (2026)
SkyReels-A2: Compose Anything in Video Diffusion Transformers
by: Fei, Zhengcong, et al.
Published: (2025)
by: Fei, Zhengcong, et al.
Published: (2025)
Pose Prior Learner: Unsupervised Categorical Prior Learning for Pose Estimation
by: Wang, Ziyu, et al.
Published: (2024)
by: Wang, Ziyu, et al.
Published: (2024)
Similar Items
-
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024) -
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024) -
IDEA-Bench: How Far are Generative Models from Professional Designing?
by: Liang, Chen, et al.
Published: (2024) -
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
by: Dou, Huanzhang, et al.
Published: (2024) -
Lipschitz Singularities in Diffusion Models
by: Yang, Zhantao, et al.
Published: (2023)