DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Mengping, Tan, Zhiyu, Li, Binglei, Yang, Xiaomeng, Chen, Hesen, Li, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
par: Li, Binglei, et autres
Publié: (2026)
par: Li, Binglei, et autres
Publié: (2026)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
par: Li, Binglei, et autres
Publié: (2026)
par: Li, Binglei, et autres
Publié: (2026)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
par: Chen, Hesen, et autres
Publié: (2025)
par: Chen, Hesen, et autres
Publié: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
par: Yang, Xiaomeng, et autres
Publié: (2025)
par: Yang, Xiaomeng, et autres
Publié: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
par: Qin, Luozheng, et autres
Publié: (2025)
par: Qin, Luozheng, et autres
Publié: (2025)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
par: Zhang, Yanbing, et autres
Publié: (2025)
par: Zhang, Yanbing, et autres
Publié: (2025)
StyleDiT: A Unified Framework for Diverse Child and Partner Faces Synthesis with Style Latent Diffusion Transformer
par: Chiu, Pin-Yen, et autres
Publié: (2024)
par: Chiu, Pin-Yen, et autres
Publié: (2024)
ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices
par: Du, Kunpeng, et autres
Publié: (2026)
par: Du, Kunpeng, et autres
Publié: (2026)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
par: Wang, Yibin, et autres
Publié: (2024)
par: Wang, Yibin, et autres
Publié: (2024)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
par: Wang, Lehan, et autres
Publié: (2024)
par: Wang, Lehan, et autres
Publié: (2024)
CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation
par: Gao, Zhanxin, et autres
Publié: (2025)
par: Gao, Zhanxin, et autres
Publié: (2025)
PartFormer: Awakening Latent Diverse Representation from Vision Transformer for Object Re-Identification
par: Tan, Lei, et autres
Publié: (2024)
par: Tan, Lei, et autres
Publié: (2024)
DiverseAR: Boosting Diversity in Bitwise Autoregressive Image Generation
par: Yang, Ying, et autres
Publié: (2025)
par: Yang, Ying, et autres
Publié: (2025)
FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers
par: Chen, Ruichen, et autres
Publié: (2025)
par: Chen, Ruichen, et autres
Publié: (2025)
SparseDiT: Token Sparsification for Efficient Diffusion Transformer
par: Chang, Shuning, et autres
Publié: (2024)
par: Chang, Shuning, et autres
Publié: (2024)
LayoutDiT: Exploring Content-Graphic Balance in Layout Generation with Diffusion Transformer
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
par: Ding, Hangliang, et autres
Publié: (2025)
par: Ding, Hangliang, et autres
Publié: (2025)
Learning to Customize Text-to-Image Diffusion In Diverse Context
par: Kim, Taewook, et autres
Publié: (2024)
par: Kim, Taewook, et autres
Publié: (2024)
DiT-JSCC: Rethinking Deep JSCC with Diffusion Transformers and Semantic Representations
par: Tan, Kailin, et autres
Publié: (2026)
par: Tan, Kailin, et autres
Publié: (2026)
RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation
par: Zhao, Wangbo, et autres
Publié: (2025)
par: Zhao, Wangbo, et autres
Publié: (2025)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Devil is in the Uniformity: Exploring Diverse Learners within Transformer for Image Restoration
par: Zhou, Shihao, et autres
Publié: (2025)
par: Zhou, Shihao, et autres
Publié: (2025)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
par: Zhao, Lin, et autres
Publié: (2026)
par: Zhao, Lin, et autres
Publié: (2026)
DiT4Edit: Diffusion Transformer for Image Editing
par: Feng, Kunyu, et autres
Publié: (2024)
par: Feng, Kunyu, et autres
Publié: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
par: Liu, Yihang, et autres
Publié: (2026)
par: Liu, Yihang, et autres
Publié: (2026)
Diverse and Lifespan Facial Age Transformation Synthesis with Identity Variation Rationality Metric
par: Xie, Jiu-Cheng, et autres
Publié: (2024)
par: Xie, Jiu-Cheng, et autres
Publié: (2024)
Generalized People Diversity: Learning a Human Perception-Aligned Diversity Representation for People Images
par: Srinivasan, Hansa, et autres
Publié: (2024)
par: Srinivasan, Hansa, et autres
Publié: (2024)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
par: Lyu, Hengye, et autres
Publié: (2026)
par: Lyu, Hengye, et autres
Publié: (2026)
Aggregating Diverse Cue Experts for AI-Generated Image Detection
par: Tan, Lei, et autres
Publié: (2026)
par: Tan, Lei, et autres
Publié: (2026)
Deep Diversity-Enhanced Feature Representation of Hyperspectral Images
par: Hou, Jinhui, et autres
Publié: (2023)
par: Hou, Jinhui, et autres
Publié: (2023)
Documents similaires
-
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
par: Li, Binglei, et autres
Publié: (2026) -
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
par: Tan, Zhiyu, et autres
Publié: (2024) -
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
par: Li, Binglei, et autres
Publié: (2026) -
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
par: Chen, Hesen, et autres
Publié: (2025) -
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
par: Yang, Hao, et autres
Publié: (2026)