Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Binglei, Yang, Mengping, Tan, Zhiyu, Zhang, Junping, Li, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
by: Li, Binglei, et al.
Published: (2026)
by: Li, Binglei, et al.
Published: (2026)
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
by: Wei, Tianyi, et al.
Published: (2024)
by: Wei, Tianyi, et al.
Published: (2024)
AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT
by: Li, Guandong, et al.
Published: (2026)
by: Li, Guandong, et al.
Published: (2026)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
by: Yang, Mengping, et al.
Published: (2026)
by: Yang, Mengping, et al.
Published: (2026)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
by: Shen, Tong, et al.
Published: (2025)
by: Shen, Tong, et al.
Published: (2025)
FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing
by: Wei, Tianyi, et al.
Published: (2025)
by: Wei, Tianyi, et al.
Published: (2025)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
by: Qin, Luozheng, et al.
Published: (2025)
by: Qin, Luozheng, et al.
Published: (2025)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
by: Yang, Xiaomeng, et al.
Published: (2025)
by: Yang, Xiaomeng, et al.
Published: (2025)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
by: Tan, Zhiyu, et al.
Published: (2025)
by: Tan, Zhiyu, et al.
Published: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
by: Qin, Luozheng, et al.
Published: (2025)
by: Qin, Luozheng, et al.
Published: (2025)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
by: Chen, Hesen, et al.
Published: (2025)
by: Chen, Hesen, et al.
Published: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
by: Tan, Zhiyu, et al.
Published: (2025)
by: Tan, Zhiyu, et al.
Published: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement
by: Li, Zilong, et al.
Published: (2026)
by: Li, Zilong, et al.
Published: (2026)
Attention Calibration for Disentangled Text-to-Image Personalization
by: Zhang, Yanbing, et al.
Published: (2024)
by: Zhang, Yanbing, et al.
Published: (2024)
DeltaEdit: Exploring Text-free Training for Text-Driven Image Manipulation
by: Lyu, Yueming, et al.
Published: (2023)
by: Lyu, Yueming, et al.
Published: (2023)
FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers
by: Zhang, Yanbing, et al.
Published: (2025)
by: Zhang, Yanbing, et al.
Published: (2025)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
by: Wang, Yibin, et al.
Published: (2024)
by: Wang, Yibin, et al.
Published: (2024)
InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
by: Xiang, Qiang, et al.
Published: (2025)
by: Xiang, Qiang, et al.
Published: (2025)
MOVi: Training-free Text-conditioned Multi-Object Video Generation
by: Rahman, Aimon, et al.
Published: (2025)
by: Rahman, Aimon, et al.
Published: (2025)
Scribble-Guided Diffusion for Training-free Text-to-Image Generation
by: Lee, Seonho, et al.
Published: (2024)
by: Lee, Seonho, et al.
Published: (2024)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
by: Li, Yanyu, et al.
Published: (2025)
by: Li, Yanyu, et al.
Published: (2025)
PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
by: Margaryan, Hovhannes, et al.
Published: (2025)
by: Margaryan, Hovhannes, et al.
Published: (2025)
StyleSSP: Sampling StartPoint Enhancement for Training-free Diffusion-based Method for Style Transfer
by: Xu, Ruojun, et al.
Published: (2025)
by: Xu, Ruojun, et al.
Published: (2025)
Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation
by: Wang, Junyan, et al.
Published: (2024)
by: Wang, Junyan, et al.
Published: (2024)
Pick-and-Draw: Training-free Semantic Guidance for Text-to-Image Personalization
by: Lv, Henglei, et al.
Published: (2024)
by: Lv, Henglei, et al.
Published: (2024)
Training-free Regional Prompting for Diffusion Transformers
by: Chen, Anthony, et al.
Published: (2024)
by: Chen, Anthony, et al.
Published: (2024)
SuperMark: Robust and Training-free Image Watermarking via Diffusion-based Super-Resolution
by: Hu, Runyi, et al.
Published: (2024)
by: Hu, Runyi, et al.
Published: (2024)
Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models
by: Chen, Chubin, et al.
Published: (2025)
by: Chen, Chubin, et al.
Published: (2025)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
by: Liu, Shengyuan, et al.
Published: (2024)
by: Liu, Shengyuan, et al.
Published: (2024)
Training-free Diffusion Acceleration with Bottleneck Sampling
by: Tian, Ye, et al.
Published: (2025)
by: Tian, Ye, et al.
Published: (2025)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2025)
by: Yu, Li, et al.
Published: (2025)
AGLLDiff: Guiding Diffusion Models Towards Unsupervised Training-free Real-world Low-light Image Enhancement
by: Lin, Yunlong, et al.
Published: (2024)
by: Lin, Yunlong, et al.
Published: (2024)
Adversarial Semantic Augmentation for Training Generative Adversarial Networks under Limited Data
by: Yang, Mengping, et al.
Published: (2025)
by: Yang, Mengping, et al.
Published: (2025)
Image Synthesis under Limited Data: A Survey and Taxonomy
by: Yang, Mengping, et al.
Published: (2023)
by: Yang, Mengping, et al.
Published: (2023)
SPDiffusion: Semantic Protection Diffusion Models for Multi-concept Text-to-image Generation
by: Zhang, Yang, et al.
Published: (2024)
by: Zhang, Yang, et al.
Published: (2024)
Similar Items
-
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
by: Li, Binglei, et al.
Published: (2026) -
Enhancing MMDiT-Based Text-to-Image Models for Similar Subject Generation
by: Wei, Tianyi, et al.
Published: (2024) -
AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT
by: Li, Guandong, et al.
Published: (2026) -
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
by: Yang, Mengping, et al.
Published: (2026) -
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
by: Shen, Tong, et al.
Published: (2025)