Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Jia, Mengni, Zhou, Mengyu, Liu, Yihao, Jiang, Xiaoxi, Jiang, Guanjun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
by: Ye, Mengyu, et al.
Published: (2026)
by: Ye, Mengyu, et al.
Published: (2026)
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
by: Zhu, Fengqi, et al.
Published: (2025)
by: Zhu, Fengqi, et al.
Published: (2025)
Variance-Aware Adaptive Weighting for Diffusion Model Training
by: Sun, Nanlong, et al.
Published: (2026)
by: Sun, Nanlong, et al.
Published: (2026)
On the Trainability of Masked Diffusion Language Models via Blockwise Locality
by: Wang, Yuxiang, et al.
Published: (2026)
by: Wang, Yuxiang, et al.
Published: (2026)
Training-Free Self-Correction for Multimodal Masked Diffusion Models
by: Ouyang, Yidong, et al.
Published: (2026)
by: Ouyang, Yidong, et al.
Published: (2026)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
by: Miao, Yanting, et al.
Published: (2026)
by: Miao, Yanting, et al.
Published: (2026)
MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
by: He, Haoyu, et al.
Published: (2025)
by: He, Haoyu, et al.
Published: (2025)
LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models
by: Wei, Chenxing, et al.
Published: (2026)
by: Wei, Chenxing, et al.
Published: (2026)
DecompDiff: Diffusion Models with Decomposed Priors for Structure-Based Drug Design
by: Guan, Jiaqi, et al.
Published: (2024)
by: Guan, Jiaqi, et al.
Published: (2024)
Stop Training for the Worst: Progressive Unmasking Accelerates Masked Diffusion Training
by: Kim, Jaeyeon, et al.
Published: (2026)
by: Kim, Jaeyeon, et al.
Published: (2026)
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
by: Chen, Ziyu, et al.
Published: (2025)
by: Chen, Ziyu, et al.
Published: (2025)
Fast Training of Diffusion Models with Masked Transformers
by: Zheng, Hongkai, et al.
Published: (2023)
by: Zheng, Hongkai, et al.
Published: (2023)
Understanding and Accelerating the Training of Masked Diffusion Language Models
by: Hong, Chunsan, et al.
Published: (2026)
by: Hong, Chunsan, et al.
Published: (2026)
DecompOpt: Controllable and Decomposed Diffusion Models for Structure-based Molecular Optimization
by: Zhou, Xiangxin, et al.
Published: (2024)
by: Zhou, Xiangxin, et al.
Published: (2024)
Mask Is What DLLM Needs: A Masked Data Training Paradigm for Diffusion LLMs
by: Ma, Linrui, et al.
Published: (2026)
by: Ma, Linrui, et al.
Published: (2026)
Auto-Regressive Masked Diffusion Models
by: Karami, Mahdi, et al.
Published: (2026)
by: Karami, Mahdi, et al.
Published: (2026)
Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
by: Xu, Shifeng, et al.
Published: (2025)
by: Xu, Shifeng, et al.
Published: (2025)
Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions
by: Kim, Jaeyeon, et al.
Published: (2025)
by: Kim, Jaeyeon, et al.
Published: (2025)
Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking
by: Chao, Chen-Hao, et al.
Published: (2025)
by: Chao, Chen-Hao, et al.
Published: (2025)
Optimal Inference Schedules for Masked Diffusion Models
by: Chen, Sitan, et al.
Published: (2025)
by: Chen, Sitan, et al.
Published: (2025)
Sharp Convergence Rates for Masked Diffusion Models
by: Liang, Yuchen, et al.
Published: (2026)
by: Liang, Yuchen, et al.
Published: (2026)
Stability and Generalization of Adversarial Diffusion Training
by: Hosseini, Hesam, et al.
Published: (2025)
by: Hosseini, Hesam, et al.
Published: (2025)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
by: Oba, Daisuke, et al.
Published: (2026)
by: Oba, Daisuke, et al.
Published: (2026)
Scaling Beyond Masked Diffusion Language Models
by: Sahoo, Subham Sekhar, et al.
Published: (2026)
by: Sahoo, Subham Sekhar, et al.
Published: (2026)
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
by: Zhou, Xueyu, et al.
Published: (2026)
by: Zhou, Xueyu, et al.
Published: (2026)
Backdooring Masked Diffusion Language Models
by: Cao, Daniel Yiming, et al.
Published: (2026)
by: Cao, Daniel Yiming, et al.
Published: (2026)
Masked Diffusion Modeling for Anomaly Detection
by: Zhang, Lixing, et al.
Published: (2026)
by: Zhang, Lixing, et al.
Published: (2026)
Self-Speculative Masked Diffusions
by: Campbell, Andrew, et al.
Published: (2025)
by: Campbell, Andrew, et al.
Published: (2025)
Variational Masked Diffusion Models
by: Zhang, Yichi, et al.
Published: (2025)
by: Zhang, Yichi, et al.
Published: (2025)
Disentangling Total-Variance and Signal-to-Noise-Ratio Improves Diffusion Models
by: Kahouli, Khaled, et al.
Published: (2025)
by: Kahouli, Khaled, et al.
Published: (2025)
SliderSpace: Decomposing the Visual Capabilities of Diffusion Models
by: Gandikota, Rohit, et al.
Published: (2025)
by: Gandikota, Rohit, et al.
Published: (2025)
No Compute Left Behind: Rethinking Reasoning and Sampling with Masked Diffusion Models
by: Horvitz, Zachary, et al.
Published: (2025)
by: Horvitz, Zachary, et al.
Published: (2025)
A Decomposable Forward Process in Diffusion Models for Time-Series Forecasting
by: Caldas, Francisco, et al.
Published: (2026)
by: Caldas, Francisco, et al.
Published: (2026)
The Design Space of Tri-Modal Masked Diffusion Models
by: Bethune, Louis, et al.
Published: (2026)
by: Bethune, Louis, et al.
Published: (2026)
BatteryBERT for Realistic Battery Fault Detection Using Point-Masked Signal Modeling
by: Zhou, Songqi, et al.
Published: (2025)
by: Zhou, Songqi, et al.
Published: (2025)
DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models
by: Goyal, Satyam, et al.
Published: (2026)
by: Goyal, Satyam, et al.
Published: (2026)
Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
by: Garg, Prateek, et al.
Published: (2025)
by: Garg, Prateek, et al.
Published: (2025)
Revealing the Attention Floating Mechanism in Masked Diffusion Models
by: Dai, Xin, et al.
Published: (2026)
by: Dai, Xin, et al.
Published: (2026)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
by: Li, Zhuo, et al.
Published: (2025)
by: Li, Zhuo, et al.
Published: (2025)
On the Generalization Properties of Diffusion Models
by: Li, Puheng, et al.
Published: (2023)
by: Li, Puheng, et al.
Published: (2023)
Similar Items
-
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
by: Ye, Mengyu, et al.
Published: (2026) -
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
by: Zhu, Fengqi, et al.
Published: (2025) -
Variance-Aware Adaptive Weighting for Diffusion Model Training
by: Sun, Nanlong, et al.
Published: (2026) -
On the Trainability of Masked Diffusion Language Models via Blockwise Locality
by: Wang, Yuxiang, et al.
Published: (2026) -
Training-Free Self-Correction for Multimodal Masked Diffusion Models
by: Ouyang, Yidong, et al.
Published: (2026)