MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Haoyu, Renz, Katrin, Cao, Yong, Geiger, Andreas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation
por: von Rad, Jonathan, et al.
Publicado: (2026)
por: von Rad, Jonathan, et al.
Publicado: (2026)
MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning
por: Lin, Yunze
Publicado: (2025)
por: Lin, Yunze
Publicado: (2025)
Optimal Inference Schedules for Masked Diffusion Models
por: Chen, Sitan, et al.
Publicado: (2025)
por: Chen, Sitan, et al.
Publicado: (2025)
Backdooring Masked Diffusion Language Models
por: Cao, Daniel Yiming, et al.
Publicado: (2026)
por: Cao, Daniel Yiming, et al.
Publicado: (2026)
HDT: Hierarchical Document Transformer
por: He, Haoyu, et al.
Publicado: (2024)
por: He, Haoyu, et al.
Publicado: (2024)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
por: Ye, Mengyu, et al.
Publicado: (2026)
por: Ye, Mengyu, et al.
Publicado: (2026)
Understanding and Accelerating the Training of Masked Diffusion Language Models
por: Hong, Chunsan, et al.
Publicado: (2026)
por: Hong, Chunsan, et al.
Publicado: (2026)
KLASS: KL-Guided Fast Inference in Masked Diffusion Models
por: Kim, Seo Hyun, et al.
Publicado: (2025)
por: Kim, Seo Hyun, et al.
Publicado: (2025)
ILRR: Inference-Time Steering Method for Masked Diffusion Language Models
por: Avrahami, Eden, et al.
Publicado: (2026)
por: Avrahami, Eden, et al.
Publicado: (2026)
Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
por: Jia, Mengni, et al.
Publicado: (2025)
por: Jia, Mengni, et al.
Publicado: (2025)
Training-Free Self-Correction for Multimodal Masked Diffusion Models
por: Ouyang, Yidong, et al.
Publicado: (2026)
por: Ouyang, Yidong, et al.
Publicado: (2026)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
por: Arriola, Marianne, et al.
Publicado: (2025)
por: Arriola, Marianne, et al.
Publicado: (2025)
Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
por: Padole, Tejomay Kishor, et al.
Publicado: (2025)
por: Padole, Tejomay Kishor, et al.
Publicado: (2025)
Learning Generation Orders for Masked Discrete Diffusion Models via Variational Inference
por: Fox, David, et al.
Publicado: (2026)
por: Fox, David, et al.
Publicado: (2026)
Stop Training for the Worst: Progressive Unmasking Accelerates Masked Diffusion Training
por: Kim, Jaeyeon, et al.
Publicado: (2026)
por: Kim, Jaeyeon, et al.
Publicado: (2026)
Diffusion Generative Modelling for Divide-and-Conquer MCMC
por: Trojan, C., et al.
Publicado: (2024)
por: Trojan, C., et al.
Publicado: (2024)
Mask Is What DLLM Needs: A Masked Data Training Paradigm for Diffusion LLMs
por: Ma, Linrui, et al.
Publicado: (2026)
por: Ma, Linrui, et al.
Publicado: (2026)
Can Vehicle Motion Planning Generalize to Realistic Long-tail Scenarios?
por: Hallgarten, Marcel, et al.
Publicado: (2024)
por: Hallgarten, Marcel, et al.
Publicado: (2024)
Scaling Beyond Masked Diffusion Language Models
por: Sahoo, Subham Sekhar, et al.
Publicado: (2026)
por: Sahoo, Subham Sekhar, et al.
Publicado: (2026)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
por: Piskorz, Julianna, et al.
Publicado: (2025)
por: Piskorz, Julianna, et al.
Publicado: (2025)
Faithfulness Measurable Masked Language Models
por: Madsen, Andreas, et al.
Publicado: (2023)
por: Madsen, Andreas, et al.
Publicado: (2023)
Soft-Masked Diffusion Language Models
por: Hersche, Michael, et al.
Publicado: (2025)
por: Hersche, Michael, et al.
Publicado: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
por: Zhao, Bowen, et al.
Publicado: (2024)
por: Zhao, Bowen, et al.
Publicado: (2024)
Fast Training of Diffusion Models with Masked Transformers
por: Zheng, Hongkai, et al.
Publicado: (2023)
por: Zheng, Hongkai, et al.
Publicado: (2023)
Understanding Post-Training Structural Changes in Large Language Models
por: He, Xinyu, et al.
Publicado: (2025)
por: He, Xinyu, et al.
Publicado: (2025)
What Exactly Does Guidance Do in Masked Discrete Diffusion Models
por: Ye, He, et al.
Publicado: (2025)
por: Ye, He, et al.
Publicado: (2025)
Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models
por: Luo, Ziwei, et al.
Publicado: (2026)
por: Luo, Ziwei, et al.
Publicado: (2026)
Overcoming Selection Bias in Statistical Studies With Amortized Bayesian Inference
por: Arruda, Jonas, et al.
Publicado: (2026)
por: Arruda, Jonas, et al.
Publicado: (2026)
On the Reasoning Abilities of Masked Diffusion Language Models
por: Svete, Anej, et al.
Publicado: (2025)
por: Svete, Anej, et al.
Publicado: (2025)
Simple and Effective Masked Diffusion Language Models
por: Sahoo, Subham Sekhar, et al.
Publicado: (2024)
por: Sahoo, Subham Sekhar, et al.
Publicado: (2024)
PlanT 2.0: Exposing Biases and Structural Flaws in Closed-Loop Driving
por: Gerstenecker, Simon, et al.
Publicado: (2025)
por: Gerstenecker, Simon, et al.
Publicado: (2025)
Fail2Drive: Benchmarking Closed-Loop Driving Generalization
por: Gerstenecker, Simon, et al.
Publicado: (2026)
por: Gerstenecker, Simon, et al.
Publicado: (2026)
An Examination on the Effectiveness of Divide-and-Conquer Prompting in Large Language Models
por: Zhang, Yizhou, et al.
Publicado: (2024)
por: Zhang, Yizhou, et al.
Publicado: (2024)
Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions
por: Kim, Jaeyeon, et al.
Publicado: (2025)
por: Kim, Jaeyeon, et al.
Publicado: (2025)
Auto-Regressive Masked Diffusion Models
por: Karami, Mahdi, et al.
Publicado: (2026)
por: Karami, Mahdi, et al.
Publicado: (2026)
Beyond Masked and Unmasked: Discrete Diffusion Models via Partial Masking
por: Chao, Chen-Hao, et al.
Publicado: (2025)
por: Chao, Chen-Hao, et al.
Publicado: (2025)
Pre-Training Graph Contrastive Masked Autoencoders are Strong Distillers for EEG
por: Wei, Xinxu, et al.
Publicado: (2024)
por: Wei, Xinxu, et al.
Publicado: (2024)
On the Trainability of Masked Diffusion Language Models via Blockwise Locality
por: Wang, Yuxiang, et al.
Publicado: (2026)
por: Wang, Yuxiang, et al.
Publicado: (2026)
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
por: Zhou, Xueyu, et al.
Publicado: (2026)
por: Zhou, Xueyu, et al.
Publicado: (2026)
Ejemplares similares
-
UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation
por: von Rad, Jonathan, et al.
Publicado: (2026) -
MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning
por: Lin, Yunze
Publicado: (2025) -
Optimal Inference Schedules for Masked Diffusion Models
por: Chen, Sitan, et al.
Publicado: (2025) -
Backdooring Masked Diffusion Language Models
por: Cao, Daniel Yiming, et al.
Publicado: (2026) -
HDT: Hierarchical Document Transformer
por: He, Haoyu, et al.
Publicado: (2024)