Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison
Fuente:
arXiv
Saved in:
| Main Author: | Vicentino, Caio |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
by: Vicentino, Caio
Published: (2026)
by: Vicentino, Caio
Published: (2026)
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
by: Zhang, Siyue, et al.
Published: (2025)
by: Zhang, Siyue, et al.
Published: (2025)
Causal Autoregressive Diffusion Language Model
by: Ruan, Junhao, et al.
Published: (2026)
by: Ruan, Junhao, et al.
Published: (2026)
Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models
by: Kong, Injin, et al.
Published: (2026)
by: Kong, Injin, et al.
Published: (2026)
Look Ahead or Look Around? A Theoretical Comparison Between Autoregressive and Masked Pretraining
by: Zhang, Qi, et al.
Published: (2024)
by: Zhang, Qi, et al.
Published: (2024)
Activation Steering for Masked Diffusion Language Models
by: Shnaidman, Adi, et al.
Published: (2025)
by: Shnaidman, Adi, et al.
Published: (2025)
Diffusion-Inspired Masked Fine-Tuning for Knowledge Injection in Autoregressive LLMs
by: Pan, Xu, et al.
Published: (2025)
by: Pan, Xu, et al.
Published: (2025)
Scaling Diffusion Language Models via Adaptation from Autoregressive Models
by: Gong, Shansan, et al.
Published: (2024)
by: Gong, Shansan, et al.
Published: (2024)
Masked Diffusion Language Models with Frequency-Informed Training
by: Kosmopoulou, Despoina, et al.
Published: (2025)
by: Kosmopoulou, Despoina, et al.
Published: (2025)
Diffutron: A Masked Diffusion Language Model for Turkish Language
by: Kocabay, Şuayp Talha, et al.
Published: (2026)
by: Kocabay, Şuayp Talha, et al.
Published: (2026)
Differences in Text Generated by Diffusion and Autoregressive Language Models
by: Zhang, Zeyang, et al.
Published: (2026)
by: Zhang, Zeyang, et al.
Published: (2026)
Reward-Weighted Sampling: Enhancing Non-Autoregressive Characteristics in Masked Diffusion LLMs
by: Gwak, Daehoon, et al.
Published: (2025)
by: Gwak, Daehoon, et al.
Published: (2025)
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
by: Lin, Liang, et al.
Published: (2026)
by: Lin, Liang, et al.
Published: (2026)
Scaling Beyond Masked Diffusion Language Models
by: Sahoo, Subham Sekhar, et al.
Published: (2026)
by: Sahoo, Subham Sekhar, et al.
Published: (2026)
Enabling Autoregressive Models to Fill In Masked Tokens
by: Israel, Daniel, et al.
Published: (2025)
by: Israel, Daniel, et al.
Published: (2025)
Embedding Inversion via Conditional Masked Diffusion Language Models
by: Xiao, Han
Published: (2026)
by: Xiao, Han
Published: (2026)
Edit-Based Refinement for Parallel Masked Diffusion Language Models
by: Ren, Houxing, et al.
Published: (2026)
by: Ren, Houxing, et al.
Published: (2026)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
by: Oba, Daisuke, et al.
Published: (2026)
by: Oba, Daisuke, et al.
Published: (2026)
Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
by: Sun, Bowen, et al.
Published: (2025)
by: Sun, Bowen, et al.
Published: (2025)
Soft-Masked Diffusion Language Models
by: Hersche, Michael, et al.
Published: (2025)
by: Hersche, Michael, et al.
Published: (2025)
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models
by: Chen, Lingjie, et al.
Published: (2026)
by: Chen, Lingjie, et al.
Published: (2026)
DiffuMask: Diffusion Language Model for Token-level Prompt Pruning
by: Zheng, Caleb, et al.
Published: (2026)
by: Zheng, Caleb, et al.
Published: (2026)
Simple and Effective Masked Diffusion Language Models
by: Sahoo, Subham Sekhar, et al.
Published: (2024)
by: Sahoo, Subham Sekhar, et al.
Published: (2024)
On the Reasoning Abilities of Masked Diffusion Language Models
by: Svete, Anej, et al.
Published: (2025)
by: Svete, Anej, et al.
Published: (2025)
Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Large Language Models
by: Yao, Lin
Published: (2026)
by: Yao, Lin
Published: (2026)
Reversal Invariance in Autoregressive Language Models
by: Sahasrabudhe, Mihir
Published: (2025)
by: Sahasrabudhe, Mihir
Published: (2025)
Towards Closing the Autoregressive Gap in Language Modeling via Entropy-Gated Continuous Bitstream Diffusion
by: Batzolis, Georgios, et al.
Published: (2026)
by: Batzolis, Georgios, et al.
Published: (2026)
DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models
by: Zhou, Xueyu, et al.
Published: (2026)
by: Zhou, Xueyu, et al.
Published: (2026)
Reconsidering Positional Supervision in Masked Diffusion Language Model Training
by: Ye, Mengyu, et al.
Published: (2026)
by: Ye, Mengyu, et al.
Published: (2026)
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
by: Wang, Chenyu, et al.
Published: (2025)
by: Wang, Chenyu, et al.
Published: (2025)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
by: Li, Pengxiang, et al.
Published: (2026)
by: Li, Pengxiang, et al.
Published: (2026)
Understanding and Accelerating the Training of Masked Diffusion Language Models
by: Hong, Chunsan, et al.
Published: (2026)
by: Hong, Chunsan, et al.
Published: (2026)
FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation
by: He, Siyang, et al.
Published: (2026)
by: He, Siyang, et al.
Published: (2026)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
by: Li, Jia-Nan, et al.
Published: (2025)
by: Li, Jia-Nan, et al.
Published: (2025)
Revisiting Knowledge Distillation for Autoregressive Language Models
by: Zhong, Qihuang, et al.
Published: (2024)
by: Zhong, Qihuang, et al.
Published: (2024)
Autoregressive Large Language Models are Computationally Universal
by: Schuurmans, Dale, et al.
Published: (2024)
by: Schuurmans, Dale, et al.
Published: (2024)
Beyond Hard Masks: Progressive Token Evolution for Diffusion Language Models
by: Zhong, Linhao, et al.
Published: (2026)
by: Zhong, Linhao, et al.
Published: (2026)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
by: Fu, Yonggan, et al.
Published: (2025)
by: Fu, Yonggan, et al.
Published: (2025)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
by: Wang, Zihang, et al.
Published: (2026)
by: Wang, Zihang, et al.
Published: (2026)
Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models
by: Asano, Hikaru, et al.
Published: (2026)
by: Asano, Hikaru, et al.
Published: (2026)
Similar Items
-
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
by: Vicentino, Caio
Published: (2026) -
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
by: Zhang, Siyue, et al.
Published: (2025) -
Causal Autoregressive Diffusion Language Model
by: Ruan, Junhao, et al.
Published: (2026) -
Mechanism Shift During Post-training from Autoregressive to Masked Diffusion Language Models
by: Kong, Injin, et al.
Published: (2026) -
Look Ahead or Look Around? A Theoretical Comparison Between Autoregressive and Masked Pretraining
by: Zhang, Qi, et al.
Published: (2024)