LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Fengqi, Wang, Rongzhen, Nie, Shen, Zhang, Xiaolu, Wu, Chunwei, Hu, Jun, Zhou, Jun, Chen, Jianfei, Lin, Yankai, Wen, Ji-Rong, Li, Chongxuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
by: You, Zebin, et al.
Published: (2025)
by: You, Zebin, et al.
Published: (2025)
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
by: You, Zebin, et al.
Published: (2026)
by: You, Zebin, et al.
Published: (2026)
Large Language Diffusion Models
by: Nie, Shen, et al.
Published: (2025)
by: Nie, Shen, et al.
Published: (2025)
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
by: Shi, Teng, et al.
Published: (2025)
by: Shi, Teng, et al.
Published: (2025)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
by: Zhu, Fengqi, et al.
Published: (2025)
by: Zhu, Fengqi, et al.
Published: (2025)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
by: Bie, Tiwei, et al.
Published: (2025)
by: Bie, Tiwei, et al.
Published: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
by: Wen, Yuqing, et al.
Published: (2025)
by: Wen, Yuqing, et al.
Published: (2025)
UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
by: He, Guangxin, et al.
Published: (2025)
by: He, Guangxin, et al.
Published: (2025)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
by: Huang, Sterling, et al.
Published: (2026)
by: Huang, Sterling, et al.
Published: (2026)
Efficient Token Pruning for LLaDA-V
by: Wan, Zhewen, et al.
Published: (2026)
by: Wan, Zhewen, et al.
Published: (2026)
LLaDA2.1: Speeding Up Text Diffusion via Token Editing
by: Bie, Tiwei, et al.
Published: (2026)
by: Bie, Tiwei, et al.
Published: (2026)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
by: Dong, Xuanzhao, et al.
Published: (2025)
by: Dong, Xuanzhao, et al.
Published: (2025)
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refinement
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
by: AI, Inclusion, et al.
Published: (2026)
by: AI, Inclusion, et al.
Published: (2026)
DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs
by: Yu, Longxuan, et al.
Published: (2026)
by: Yu, Longxuan, et al.
Published: (2026)
Unifying Bayesian Flow Networks and Diffusion Models through Stochastic Differential Equations
by: Xue, Kaiwen, et al.
Published: (2024)
by: Xue, Kaiwen, et al.
Published: (2024)
LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
by: Fan, Xiaoyu, et al.
Published: (2026)
by: Fan, Xiaoyu, et al.
Published: (2026)
On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability
by: Zheng, Chenyu, et al.
Published: (2024)
by: Zheng, Chenyu, et al.
Published: (2024)
Masked Diffusion Models as Energy Minimization
by: Chen, Sitong, et al.
Published: (2025)
by: Chen, Sitong, et al.
Published: (2025)
Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
by: Ou, Jingyang, et al.
Published: (2024)
by: Ou, Jingyang, et al.
Published: (2024)
Effective and Efficient Masked Image Generation Models
by: You, Zebin, et al.
Published: (2025)
by: You, Zebin, et al.
Published: (2025)
Scaling up Masked Diffusion Models on Text
by: Nie, Shen, et al.
Published: (2024)
by: Nie, Shen, et al.
Published: (2024)
DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents
by: Zhao, Jiahao, et al.
Published: (2026)
by: Zhao, Jiahao, et al.
Published: (2026)
Scaling Diffusion Transformers Efficiently via $μ$P
by: Zheng, Chenyu, et al.
Published: (2025)
by: Zheng, Chenyu, et al.
Published: (2025)
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
by: Lu, Cheng, et al.
Published: (2022)
by: Lu, Cheng, et al.
Published: (2022)
Efficient Backpropagation with Variance-Controlled Adaptive Sampling
by: Wang, Ziteng, et al.
Published: (2024)
by: Wang, Ziteng, et al.
Published: (2024)
Spectral Condition for $μ$P under Width-Depth Scaling
by: Zheng, Chenyu, et al.
Published: (2026)
by: Zheng, Chenyu, et al.
Published: (2026)
Deterministic Differentiable Structured Pruning for Large Language Models
by: Huang, Weiyu, et al.
Published: (2026)
by: Huang, Weiyu, et al.
Published: (2026)
Distilling Rule-based Knowledge into Large Language Models
by: Yang, Wenkai, et al.
Published: (2023)
by: Yang, Wenkai, et al.
Published: (2023)
DeepCritic: Deliberate Critique with Large Language Models
by: Yang, Wenkai, et al.
Published: (2025)
by: Yang, Wenkai, et al.
Published: (2025)
A Theory for Conditional Generative Modeling on Multiple Data Sources
by: Wang, Rongzhen, et al.
Published: (2025)
by: Wang, Rongzhen, et al.
Published: (2025)
On the Role of Preference Variance in Preference Optimization
by: Guo, Jiacheng, et al.
Published: (2025)
by: Guo, Jiacheng, et al.
Published: (2025)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
by: Zhang, Jianfei, et al.
Published: (2024)
by: Zhang, Jianfei, et al.
Published: (2024)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
by: Zhu, Lanyun, et al.
Published: (2023)
by: Zhu, Lanyun, et al.
Published: (2023)
PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier
by: Wang, Shaomeng, et al.
Published: (2025)
by: Wang, Shaomeng, et al.
Published: (2025)
Real-time Identity Defenses against Malicious Personalization of Diffusion Models
by: Guo, Hanzhong, et al.
Published: (2024)
by: Guo, Hanzhong, et al.
Published: (2024)
The Blessing of Randomness: SDE Beats ODE in General Diffusion-based Image Editing
by: Nie, Shen, et al.
Published: (2023)
by: Nie, Shen, et al.
Published: (2023)
Oscillation-Reduced MXFP4 Training for Vision Transformers
by: Chen, Yuxiang, et al.
Published: (2025)
by: Chen, Yuxiang, et al.
Published: (2025)
Configuring Data Augmentations to Reduce Variance Shift in Positional Embedding of Vision Transformers
by: Kim, Bum Jun, et al.
Published: (2024)
by: Kim, Bum Jun, et al.
Published: (2024)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
by: Huang, Weiyu, et al.
Published: (2025)
by: Huang, Weiyu, et al.
Published: (2025)
Similar Items
-
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
by: You, Zebin, et al.
Published: (2025) -
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
by: You, Zebin, et al.
Published: (2026) -
Large Language Diffusion Models
by: Nie, Shen, et al.
Published: (2025) -
LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
by: Shi, Teng, et al.
Published: (2025) -
LLaDA-MoE: A Sparse MoE Diffusion Language Model
by: Zhu, Fengqi, et al.
Published: (2025)