GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Xiaohang, Jiang, Keyue, Liu, Che, Zhao, Qifang, Xu, Xiaoxiao, Yoon, Sangwoong, Bogunovic, Ilija |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
by: Tang, Xiaohang, et al.
Published: (2025)
by: Tang, Xiaohang, et al.
Published: (2025)
RSPO: Regularized Self-Play Alignment of Large Language Models
by: Tang, Xiaohang, et al.
Published: (2025)
by: Tang, Xiaohang, et al.
Published: (2025)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
by: Wolf, Lorenz, et al.
Published: (2025)
by: Wolf, Lorenz, et al.
Published: (2025)
Robust Multi-Objective Controlled Decoding of Large Language Models
by: Son, Seongho, et al.
Published: (2025)
by: Son, Seongho, et al.
Published: (2025)
On the Trainability of Masked Diffusion Language Models via Blockwise Locality
by: Wang, Yuxiang, et al.
Published: (2026)
by: Wang, Yuxiang, et al.
Published: (2026)
Adversarially Robust Decision Transformer
by: Tang, Xiaohang, et al.
Published: (2024)
by: Tang, Xiaohang, et al.
Published: (2024)
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
by: Yoon, Sangwoong, et al.
Published: (2024)
by: Yoon, Sangwoong, et al.
Published: (2024)
Overton Pluralistic Reinforcement Learning for Large Language Models
by: Fu, Yu, et al.
Published: (2026)
by: Fu, Yu, et al.
Published: (2026)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
by: Ramesh, Shyam Sundhar, et al.
Published: (2026)
by: Ramesh, Shyam Sundhar, et al.
Published: (2026)
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
by: Ziomek, Juliusz, et al.
Published: (2026)
by: Ziomek, Juliusz, et al.
Published: (2026)
Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
by: Ramesh, Shyam Sundhar, et al.
Published: (2023)
by: Ramesh, Shyam Sundhar, et al.
Published: (2023)
PROWL: Prioritized Regret-Driven Optimization for World Model Learning
by: Güzel, Ahmet H., et al.
Published: (2026)
by: Güzel, Ahmet H., et al.
Published: (2026)
GraphGPT: Generative Pre-trained Graph Eulerian Transformer
by: Zhao, Qifang, et al.
Published: (2023)
by: Zhao, Qifang, et al.
Published: (2023)
Synthetic Data is Sufficient for Zero-Shot Visual Generalization from Offline Data
by: Güzel, Ahmet H., et al.
Published: (2025)
by: Güzel, Ahmet H., et al.
Published: (2025)
Heterogeneous Graph Structure Learning through the Lens of Data-generating Processes
by: Jiang, Keyue, et al.
Published: (2025)
by: Jiang, Keyue, et al.
Published: (2025)
Training-Free Message Passing for Learning on Hypergraphs
by: Tang, Bohan, et al.
Published: (2024)
by: Tang, Bohan, et al.
Published: (2024)
Bias of AI-Generated Content: An Examination of News Produced by Large Language Models
by: Fang, Xiao, et al.
Published: (2023)
by: Fang, Xiao, et al.
Published: (2023)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
by: Monsefi, Amin Karimi, et al.
Published: (2026)
by: Monsefi, Amin Karimi, et al.
Published: (2026)
Sample-Efficient Regret-Minimizing Double Oracle in Extensive-Form Games
by: Tang, Xiaohang, et al.
Published: (2024)
by: Tang, Xiaohang, et al.
Published: (2024)
Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement
by: Xu, Mingyu, et al.
Published: (2026)
by: Xu, Mingyu, et al.
Published: (2026)
Self-Hinting Language Models Enhance Reinforcement Learning
by: Liao, Baohao, et al.
Published: (2026)
by: Liao, Baohao, et al.
Published: (2026)
On the Importance of Task Complexity in Evaluating LLM-Based Multi-Agent Systems
by: Tang, Bohan, et al.
Published: (2025)
by: Tang, Bohan, et al.
Published: (2025)
Curriculum Learning-Guided Progressive Distillation in Large Language Models
by: Cao, Jincheng, et al.
Published: (2026)
by: Cao, Jincheng, et al.
Published: (2026)
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
by: Cheng, Xueqi, et al.
Published: (2026)
by: Cheng, Xueqi, et al.
Published: (2026)
Reinforcement Learning via Self-Distillation
by: Hübotter, Jonas, et al.
Published: (2026)
by: Hübotter, Jonas, et al.
Published: (2026)
Improving Language Model Reasoning with Self-motivated Learning
by: Feng, Yunlong, et al.
Published: (2024)
by: Feng, Yunlong, et al.
Published: (2024)
Federated Learning on Virtual Heterogeneous Data with Local-global Distillation
by: Huang, Chun-Yin, et al.
Published: (2023)
by: Huang, Chun-Yin, et al.
Published: (2023)
Self-Distilled Agentic Reinforcement Learning
by: Lu, Zhengxi, et al.
Published: (2026)
by: Lu, Zhengxi, et al.
Published: (2026)
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)
by: Zhong, Jianyuan, et al.
Published: (2026)
Learning to Better Search with Language Models via Guided Reinforced Self-Training
by: Moon, Seungyong, et al.
Published: (2024)
by: Moon, Seungyong, et al.
Published: (2024)
Efficient and Stable Reinforcement Learning for Diffusion Language Models
by: Liu, Jiawei, et al.
Published: (2026)
by: Liu, Jiawei, et al.
Published: (2026)
Guiding Diffusion Models with Reinforcement Learning for Stable Molecule Generation
by: Zhou, Zhijian, et al.
Published: (2025)
by: Zhou, Zhijian, et al.
Published: (2025)
A Markov Random Field model for Hypergraph-based Machine Learning
by: Tang, Bohan, et al.
Published: (2023)
by: Tang, Bohan, et al.
Published: (2023)
The Safety-Aware Denoiser for Text Diffusion Models
by: Yusuf, Amman, et al.
Published: (2026)
by: Yusuf, Amman, et al.
Published: (2026)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
by: Zheng, Yinan, et al.
Published: (2024)
by: Zheng, Yinan, et al.
Published: (2024)
Sample-efficient Bayesian Optimisation Using Known Invariances
by: Brown, Theodore, et al.
Published: (2024)
by: Brown, Theodore, et al.
Published: (2024)
Robust Bayesian Optimisation with Unbounded Corruptions
by: Ezzerg, Abdelhamid, et al.
Published: (2025)
by: Ezzerg, Abdelhamid, et al.
Published: (2025)
Advantage-Guided Diffusion for Model-Based Reinforcement Learning
by: Foffano, Daniele, et al.
Published: (2026)
by: Foffano, Daniele, et al.
Published: (2026)
Relation Modeling and Distillation for Learning with Noisy Labels
by: Che, Xiaming, et al.
Published: (2024)
by: Che, Xiaming, et al.
Published: (2024)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
by: Liu, Biao, et al.
Published: (2024)
by: Liu, Biao, et al.
Published: (2024)
Similar Items
-
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
by: Tang, Xiaohang, et al.
Published: (2025) -
RSPO: Regularized Self-Play Alignment of Large Language Models
by: Tang, Xiaohang, et al.
Published: (2025) -
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
by: Wolf, Lorenz, et al.
Published: (2025) -
Robust Multi-Objective Controlled Decoding of Large Language Models
by: Son, Seongho, et al.
Published: (2025) -
On the Trainability of Masked Diffusion Language Models via Blockwise Locality
by: Wang, Yuxiang, et al.
Published: (2026)