dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Shirui, Jiao, Jiantao, Ratliff, Lillian J., Zhu, Banghua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
by: Zhu, Banghua, et al.
Published: (2023)
by: Zhu, Banghua, et al.
Published: (2023)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
by: Zhu, Banghua, et al.
Published: (2024)
by: Zhu, Banghua, et al.
Published: (2024)
Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning
by: Narang, Adhyyan, et al.
Published: (2024)
by: Narang, Adhyyan, et al.
Published: (2024)
Generative AI Security: Challenges and Countermeasures
by: Zhu, Banghua, et al.
Published: (2024)
by: Zhu, Banghua, et al.
Published: (2024)
Mercury: Ultra-Fast Language Models Based on Diffusion
by: Labs, Inception, et al.
Published: (2025)
by: Labs, Inception, et al.
Published: (2025)
d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation
by: Qian, Yu-Yang, et al.
Published: (2026)
by: Qian, Yu-Yang, et al.
Published: (2026)
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
by: Zheng, Haoyang, et al.
Published: (2025)
by: Zheng, Haoyang, et al.
Published: (2025)
From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
by: Fu, Hengyu, et al.
Published: (2025)
by: Fu, Hengyu, et al.
Published: (2025)
Efficient Prompt Caching via Embedding Similarity
by: Zhu, Hanlin, et al.
Published: (2024)
by: Zhu, Hanlin, et al.
Published: (2024)
How to Evaluate Reward Models for RLHF
by: Frick, Evan, et al.
Published: (2024)
by: Frick, Evan, et al.
Published: (2024)
TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics
by: Chen, Shirui, et al.
Published: (2026)
by: Chen, Shirui, et al.
Published: (2026)
Fine-Tuning Diffusion Models for Molecular Generation via Reinforcement Learning and Fast Sampling
by: Lin, Guang, et al.
Published: (2026)
by: Lin, Guang, et al.
Published: (2026)
Exploratory Diffusion Model for Unsupervised Reinforcement Learning
by: Ying, Chengyang, et al.
Published: (2025)
by: Ying, Chengyang, et al.
Published: (2025)
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)
by: Zhong, Jianyuan, et al.
Published: (2026)
EmbedLLM: Learning Compact Representations of Large Language Models
by: Zhuang, Richard, et al.
Published: (2024)
by: Zhuang, Richard, et al.
Published: (2024)
Diffusion Models for Reinforcement Learning: A Survey
by: Zhu, Zhengbang, et al.
Published: (2023)
by: Zhu, Zhengbang, et al.
Published: (2023)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
by: Zhao, Hanyang, et al.
Published: (2025)
by: Zhao, Hanyang, et al.
Published: (2025)
The Effective Horizon Explains Deep RL Performance in Stochastic Environments
by: Laidlaw, Cassidy, et al.
Published: (2023)
by: Laidlaw, Cassidy, et al.
Published: (2023)
ULTHO: Ultra-Lightweight yet Efficient Hyperparameter Optimization in Deep Reinforcement Learning
by: Yuan, Mingqi, et al.
Published: (2025)
by: Yuan, Mingqi, et al.
Published: (2025)
UltraSTF: Ultra-Compact Model for Large-Scale Spatio-Temporal Forecasting
by: Yeh, Chin-Chia Michael, et al.
Published: (2025)
by: Yeh, Chin-Chia Michael, et al.
Published: (2025)
Initializing Services in Interactive ML Systems for Diverse Users
by: Bose, Avinandan, et al.
Published: (2023)
by: Bose, Avinandan, et al.
Published: (2023)
Towards Fast Safe Online Reinforcement Learning via Policy Finetuning
by: Chen, Keru, et al.
Published: (2024)
by: Chen, Keru, et al.
Published: (2024)
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
by: Wu, Yuhao, et al.
Published: (2025)
by: Wu, Yuhao, et al.
Published: (2025)
Fairness in Serving Large Language Models
by: Sheng, Ying, et al.
Published: (2023)
by: Sheng, Ying, et al.
Published: (2023)
ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping
by: Zhu, Zijian, et al.
Published: (2026)
by: Zhu, Zijian, et al.
Published: (2026)
INSPIRE-GNN: Intelligent Sensor Placement to Improve Sparse Bicycling Network Prediction via Reinforcement Learning Boosted Graph Neural Networks
by: Gupta, Mohit, et al.
Published: (2025)
by: Gupta, Mohit, et al.
Published: (2025)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
by: Tang, Xiaohang, et al.
Published: (2026)
by: Tang, Xiaohang, et al.
Published: (2026)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
by: Cui, Ganqu, et al.
Published: (2023)
by: Cui, Ganqu, et al.
Published: (2023)
Deep Reinforcement Learning for Personalized Diagnostic Decision Pathways Using Electronic Health Records: A Comparative Study on Anemia and Systemic Lupus Erythematosus
by: Muyama, Lillian, et al.
Published: (2024)
by: Muyama, Lillian, et al.
Published: (2024)
dLLM: Simple Diffusion Language Modeling
by: Zhou, Zhanhui, et al.
Published: (2026)
by: Zhou, Zhanhui, et al.
Published: (2026)
Teaching Language Models to Critique via Reinforcement Learning
by: Xie, Zhihui, et al.
Published: (2025)
by: Xie, Zhihui, et al.
Published: (2025)
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
by: Li, Zhaoxin, et al.
Published: (2025)
by: Li, Zhaoxin, et al.
Published: (2025)
DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models
by: Chen, Jingyi, et al.
Published: (2024)
by: Chen, Jingyi, et al.
Published: (2024)
UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
by: Wang, Fu-Yun, et al.
Published: (2025)
by: Wang, Fu-Yun, et al.
Published: (2025)
Estimating Time Series Foundation Model Transferability via In-Context Learning
by: Yao, Qingren, et al.
Published: (2025)
by: Yao, Qingren, et al.
Published: (2025)
Noise-Resilient Unsupervised Graph Representation Learning via Multi-Hop Feature Quality Estimation
by: Li, Shiyuan, et al.
Published: (2024)
by: Li, Shiyuan, et al.
Published: (2024)
Fast Rates for Inverse Reinforcement Learning
by: Schlaginhaufen, Andreas, et al.
Published: (2026)
by: Schlaginhaufen, Andreas, et al.
Published: (2026)
Diffusion Spectral Representation for Reinforcement Learning
by: Shribak, Dmitry, et al.
Published: (2024)
by: Shribak, Dmitry, et al.
Published: (2024)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
by: Liu, Jinmei, et al.
Published: (2024)
by: Liu, Jinmei, et al.
Published: (2024)
Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time
by: Chen, Zixiang, et al.
Published: (2023)
by: Chen, Zixiang, et al.
Published: (2023)
Similar Items
-
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
by: Zhu, Banghua, et al.
Published: (2023) -
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
by: Zhu, Banghua, et al.
Published: (2024) -
Sample Complexity Reduction via Policy Difference Estimation in Tabular Reinforcement Learning
by: Narang, Adhyyan, et al.
Published: (2024) -
Generative AI Security: Challenges and Countermeasures
by: Zhu, Banghua, et al.
Published: (2024) -
Mercury: Ultra-Fast Language Models Based on Diffusion
by: Labs, Inception, et al.
Published: (2025)