LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Kang, Haoqiang, Zhang, Yizhe, Kuang, Nikki Lijing, Ma, Yi-An, Qin, Lianhui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
von: Kang, Haoqiang, et al.
Veröffentlicht: (2025)
von: Kang, Haoqiang, et al.
Veröffentlicht: (2025)
LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation
von: Huang, Yuhang, et al.
Veröffentlicht: (2025)
von: Huang, Yuhang, et al.
Veröffentlicht: (2025)
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
von: Yu, Fangxu, et al.
Veröffentlicht: (2024)
von: Yu, Fangxu, et al.
Veröffentlicht: (2024)
TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models
von: Yu, Fangxu, et al.
Veröffentlicht: (2026)
von: Yu, Fangxu, et al.
Veröffentlicht: (2026)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
von: Xu, Huimin, et al.
Veröffentlicht: (2026)
von: Xu, Huimin, et al.
Veröffentlicht: (2026)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
von: Zhao, Hanyang, et al.
Veröffentlicht: (2025)
CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention
von: Li, Qingbin, et al.
Veröffentlicht: (2025)
von: Li, Qingbin, et al.
Veröffentlicht: (2025)
Preventing Curriculum Collapse in Self-Evolving Reasoning Systems
von: Mishra, Vaibhav
Veröffentlicht: (2026)
von: Mishra, Vaibhav
Veröffentlicht: (2026)
Skill-R1: Agent Skill Evolution via Reinforcement Learning
von: Vishe, Yash, et al.
Veröffentlicht: (2026)
von: Vishe, Yash, et al.
Veröffentlicht: (2026)
Preventing Dimensional Collapse in Self-Supervised Learning via Orthogonality Regularization
von: He, Junlin, et al.
Veröffentlicht: (2024)
von: He, Junlin, et al.
Veröffentlicht: (2024)
DiRL: An Efficient Post-Training Framework for Diffusion Language Models
von: Zhu, Ying, et al.
Veröffentlicht: (2025)
von: Zhu, Ying, et al.
Veröffentlicht: (2025)
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
von: Chang, Fu-Chieh, et al.
Veröffentlicht: (2024)
von: Chang, Fu-Chieh, et al.
Veröffentlicht: (2024)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
von: Dong, Yihong, et al.
Veröffentlicht: (2025)
Maximum Entropy Reinforcement Learning with Diffusion Policy
von: Dong, Xiaoyi, et al.
Veröffentlicht: (2025)
von: Dong, Xiaoyi, et al.
Veröffentlicht: (2025)
Preventing Collapse in Contrastive Learning with Orthonormal Prototypes (CLOP)
von: Li, Huanran, et al.
Veröffentlicht: (2024)
von: Li, Huanran, et al.
Veröffentlicht: (2024)
DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling
von: Lemercier, Jean-Marie, et al.
Veröffentlicht: (2026)
von: Lemercier, Jean-Marie, et al.
Veröffentlicht: (2026)
On Statistical Rates and Provably Efficient Criteria of Latent Diffusion Transformers (DiTs)
von: Hu, Jerry Yao-Chieh, et al.
Veröffentlicht: (2024)
von: Hu, Jerry Yao-Chieh, et al.
Veröffentlicht: (2024)
LiteCoOp: Lightweight Multi-LLM Shared-Tree Reasoning for Model-Serving Compiler Optimizations
von: Tang, Annabelle Sujun, et al.
Veröffentlicht: (2026)
von: Tang, Annabelle Sujun, et al.
Veröffentlicht: (2026)
NeoRL-2: Near Real-World Benchmarks for Offline Reinforcement Learning with Extended Realistic Scenarios
von: Gao, Songyi, et al.
Veröffentlicht: (2025)
von: Gao, Songyi, et al.
Veröffentlicht: (2025)
Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
von: Shan, Lianlei, et al.
Veröffentlicht: (2026)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
von: Bhatia, Abhinav, et al.
Veröffentlicht: (2023)
Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
von: Sanokowski, Sebastian, et al.
Veröffentlicht: (2025)
von: Sanokowski, Sebastian, et al.
Veröffentlicht: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
von: Cui, Ganqu, et al.
Veröffentlicht: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
von: Jin, Renren, et al.
Veröffentlicht: (2025)
von: Jin, Renren, et al.
Veröffentlicht: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers
von: Mo, Shentong, et al.
Veröffentlicht: (2026)
von: Mo, Shentong, et al.
Veröffentlicht: (2026)
SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning
von: Kang, Haoqiang, et al.
Veröffentlicht: (2026)
von: Kang, Haoqiang, et al.
Veröffentlicht: (2026)
Maximum Entropy Inverse Reinforcement Learning of Diffusion Models with Energy-Based Models
von: Yoon, Sangwoong, et al.
Veröffentlicht: (2024)
von: Yoon, Sangwoong, et al.
Veröffentlicht: (2024)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
von: Zhan, Guojian, et al.
Veröffentlicht: (2025)
von: Zhan, Guojian, et al.
Veröffentlicht: (2025)
LacaDM: A Latent Causal Diffusion Model for Multiobjective Reinforcement Learning
von: Yan, Xueming, et al.
Veröffentlicht: (2025)
von: Yan, Xueming, et al.
Veröffentlicht: (2025)
On Entropy Control in LLM-RL Algorithms
von: Shen, Han
Veröffentlicht: (2025)
von: Shen, Han
Veröffentlicht: (2025)
DiPRL: Learning Discrete Programmatic Policies via Architecture Entropy Regularization
von: Hu, Chengpeng, et al.
Veröffentlicht: (2026)
von: Hu, Chengpeng, et al.
Veröffentlicht: (2026)
Entropy-Preserving Reinforcement Learning
von: Petrenko, Aleksei, et al.
Veröffentlicht: (2026)
von: Petrenko, Aleksei, et al.
Veröffentlicht: (2026)
On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts
von: Wang, Fu-Yun, et al.
Veröffentlicht: (2025)
von: Wang, Fu-Yun, et al.
Veröffentlicht: (2025)
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
von: Zhang, Wenjing, et al.
Veröffentlicht: (2026)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2026)
Ever: Mitigating Hallucination in Large Language Models through Real-Time Verification and Rectification
von: Kang, Haoqiang, et al.
Veröffentlicht: (2023)
von: Kang, Haoqiang, et al.
Veröffentlicht: (2023)
EduAgent: Generative Student Agents in Learning
von: Xu, Songlin, et al.
Veröffentlicht: (2024)
von: Xu, Songlin, et al.
Veröffentlicht: (2024)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
von: Lv, Lei, et al.
Veröffentlicht: (2026)
von: Lv, Lei, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
von: Kang, Haoqiang, et al.
Veröffentlicht: (2025) -
LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation
von: Huang, Yuhang, et al.
Veröffentlicht: (2025) -
Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples
von: Yu, Fangxu, et al.
Veröffentlicht: (2024) -
TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models
von: Yu, Fangxu, et al.
Veröffentlicht: (2026) -
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
von: Xu, Huimin, et al.
Veröffentlicht: (2026)