On Entropy Control in LLM-RL Algorithms
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shen, Han |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning
par: Vanlioglu, Abdullah
Publié: (2025)
par: Vanlioglu, Abdullah
Publié: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control
par: Xue, Jun, et autres
Publié: (2026)
par: Xue, Jun, et autres
Publié: (2026)
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
par: Dewan, Shaurya, et autres
Publié: (2024)
par: Dewan, Shaurya, et autres
Publié: (2024)
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
par: Agarwal, Shivam, et autres
Publié: (2025)
par: Agarwal, Shivam, et autres
Publié: (2025)
Token-Efficient RL for LLM Reasoning
par: Lee, Alan, et autres
Publié: (2025)
par: Lee, Alan, et autres
Publié: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
par: Huang, Luke J., et autres
Publié: (2026)
par: Huang, Luke J., et autres
Publié: (2026)
Scalable Policy-Based RL Algorithms for POMDPs
par: Anjarlekar, Ameya, et autres
Publié: (2025)
par: Anjarlekar, Ameya, et autres
Publié: (2025)
Accelerating Goal-Conditioned RL Algorithms and Research
par: Bortkiewicz, Michał, et autres
Publié: (2024)
par: Bortkiewicz, Michał, et autres
Publié: (2024)
A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control
par: Choi, Wonhyeok, et autres
Publié: (2026)
par: Choi, Wonhyeok, et autres
Publié: (2026)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
par: Karine, Karine, et autres
Publié: (2025)
par: Karine, Karine, et autres
Publié: (2025)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
par: Shi, Jiahe, et autres
Publié: (2025)
par: Shi, Jiahe, et autres
Publié: (2025)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
par: Lv, Lei, et autres
Publié: (2026)
par: Lv, Lei, et autres
Publié: (2026)
LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
par: Kang, Haoqiang, et autres
Publié: (2026)
par: Kang, Haoqiang, et autres
Publié: (2026)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
par: Brantley, Kianté, et autres
Publié: (2025)
par: Brantley, Kianté, et autres
Publié: (2025)
AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
par: Han, Zhenyu, et autres
Publié: (2025)
par: Han, Zhenyu, et autres
Publié: (2025)
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
par: Wu, Xian, et autres
Publié: (2026)
par: Wu, Xian, et autres
Publié: (2026)
How Can LLM Guide RL? A Value-Based Approach
par: Zhang, Shenao, et autres
Publié: (2024)
par: Zhang, Shenao, et autres
Publié: (2024)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
par: Ye, Chenlu, et autres
Publié: (2026)
par: Ye, Chenlu, et autres
Publié: (2026)
IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
par: Cheng, Zhoujun, et autres
Publié: (2026)
par: Cheng, Zhoujun, et autres
Publié: (2026)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
par: Li, Yingru, et autres
Publié: (2026)
par: Li, Yingru, et autres
Publié: (2026)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
par: Zhang, Yiqi, et autres
Publié: (2026)
par: Zhang, Yiqi, et autres
Publié: (2026)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
par: Liu, Jia, et autres
Publié: (2025)
par: Liu, Jia, et autres
Publié: (2025)
Novel RL approach for efficient Elevator Group Control Systems
par: Vaartjes, Nathan, et autres
Publié: (2025)
par: Vaartjes, Nathan, et autres
Publié: (2025)
Deep RL With Information Constrained Policies: Generalization in Continuous Control
par: Malloy, Tailia, et autres
Publié: (2020)
par: Malloy, Tailia, et autres
Publié: (2020)
The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs
par: Howe, Nikolaus, et autres
Publié: (2025)
par: Howe, Nikolaus, et autres
Publié: (2025)
PickLLM: Context-Aware RL-Assisted Large Language Model Routing
par: Sikeridis, Dimitrios, et autres
Publié: (2024)
par: Sikeridis, Dimitrios, et autres
Publié: (2024)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
par: Bhatia, Abhinav, et autres
Publié: (2023)
par: Bhatia, Abhinav, et autres
Publié: (2023)
Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters
par: Kong, Lingxiao, et autres
Publié: (2026)
par: Kong, Lingxiao, et autres
Publié: (2026)
Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids
par: Nekoei, Hadi, et autres
Publié: (2025)
par: Nekoei, Hadi, et autres
Publié: (2025)
Heuristic Algorithm-based Action Masking Reinforcement Learning (HAAM-RL) with Ensemble Inference Method
par: Choi, Kyuwon, et autres
Publié: (2024)
par: Choi, Kyuwon, et autres
Publié: (2024)
Hard Prompts Made Interpretable: Sparse Entropy Regularization for Prompt Tuning with RL
par: Choi, Yunseon, et autres
Publié: (2024)
par: Choi, Yunseon, et autres
Publié: (2024)
It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL
par: Dwyer, Madeleine, et autres
Publié: (2025)
par: Dwyer, Madeleine, et autres
Publié: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
par: Mark, Max Sobol, et autres
Publié: (2024)
par: Mark, Max Sobol, et autres
Publié: (2024)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
par: Jin, Can, et autres
Publié: (2025)
par: Jin, Can, et autres
Publié: (2025)
Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
par: Glentis, Athanasios, et autres
Publié: (2025)
par: Glentis, Athanasios, et autres
Publié: (2025)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
par: Gu, Hao, et autres
Publié: (2026)
par: Gu, Hao, et autres
Publié: (2026)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
par: Xu, Haofeng, et autres
Publié: (2026)
par: Xu, Haofeng, et autres
Publié: (2026)
Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
par: Sareen, Kusha, et autres
Publié: (2025)
par: Sareen, Kusha, et autres
Publié: (2025)
Documents similaires
-
Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning
par: Vanlioglu, Abdullah
Publié: (2025) -
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
par: Zhan, Guojian, et autres
Publié: (2025) -
FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control
par: Xue, Jun, et autres
Publié: (2026) -
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
par: Dewan, Shaurya, et autres
Publié: (2024) -
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
par: Agarwal, Shivam, et autres
Publié: (2025)