On Entropy Control in LLM-RL Algorithms
Fuente:
arXiv
Salvato in:
| Autore principale: | Shen, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning
di: Vanlioglu, Abdullah
Pubblicazione: (2025)
di: Vanlioglu, Abdullah
Pubblicazione: (2025)
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
di: Zhan, Guojian, et al.
Pubblicazione: (2025)
FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
di: Dewan, Shaurya, et al.
Pubblicazione: (2024)
di: Dewan, Shaurya, et al.
Pubblicazione: (2024)
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
di: Agarwal, Shivam, et al.
Pubblicazione: (2025)
di: Agarwal, Shivam, et al.
Pubblicazione: (2025)
Token-Efficient RL for LLM Reasoning
di: Lee, Alan, et al.
Pubblicazione: (2025)
di: Lee, Alan, et al.
Pubblicazione: (2025)
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
di: Huang, Luke J., et al.
Pubblicazione: (2026)
di: Huang, Luke J., et al.
Pubblicazione: (2026)
Scalable Policy-Based RL Algorithms for POMDPs
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
Accelerating Goal-Conditioned RL Algorithms and Research
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
di: Bortkiewicz, Michał, et al.
Pubblicazione: (2024)
A Review of Online Diffusion Policy RL Algorithms for Scalable Robotic Control
di: Choi, Wonhyeok, et al.
Pubblicazione: (2026)
di: Choi, Wonhyeok, et al.
Pubblicazione: (2026)
Combining LLM decision and RL action selection to improve RL policy for adaptive interventions
di: Karine, Karine, et al.
Pubblicazione: (2025)
di: Karine, Karine, et al.
Pubblicazione: (2025)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
di: Shi, Jiahe, et al.
Pubblicazione: (2025)
di: Shi, Jiahe, et al.
Pubblicazione: (2025)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
di: Lv, Lei, et al.
Pubblicazione: (2026)
di: Lv, Lei, et al.
Pubblicazione: (2026)
LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
di: Kang, Haoqiang, et al.
Pubblicazione: (2026)
di: Kang, Haoqiang, et al.
Pubblicazione: (2026)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
di: Han, Zhenyu, et al.
Pubblicazione: (2025)
di: Han, Zhenyu, et al.
Pubblicazione: (2025)
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
di: Li, Yingru, et al.
Pubblicazione: (2025)
di: Li, Yingru, et al.
Pubblicazione: (2025)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
di: Wu, Xian, et al.
Pubblicazione: (2026)
di: Wu, Xian, et al.
Pubblicazione: (2026)
How Can LLM Guide RL? A Value-Based Approach
di: Zhang, Shenao, et al.
Pubblicazione: (2024)
di: Zhang, Shenao, et al.
Pubblicazione: (2024)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
di: Ye, Chenlu, et al.
Pubblicazione: (2026)
IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
di: Cheng, Zhoujun, et al.
Pubblicazione: (2026)
di: Cheng, Zhoujun, et al.
Pubblicazione: (2026)
The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL
di: Li, Yingru, et al.
Pubblicazione: (2026)
di: Li, Yingru, et al.
Pubblicazione: (2026)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
di: Zhang, Yiqi, et al.
Pubblicazione: (2026)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
di: Liu, Jia, et al.
Pubblicazione: (2025)
di: Liu, Jia, et al.
Pubblicazione: (2025)
Novel RL approach for efficient Elevator Group Control Systems
di: Vaartjes, Nathan, et al.
Pubblicazione: (2025)
di: Vaartjes, Nathan, et al.
Pubblicazione: (2025)
Deep RL With Information Constrained Policies: Generalization in Continuous Control
di: Malloy, Tailia, et al.
Pubblicazione: (2020)
di: Malloy, Tailia, et al.
Pubblicazione: (2020)
The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs
di: Howe, Nikolaus, et al.
Pubblicazione: (2025)
di: Howe, Nikolaus, et al.
Pubblicazione: (2025)
PickLLM: Context-Aware RL-Assisted Large Language Model Routing
di: Sikeridis, Dimitrios, et al.
Pubblicazione: (2024)
di: Sikeridis, Dimitrios, et al.
Pubblicazione: (2024)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
Enhancing RL Generalizability in Robotics through SHAP Analysis of Algorithms and Hyperparameters
di: Kong, Lingxiao, et al.
Pubblicazione: (2026)
di: Kong, Lingxiao, et al.
Pubblicazione: (2026)
Shielded Controller Units for RL with Operational Constraints Applied to Remote Microgrids
di: Nekoei, Hadi, et al.
Pubblicazione: (2025)
di: Nekoei, Hadi, et al.
Pubblicazione: (2025)
Heuristic Algorithm-based Action Masking Reinforcement Learning (HAAM-RL) with Ensemble Inference Method
di: Choi, Kyuwon, et al.
Pubblicazione: (2024)
di: Choi, Kyuwon, et al.
Pubblicazione: (2024)
Hard Prompts Made Interpretable: Sparse Entropy Regularization for Prompt Tuning with RL
di: Choi, Yunseon, et al.
Pubblicazione: (2024)
di: Choi, Yunseon, et al.
Pubblicazione: (2024)
It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL
di: Dwyer, Madeleine, et al.
Pubblicazione: (2025)
di: Dwyer, Madeleine, et al.
Pubblicazione: (2025)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
di: Jin, Can, et al.
Pubblicazione: (2025)
di: Jin, Can, et al.
Pubblicazione: (2025)
Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking
di: Glentis, Athanasios, et al.
Pubblicazione: (2025)
di: Glentis, Athanasios, et al.
Pubblicazione: (2025)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
di: Gu, Hao, et al.
Pubblicazione: (2026)
di: Gu, Hao, et al.
Pubblicazione: (2026)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
di: Xu, Haofeng, et al.
Pubblicazione: (2026)
di: Xu, Haofeng, et al.
Pubblicazione: (2026)
Performance Comparison of Deep RL Algorithms for Mixed Traffic Cooperative Lane-Changing
di: Yao, Xue, et al.
Pubblicazione: (2024)
di: Yao, Xue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning
di: Vanlioglu, Abdullah
Pubblicazione: (2025) -
Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL
di: Zhan, Guojian, et al.
Pubblicazione: (2025) -
FastDSAC: Unlocking the Potential of Maximum Entropy RL in High-Dimensional Humanoid Control
di: Xue, Jun, et al.
Pubblicazione: (2026) -
Curiosity & Entropy Driven Unsupervised RL in Multiple Environments
di: Dewan, Shaurya, et al.
Pubblicazione: (2024) -
The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
di: Agarwal, Shivam, et al.
Pubblicazione: (2025)