Enhancing Efficiency and Exploration in Reinforcement Learning for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liao, Mengqi, Xi, Xiangyu, Chen, Ruinian, Leng, Jia, Hu, Yangen, Zeng, Ke, Liu, Shuai, Wan, Huaiyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
par: Qin, Zhanyue, et autres
Publié: (2026)
par: Qin, Zhanyue, et autres
Publié: (2026)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration
par: Gu, Tianteng, et autres
Publié: (2025)
par: Gu, Tianteng, et autres
Publié: (2025)
Reinforcement Learning Enhanced LLMs: A Survey
par: Wang, Shuhe, et autres
Publié: (2024)
par: Wang, Shuhe, et autres
Publié: (2024)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
par: Deng, Wenhao, et autres
Publié: (2025)
par: Deng, Wenhao, et autres
Publié: (2025)
Optimizing Large Language Models with an Enhanced LoRA Fine-Tuning Algorithm for Efficiency and Robustness in NLP Tasks
par: Hu, Jiacheng, et autres
Publié: (2024)
par: Hu, Jiacheng, et autres
Publié: (2024)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning
par: Ma, Ruotian, et autres
Publié: (2025)
par: Ma, Ruotian, et autres
Publié: (2025)
Large Language Model Prompt Datasets: An In-depth Analysis and Insights
par: Zhang, Yuanming, et autres
Publié: (2025)
par: Zhang, Yuanming, et autres
Publié: (2025)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
par: Hao, Bingguang, et autres
Publié: (2025)
par: Hao, Bingguang, et autres
Publié: (2025)
Towards Understanding Multi-Task Learning (Generalization) of LLMs via Detecting and Exploring Task-Specific Neurons
par: Leng, Yongqi, et autres
Publié: (2024)
par: Leng, Yongqi, et autres
Publié: (2024)
When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs
par: Wang, Shaowen, et autres
Publié: (2025)
par: Wang, Shaowen, et autres
Publié: (2025)
Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization
par: Chen, Zhengyu, et autres
Publié: (2025)
par: Chen, Zhengyu, et autres
Publié: (2025)
AutoTriton: Automatic Triton Programming with Reinforcement Learning in LLMs
par: Li, Shangzhan, et autres
Publié: (2025)
par: Li, Shangzhan, et autres
Publié: (2025)
Enhancing LLM Knowledge Learning through Generalization
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
par: Jang, Eyon, et autres
Publié: (2026)
par: Jang, Eyon, et autres
Publié: (2026)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
par: Zhang, Bonan, et autres
Publié: (2025)
par: Zhang, Bonan, et autres
Publié: (2025)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
par: Zheng, Chujie, et autres
Publié: (2025)
par: Zheng, Chujie, et autres
Publié: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
par: Hu, Jingcheng, et autres
Publié: (2025)
par: Hu, Jingcheng, et autres
Publié: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
par: Huang, Guanhua, et autres
Publié: (2025)
par: Huang, Guanhua, et autres
Publié: (2025)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
par: Huo, Yifu, et autres
Publié: (2026)
par: Huo, Yifu, et autres
Publié: (2026)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
par: Zhang, Fuxiang, et autres
Publié: (2024)
par: Zhang, Fuxiang, et autres
Publié: (2024)
TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
par: Wei, Zhepei, et autres
Publié: (2025)
par: Wei, Zhepei, et autres
Publié: (2025)
Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
par: Huang, Yiming, et autres
Publié: (2026)
par: Huang, Yiming, et autres
Publié: (2026)
ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs
par: Chen, Fu, et autres
Publié: (2025)
par: Chen, Fu, et autres
Publié: (2025)
ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning
par: Wan, Ziyu, et autres
Publié: (2025)
par: Wan, Ziyu, et autres
Publié: (2025)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
par: Karaman, Batuhan K., et autres
Publié: (2026)
par: Karaman, Batuhan K., et autres
Publié: (2026)
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
par: Li, Pengyi, et autres
Publié: (2026)
par: Li, Pengyi, et autres
Publié: (2026)
Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
par: Deng, Wenlong, et autres
Publié: (2025)
par: Deng, Wenlong, et autres
Publié: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
par: Li, Yiyuan, et autres
Publié: (2026)
par: Li, Yiyuan, et autres
Publié: (2026)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
par: Zhang, Xinnan, et autres
Publié: (2025)
par: Zhang, Xinnan, et autres
Publié: (2025)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
par: Guo, Yiran, et autres
Publié: (2026)
par: Guo, Yiran, et autres
Publié: (2026)
TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only
par: Liu, Yilun, et autres
Publié: (2026)
par: Liu, Yilun, et autres
Publié: (2026)
Natural Language Reinforcement Learning
par: Feng, Xidong, et autres
Publié: (2024)
par: Feng, Xidong, et autres
Publié: (2024)
Documents similaires
-
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
par: Qin, Zhanyue, et autres
Publié: (2026) -
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
par: Huang, Wei, et autres
Publié: (2025) -
DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration
par: Gu, Tianteng, et autres
Publié: (2025) -
Reinforcement Learning Enhanced LLMs: A Survey
par: Wang, Shuhe, et autres
Publié: (2024) -
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
par: Deng, Wenhao, et autres
Publié: (2025)