Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Yan, Guo, Jia, Kok, Stanley, Wang, Zihao, Wen, Zujie, Zhang, Zhiqiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
by: Chen, Kesheng, et al.
Published: (2025)
by: Chen, Kesheng, et al.
Published: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
by: Dai, Runpeng, et al.
Published: (2025)
by: Dai, Runpeng, et al.
Published: (2025)
Prediction of Bank Credit Ratings using Heterogeneous Topological Graph Neural Networks
by: Liu, Junyi, et al.
Published: (2025)
by: Liu, Junyi, et al.
Published: (2025)
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025)
by: Arumugam, Dilip, et al.
Published: (2025)
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
by: Wang, Yibo, et al.
Published: (2024)
by: Wang, Yibo, et al.
Published: (2024)
On Predictability of Reinforcement Learning Dynamics for Large Language Models
by: Cai, Yuchen, et al.
Published: (2025)
by: Cai, Yuchen, et al.
Published: (2025)
LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models
by: Hao, Qianyue, et al.
Published: (2025)
by: Hao, Qianyue, et al.
Published: (2025)
Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space
by: Zhang, Xinyu, et al.
Published: (2025)
by: Zhang, Xinyu, et al.
Published: (2025)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
by: Yue, Bo, et al.
Published: (2024)
by: Yue, Bo, et al.
Published: (2024)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
by: Wang, Shumin, et al.
Published: (2026)
by: Wang, Shumin, et al.
Published: (2026)
From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning?
by: Cao, Hanqun, et al.
Published: (2025)
by: Cao, Hanqun, et al.
Published: (2025)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
by: Zhou, Runlong, et al.
Published: (2025)
by: Zhou, Runlong, et al.
Published: (2025)
Rethinking Plasticity in Deep Reinforcement Learning
by: He, Zhiqiang
Published: (2026)
by: He, Zhiqiang
Published: (2026)
Is Exploration All You Need? Effective Exploration Characteristics for Transfer in Reinforcement Learning
by: Balloch, Jonathan C., et al.
Published: (2024)
by: Balloch, Jonathan C., et al.
Published: (2024)
Reinforcement Learning with Promising Tokens for Large Language Models
by: Pang, Jing-Cheng, et al.
Published: (2026)
by: Pang, Jing-Cheng, et al.
Published: (2026)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
by: Bao, Yicheng, et al.
Published: (2026)
by: Bao, Yicheng, et al.
Published: (2026)
Fostering Intrinsic Motivation in Reinforcement Learning with Pretrained Foundation Models
by: Andres, Alain, et al.
Published: (2024)
by: Andres, Alain, et al.
Published: (2024)
Data-centric Federated Graph Learning with Large Language Models
by: Yan, Bo, et al.
Published: (2025)
by: Yan, Bo, et al.
Published: (2025)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
Guardian: Decoupling Exploration from Safety in Reinforcement Learning
by: Cai, Kaitong, et al.
Published: (2025)
by: Cai, Kaitong, et al.
Published: (2025)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
by: Richemond, Pierre Harvey, et al.
Published: (2024)
by: Richemond, Pierre Harvey, et al.
Published: (2024)
More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling
by: Ishfaq, Haque, et al.
Published: (2024)
by: Ishfaq, Haque, et al.
Published: (2024)
Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
by: Yu, Zhiyin, et al.
Published: (2026)
by: Yu, Zhiyin, et al.
Published: (2026)
Offline Model-Based Reinforcement Learning with Anti-Exploration
by: Srinivasan, Padmanaba, et al.
Published: (2024)
by: Srinivasan, Padmanaba, et al.
Published: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2024)
by: Xi, Zhiheng, et al.
Published: (2024)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
by: Li, Gen, et al.
Published: (2025)
by: Li, Gen, et al.
Published: (2025)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
by: Sun, Hao, et al.
Published: (2024)
by: Sun, Hao, et al.
Published: (2024)
Discovering Reinforcement Learning Interfaces with Large Language Models
by: Jaswal, Akshat Singh, et al.
Published: (2026)
by: Jaswal, Akshat Singh, et al.
Published: (2026)
Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning
by: Mete, Akshay, et al.
Published: (2026)
by: Mete, Akshay, et al.
Published: (2026)
Stabilizing Reinforcement Learning for Diffusion Language Models
by: Zhong, Jianyuan, et al.
Published: (2026)
by: Zhong, Jianyuan, et al.
Published: (2026)
Guided Exploration for Efficient Relational Model Learning
by: Feng, Annie, et al.
Published: (2025)
by: Feng, Annie, et al.
Published: (2025)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
by: Liu, Jia, et al.
Published: (2025)
by: Liu, Jia, et al.
Published: (2025)
Improving Intrinsic Exploration by Creating Stationary Objectives
by: Castanyer, Roger Creus, et al.
Published: (2023)
by: Castanyer, Roger Creus, et al.
Published: (2023)
From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning
by: Zeqiao, Li, et al.
Published: (2025)
by: Zeqiao, Li, et al.
Published: (2025)
Exploring Graph Structure Comprehension Ability of Multimodal Large Language Models: Case Studies
by: Zhong, Zhiqiang, et al.
Published: (2024)
by: Zhong, Zhiqiang, et al.
Published: (2024)
Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning
by: Nguyen, Viet Bac, et al.
Published: (2026)
by: Nguyen, Viet Bac, et al.
Published: (2026)
Surprise-Adaptive Intrinsic Motivation for Unsupervised Reinforcement Learning
by: Hugessen, Adriana, et al.
Published: (2024)
by: Hugessen, Adriana, et al.
Published: (2024)
FedKRSO: Communication and Memory Efficient Federated Fine-Tuning of Large Language Models
by: Yang, Guohao, et al.
Published: (2026)
by: Yang, Guohao, et al.
Published: (2026)
Ask more, know better: Reinforce-Learned Prompt Questions for Decision Making with Large Language Models
by: Yan, Xue, et al.
Published: (2023)
by: Yan, Xue, et al.
Published: (2023)
Similar Items
-
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
by: Chen, Kesheng, et al.
Published: (2025) -
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
by: Dai, Runpeng, et al.
Published: (2025) -
Prediction of Bank Credit Ratings using Heterogeneous Topological Graph Neural Networks
by: Liu, Junyi, et al.
Published: (2025) -
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025) -
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
by: Wang, Yibo, et al.
Published: (2024)