Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Wenjian, Zhang, Kongcheng, Qi, Jiaxin, Lai, Baisheng, Huang, Jianqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
Reasoning with Reinforced Functional Token Tuning
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
Gene Incremental Learning for Single-Cell Transcriptomics
di: Qi, Jiaxin, et al.
Pubblicazione: (2025)
di: Qi, Jiaxin, et al.
Pubblicazione: (2025)
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
di: Chen, Kesheng, et al.
Pubblicazione: (2025)
Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs
di: Jiang, Zishang, et al.
Pubblicazione: (2025)
di: Jiang, Zishang, et al.
Pubblicazione: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
Targeted Exploration via Unified Entropy Control for Reinforcement Learning
di: Wang, Chen, et al.
Pubblicazione: (2026)
di: Wang, Chen, et al.
Pubblicazione: (2026)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data
di: Fang, Wenkai, et al.
Pubblicazione: (2025)
di: Fang, Wenkai, et al.
Pubblicazione: (2025)
Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
A Comprehensive Benchmark for Electrocardiogram Time-Series
di: Tang, Zhijiang, et al.
Pubblicazione: (2025)
di: Tang, Zhijiang, et al.
Pubblicazione: (2025)
Joint Intrinsic Motivation for Coordinated Exploration in Multi-Agent Deep Reinforcement Learning
di: Toquebiau, Maxime, et al.
Pubblicazione: (2024)
di: Toquebiau, Maxime, et al.
Pubblicazione: (2024)
Is Exploration All You Need? Effective Exploration Characteristics for Transfer in Reinforcement Learning
di: Balloch, Jonathan C., et al.
Pubblicazione: (2024)
di: Balloch, Jonathan C., et al.
Pubblicazione: (2024)
Towards Universal Gene Regulatory Network Inference: Unlocking Generalizable Regulatory Knowledge in Single-cell Foundation Models
di: Qi, Jiaxin, et al.
Pubblicazione: (2026)
di: Qi, Jiaxin, et al.
Pubblicazione: (2026)
Constrained Intrinsic Motivation for Reinforcement Learning
di: Zheng, Xiang, et al.
Pubblicazione: (2024)
di: Zheng, Xiang, et al.
Pubblicazione: (2024)
Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
Towards Reinforcement Learning for Exploration of Speculative Execution Vulnerabilities
di: Lai, Evan, et al.
Pubblicazione: (2025)
di: Lai, Evan, et al.
Pubblicazione: (2025)
Spatial Transcriptomics as Images for Large-Scale Pretraining
di: Zhu, Yishun, et al.
Pubblicazione: (2026)
di: Zhu, Yishun, et al.
Pubblicazione: (2026)
Entropy-Aware Model Initialization for Effective Exploration in Deep Reinforcement Learning
di: Jang, Sooyoung, et al.
Pubblicazione: (2021)
di: Jang, Sooyoung, et al.
Pubblicazione: (2021)
In Search of Lost DNA Sequence Pretraining
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
di: Tang, Zhijiang, et al.
Pubblicazione: (2026)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
di: Deng, Wenhao, et al.
Pubblicazione: (2025)
Plasticine: Accelerating Research in Plasticity-Motivated Deep Reinforcement Learning
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
di: Yuan, Mingqi, et al.
Pubblicazione: (2025)
Merge then Realign: Simple and Effective Modality-Incremental Continual Learning for Multimodal LLMs
di: Zhang, Dingkun, et al.
Pubblicazione: (2025)
di: Zhang, Dingkun, et al.
Pubblicazione: (2025)
Trapezoidal Gradient Descent for Effective Reinforcement Learning in Spiking Networks
di: Pan, Yuhao, et al.
Pubblicazione: (2024)
di: Pan, Yuhao, et al.
Pubblicazione: (2024)
Guardian: Decoupling Exploration from Safety in Reinforcement Learning
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
di: Beigi, Mohammad, et al.
Pubblicazione: (2026)
Off-policy Reinforcement Learning with Model-based Exploration Augmentation
di: Wang, Likun, et al.
Pubblicazione: (2025)
di: Wang, Likun, et al.
Pubblicazione: (2025)
Effective Reinforcement Learning for Reasoning in Language Models
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
di: Huang, Lianghuan, et al.
Pubblicazione: (2025)
Intrinsically-Motivated Humans and Agents in Open-World Exploration
di: Lidayan, Aly, et al.
Pubblicazione: (2025)
di: Lidayan, Aly, et al.
Pubblicazione: (2025)
Prioritized League Reinforcement Learning for Large-Scale Heterogeneous Multiagent Systems
di: Fu, Qingxu, et al.
Pubblicazione: (2024)
di: Fu, Qingxu, et al.
Pubblicazione: (2024)
CURIOUS: Intrinsically Motivated Modular Multi-Goal Reinforcement Learning
di: Colas, Cédric, et al.
Pubblicazione: (2018)
di: Colas, Cédric, et al.
Pubblicazione: (2018)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
di: Liang, Zhenwen, et al.
Pubblicazione: (2025)
Self-Clustering Hierarchical Multi-Agent Reinforcement Learning with Extensible Cooperation Graph
di: Fu, Qingxu, et al.
Pubblicazione: (2024)
di: Fu, Qingxu, et al.
Pubblicazione: (2024)
Reinforcement Learning with Intrinsically Motivated Feedback Graph for Lost-sales Inventory Control
di: Liu, Zifan, et al.
Pubblicazione: (2024)
di: Liu, Zifan, et al.
Pubblicazione: (2024)
Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents
di: Zhou, Zihao, et al.
Pubblicazione: (2023)
di: Zhou, Zihao, et al.
Pubblicazione: (2023)
Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
di: Zhang, Xinyu, et al.
Pubblicazione: (2025)
Evolutionary System Prompt Learning for Reinforcement Learning in LLMs
di: Zhang, Lunjun, et al.
Pubblicazione: (2026)
di: Zhang, Lunjun, et al.
Pubblicazione: (2026)
Learning to Balance Altruism and Self-interest Based on Empathy in Mixed-Motive Games
di: Kong, Fanqi, et al.
Pubblicazione: (2024)
di: Kong, Fanqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025) -
Reasoning with Reinforced Functional Token Tuning
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025) -
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025) -
Gene Incremental Learning for Single-Cell Transcriptomics
di: Qi, Jiaxin, et al.
Pubblicazione: (2025) -
MIR: Efficient Exploration in Episodic Multi-Agent Reinforcement Learning via Mutual Intrinsic Reward
di: Chen, Kesheng, et al.
Pubblicazione: (2025)