Goal-Guided Efficient Exploration via Large Language Model in Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Qi, Yajie, Wei, Wei, Li, Lin, Zhang, Lijun, Gao, Zhidong, Wang, Da, Song, Huizhong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Risk-aware Direct Preference Optimization under Nested Risk Measure
von: Zhang, Lijun, et al.
Veröffentlicht: (2025)
von: Zhang, Lijun, et al.
Veröffentlicht: (2025)
Preference-Guided Reinforcement Learning for Efficient Exploration
von: Wang, Guojian, et al.
Veröffentlicht: (2024)
von: Wang, Guojian, et al.
Veröffentlicht: (2024)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
von: Sun, Yan, et al.
Veröffentlicht: (2025)
von: Sun, Yan, et al.
Veröffentlicht: (2025)
Efficient Reinforcement Learning via Decoupling Exploration and Utilization
von: Yang, Jingpu, et al.
Veröffentlicht: (2023)
von: Yang, Jingpu, et al.
Veröffentlicht: (2023)
Efficient Reinforcement Learning with Large Language Model Priors
von: Yan, Xue, et al.
Veröffentlicht: (2024)
von: Yan, Xue, et al.
Veröffentlicht: (2024)
Goal Exploration via Adaptive Skill Distribution for Goal-Conditioned Reinforcement Learning
von: Wu, Lisheng, et al.
Veröffentlicht: (2024)
von: Wu, Lisheng, et al.
Veröffentlicht: (2024)
AREAL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment
von: Zhang, Lijun, et al.
Veröffentlicht: (2025)
von: Zhang, Lijun, et al.
Veröffentlicht: (2025)
Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows
von: Garg, Shaswat, et al.
Veröffentlicht: (2026)
von: Garg, Shaswat, et al.
Veröffentlicht: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
von: Dai, Runpeng, et al.
Veröffentlicht: (2025)
von: Dai, Runpeng, et al.
Veröffentlicht: (2025)
Parameter-Efficient Tuning Large Language Models for Graph Representation Learning
von: Zhu, Qi, et al.
Veröffentlicht: (2024)
von: Zhu, Qi, et al.
Veröffentlicht: (2024)
Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning
von: Wang, Yiran, et al.
Veröffentlicht: (2024)
von: Wang, Yiran, et al.
Veröffentlicht: (2024)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
von: Wang, Qi, et al.
Veröffentlicht: (2025)
von: Wang, Qi, et al.
Veröffentlicht: (2025)
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search
von: Liu, Max, et al.
Veröffentlicht: (2024)
von: Liu, Max, et al.
Veröffentlicht: (2024)
LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
von: Hao, Qianyue, et al.
Veröffentlicht: (2025)
Reasoning-preserved Efficient Distillation of Large Language Models via Activation-aware Initialization
von: He, Junlin, et al.
Veröffentlicht: (2026)
von: He, Junlin, et al.
Veröffentlicht: (2026)
Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation
von: Lee, Donghoon, et al.
Veröffentlicht: (2025)
von: Lee, Donghoon, et al.
Veröffentlicht: (2025)
On Efficient Bayesian Exploration in Model-Based Reinforcement Learning
von: Caron, Alberto, et al.
Veröffentlicht: (2025)
von: Caron, Alberto, et al.
Veröffentlicht: (2025)
Random Latent Exploration for Deep Reinforcement Learning
von: Mahankali, Srinath, et al.
Veröffentlicht: (2024)
von: Mahankali, Srinath, et al.
Veröffentlicht: (2024)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
von: Wang, Chen, et al.
Veröffentlicht: (2025)
von: Wang, Chen, et al.
Veröffentlicht: (2025)
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
von: Li, Ziniu, et al.
Veröffentlicht: (2023)
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models
von: Huang, Shiting, et al.
Veröffentlicht: (2026)
von: Huang, Shiting, et al.
Veröffentlicht: (2026)
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration
von: Li, Chunxiao, et al.
Veröffentlicht: (2026)
von: Li, Chunxiao, et al.
Veröffentlicht: (2026)
Guided Exploration for Efficient Relational Model Learning
von: Feng, Annie, et al.
Veröffentlicht: (2025)
von: Feng, Annie, et al.
Veröffentlicht: (2025)
Reinforcement Learning by Guided Safe Exploration
von: Yang, Qisong, et al.
Veröffentlicht: (2023)
von: Yang, Qisong, et al.
Veröffentlicht: (2023)
Guiding Reinforcement Learning Using Uncertainty-Aware Large Language Models
von: Shoaeinaeini, Maryam, et al.
Veröffentlicht: (2024)
von: Shoaeinaeini, Maryam, et al.
Veröffentlicht: (2024)
Goal Discovery with Causal Capacity for Efficient Reinforcement Learning
von: Yu, Yan, et al.
Veröffentlicht: (2025)
von: Yu, Yan, et al.
Veröffentlicht: (2025)
ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management
von: Zhao, Lingjie, et al.
Veröffentlicht: (2025)
von: Zhao, Lingjie, et al.
Veröffentlicht: (2025)
Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
Large Language Model-Enhanced Reinforcement Learning for Generic Bus Holding Control Strategies
von: Yu, Jiajie, et al.
Veröffentlicht: (2024)
von: Yu, Jiajie, et al.
Veröffentlicht: (2024)
SHAP-Guided Kernel Actor-Critic for Explainable Reinforcement Learning
von: Li, Na, et al.
Veröffentlicht: (2025)
von: Li, Na, et al.
Veröffentlicht: (2025)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
GCHR : Goal-Conditioned Hindsight Regularization for Sample-Efficient Reinforcement Learning
von: Lei, Xing, et al.
Veröffentlicht: (2025)
von: Lei, Xing, et al.
Veröffentlicht: (2025)
Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression
von: Tang, Yuntian, et al.
Veröffentlicht: (2026)
von: Tang, Yuntian, et al.
Veröffentlicht: (2026)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
Guided Exploration in Reinforcement Learning via Monte Carlo Critic Optimization
von: Kuznetsov, Igor
Veröffentlicht: (2022)
von: Kuznetsov, Igor
Veröffentlicht: (2022)
Exploration-Driven Optimization for Test-Time Large Language Model Reasoning
von: Li, Changhao, et al.
Veröffentlicht: (2026)
von: Li, Changhao, et al.
Veröffentlicht: (2026)
AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
von: Lin, Xuan, et al.
Veröffentlicht: (2025)
von: Lin, Xuan, et al.
Veröffentlicht: (2025)
AFLoRA: Adaptive Federated Fine-Tuning of Large Language Models with Resource-Aware Low-Rank Adaption
von: Zhou, Yajie, et al.
Veröffentlicht: (2025)
von: Zhou, Yajie, et al.
Veröffentlicht: (2025)
TGRL: An Algorithm for Teacher Guided Reinforcement Learning
von: Shenfeld, Idan, et al.
Veröffentlicht: (2023)
von: Shenfeld, Idan, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Risk-aware Direct Preference Optimization under Nested Risk Measure
von: Zhang, Lijun, et al.
Veröffentlicht: (2025) -
Preference-Guided Reinforcement Learning for Efficient Exploration
von: Wang, Guojian, et al.
Veröffentlicht: (2024) -
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
von: Sun, Yan, et al.
Veröffentlicht: (2025) -
Efficient Reinforcement Learning via Decoupling Exploration and Utilization
von: Yang, Jingpu, et al.
Veröffentlicht: (2023) -
Efficient Reinforcement Learning with Large Language Model Priors
von: Yan, Xue, et al.
Veröffentlicht: (2024)