LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Heng, Yan, Hua, Yang, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bridging Policy and Real-World Dynamics: LLM-Augmented Rebalancing for Shared Micromobility Systems
par: Tan, Heng, et autres
Publié: (2026)
par: Tan, Heng, et autres
Publié: (2026)
Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation
par: Yan, Hua, et autres
Publié: (2026)
par: Yan, Hua, et autres
Publié: (2026)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
par: Cheng, Zelei, et autres
Publié: (2024)
par: Cheng, Zelei, et autres
Publié: (2024)
Bayesian Concept Bottleneck Models with LLM Priors
par: Feng, Jean, et autres
Publié: (2024)
par: Feng, Jean, et autres
Publié: (2024)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
par: Tan, Zelin, et autres
Publié: (2025)
par: Tan, Zelin, et autres
Publié: (2025)
CausalGDP: Causality-Guided Diffusion Policies for Reinforcement Learning
par: Xiao, Xiaofeng, et autres
Publié: (2026)
par: Xiao, Xiaofeng, et autres
Publié: (2026)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
PAC-Bayesian Reinforcement Learning Trains Generalizable Policies
par: Zitouni, Abdelkrim, et autres
Publié: (2025)
par: Zitouni, Abdelkrim, et autres
Publié: (2025)
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search
par: Liu, Max, et autres
Publié: (2024)
par: Liu, Max, et autres
Publié: (2024)
Policy Guided Tree Search for Enhanced LLM Reasoning
par: Li, Yang
Publié: (2025)
par: Li, Yang
Publié: (2025)
Heterogeneous Information-Bottleneck Coordination Graphs for Multi-Agent Reinforcement Learning
par: Duan, Wei, et autres
Publié: (2026)
par: Duan, Wei, et autres
Publié: (2026)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
Policy Learning with a Language Bottleneck
par: Srivastava, Megha, et autres
Publié: (2024)
par: Srivastava, Megha, et autres
Publié: (2024)
Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards
par: Zhang, Hanping, et autres
Publié: (2025)
par: Zhang, Hanping, et autres
Publié: (2025)
Addressing Concept Mislabeling in Concept Bottleneck Models Through Preference Optimization
par: Penaloza, Emiliano, et autres
Publié: (2025)
par: Penaloza, Emiliano, et autres
Publié: (2025)
Diagnosing Training Inference Mismatch in LLM Reinforcement Learning
par: Zhong, Tianle, et autres
Publié: (2026)
par: Zhong, Tianle, et autres
Publié: (2026)
Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages
par: Ma, Guozheng, et autres
Publié: (2023)
par: Ma, Guozheng, et autres
Publié: (2023)
Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
par: Lu, Jian
Publié: (2025)
par: Lu, Jian
Publié: (2025)
IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck
par: Deng, Huilin, et autres
Publié: (2026)
par: Deng, Huilin, et autres
Publié: (2026)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
par: Cai, Ruichu, et autres
Publié: (2024)
par: Cai, Ruichu, et autres
Publié: (2024)
Guiding Exploration in Reinforcement Learning Through LLM-Augmented Observations
par: Jain, Vaibhav, et autres
Publié: (2025)
par: Jain, Vaibhav, et autres
Publié: (2025)
Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning
par: Nourzad, Narjes, et autres
Publié: (2026)
par: Nourzad, Narjes, et autres
Publié: (2026)
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
par: He, Zhongyu, et autres
Publié: (2026)
par: He, Zhongyu, et autres
Publié: (2026)
Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning
par: Tiofack, Franki Nguimatsia, et autres
Publié: (2025)
par: Tiofack, Franki Nguimatsia, et autres
Publié: (2025)
Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
par: Melo, Luckeciano C., et autres
Publié: (2025)
par: Melo, Luckeciano C., et autres
Publié: (2025)
LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
par: Zhang, Hanping, et autres
Publié: (2025)
par: Zhang, Hanping, et autres
Publié: (2025)
The Definitive Guide to Policy Gradients in Deep Reinforcement Learning: Theory, Algorithms and Implementations
par: Lehmann, Matthias
Publié: (2024)
par: Lehmann, Matthias
Publié: (2024)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy
par: Gao, Shujian, et autres
Publié: (2026)
par: Gao, Shujian, et autres
Publié: (2026)
Learning From Graph-Structured Data: Addressing Design Issues and Exploring Practical Applications in Graph Representation Learning
par: Hua, Chenqing
Publié: (2024)
par: Hua, Chenqing
Publié: (2024)
Operator-Guided Invariance Learning for Continuous Reinforcement Learning
par: Zhang, Zuyuan, et autres
Publié: (2026)
par: Zhang, Zuyuan, et autres
Publié: (2026)
Highly Parallelized Reinforcement Learning Training with Relaxed Assignment Dependencies
par: He, Zhouyu, et autres
Publié: (2025)
par: He, Zhouyu, et autres
Publié: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2025)
par: Gao, Chen-Xiao, et autres
Publié: (2025)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
par: Wu, Bo, et autres
Publié: (2025)
par: Wu, Bo, et autres
Publié: (2025)
The Interaction Bottleneck of Deep Neural Networks: Discovery, Proof, and Modulation
par: Deng, Huiqi, et autres
Publié: (2025)
par: Deng, Huiqi, et autres
Publié: (2025)
TimeSieve: Extracting Temporal Dynamics through Information Bottlenecks
par: Feng, Ninghui, et autres
Publié: (2024)
par: Feng, Ninghui, et autres
Publié: (2024)
Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning
par: Lanier, Michael, et autres
Publié: (2024)
par: Lanier, Michael, et autres
Publié: (2024)
Reinforcement Learning by Guided Safe Exploration
par: Yang, Qisong, et autres
Publié: (2023)
par: Yang, Qisong, et autres
Publié: (2023)
Documents similaires
-
Bridging Policy and Real-World Dynamics: LLM-Augmented Rebalancing for Shared Micromobility Systems
par: Tan, Heng, et autres
Publié: (2026) -
Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation
par: Yan, Hua, et autres
Publié: (2026) -
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025) -
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
par: Cheng, Zelei, et autres
Publié: (2024) -
Bayesian Concept Bottleneck Models with LLM Priors
par: Feng, Jean, et autres
Publié: (2024)