Evolutionary System Prompt Learning for Reinforcement Learning in LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Lunjun, Chen, Ryan, Stadie, Bradly C. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Mitigation in LLM Backtesting
by: Zhang, Zeyu, et al.
Published: (2026)
by: Zhang, Zeyu, et al.
Published: (2026)
EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL
by: Zhang, Lunjun, et al.
Published: (2026)
by: Zhang, Lunjun, et al.
Published: (2026)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
by: Zhang, Lunjun, et al.
Published: (2025)
by: Zhang, Lunjun, et al.
Published: (2025)
Tacit Learning with Adaptive Information Selection for Cooperative Multi-Agent Reinforcement Learning
by: Liu, Lunjun, et al.
Published: (2024)
by: Liu, Lunjun, et al.
Published: (2024)
TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting
by: Zhang, Zeyu, et al.
Published: (2026)
by: Zhang, Zeyu, et al.
Published: (2026)
Wonderful Team: Zero-Shot Physical Task Planning with Visual LLMs
by: Wang, Zidan, et al.
Published: (2024)
by: Wang, Zidan, et al.
Published: (2024)
Learning to Inject: Automated Prompt Injection via Reinforcement Learning
by: Chen, Xin, et al.
Published: (2026)
by: Chen, Xin, et al.
Published: (2026)
Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs
by: Zhou, Yifan, et al.
Published: (2025)
by: Zhou, Yifan, et al.
Published: (2025)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
by: Fu, Yuqian, et al.
Published: (2025)
by: Fu, Yuqian, et al.
Published: (2025)
Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models
by: Sygkounas, Alkis, et al.
Published: (2026)
by: Sygkounas, Alkis, et al.
Published: (2026)
PRewrite: Prompt Rewriting with Reinforcement Learning
by: Kong, Weize, et al.
Published: (2024)
by: Kong, Weize, et al.
Published: (2024)
Fairness-aware Multiobjective Evolutionary Learning
by: Zhang, Qingquan, et al.
Published: (2024)
by: Zhang, Qingquan, et al.
Published: (2024)
Surrogate-Assisted Evolutionary Reinforcement Learning Based on Autoencoder and Hyperbolic Neural Network
by: Li, Bingdong, et al.
Published: (2025)
by: Li, Bingdong, et al.
Published: (2025)
The Art of Scaling Reinforcement Learning Compute for LLMs
by: Khatri, Devvrit, et al.
Published: (2025)
by: Khatri, Devvrit, et al.
Published: (2025)
Meta-Learning for Cold-Start Personalization in Prompt-Tuned LLMs
by: Zhao, Yushang, et al.
Published: (2025)
by: Zhao, Yushang, et al.
Published: (2025)
SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
by: Liu, Huanyu, et al.
Published: (2025)
by: Liu, Huanyu, et al.
Published: (2025)
Kimi k1.5: Scaling Reinforcement Learning with LLMs
by: Kimi Team, et al.
Published: (2025)
by: Kimi Team, et al.
Published: (2025)
AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
by: Zheng, Haizhong, et al.
Published: (2026)
by: Zheng, Haizhong, et al.
Published: (2026)
CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs
by: Yao, Zhiyuan, et al.
Published: (2026)
by: Yao, Zhiyuan, et al.
Published: (2026)
Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval
by: Hsu, Sheryl, et al.
Published: (2024)
by: Hsu, Sheryl, et al.
Published: (2024)
Reinforcement Learning Enhanced LLMs: A Survey
by: Wang, Shuhe, et al.
Published: (2024)
by: Wang, Shuhe, et al.
Published: (2024)
Recurrent Reinforcement Learning with Memoroids
by: Morad, Steven, et al.
Published: (2024)
by: Morad, Steven, et al.
Published: (2024)
Affordance-Guided Reinforcement Learning via Visual Prompting
by: Lee, Olivia Y., et al.
Published: (2024)
by: Lee, Olivia Y., et al.
Published: (2024)
State-free Reinforcement Learning
by: Chen, Mingyu, et al.
Published: (2024)
by: Chen, Mingyu, et al.
Published: (2024)
Scale-free Adversarial Reinforcement Learning
by: Chen, Mingyu, et al.
Published: (2024)
by: Chen, Mingyu, et al.
Published: (2024)
Tabular Transfer Learning via Prompting LLMs
by: Nam, Jaehyun, et al.
Published: (2024)
by: Nam, Jaehyun, et al.
Published: (2024)
LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
by: Li, Ang, et al.
Published: (2025)
by: Li, Ang, et al.
Published: (2025)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
by: Guo, Xiaojun, et al.
Published: (2025)
by: Guo, Xiaojun, et al.
Published: (2025)
Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE
by: Zeng, Anxiang, et al.
Published: (2025)
by: Zeng, Anxiang, et al.
Published: (2025)
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
by: Zhang, Honglin, et al.
Published: (2025)
by: Zhang, Honglin, et al.
Published: (2025)
TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning
by: Zhang, Junru, et al.
Published: (2025)
by: Zhang, Junru, et al.
Published: (2025)
Reinforcement Learning-assisted Evolutionary Algorithm: A Survey and Research Opportunities
by: Song, Yanjie, et al.
Published: (2023)
by: Song, Yanjie, et al.
Published: (2023)
ORAN-GUIDE: RAG-Driven Prompt Learning for LLM-Augmented Reinforcement Learning in O-RAN Network Slicing
by: Lotfi, Fatemeh, et al.
Published: (2025)
by: Lotfi, Fatemeh, et al.
Published: (2025)
xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
by: Qian, Cheng, et al.
Published: (2025)
by: Qian, Cheng, et al.
Published: (2025)
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
by: Zhang, Jinghao, et al.
Published: (2025)
by: Zhang, Jinghao, et al.
Published: (2025)
List Replicable Reinforcement Learning
by: Zhang, Bohan, et al.
Published: (2025)
by: Zhang, Bohan, et al.
Published: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2024)
by: Gao, Chen-Xiao, et al.
Published: (2024)
DECRL: A Deep Evolutionary Clustering Jointed Temporal Knowledge Graph Representation Learning Approach
by: Chen, Qian, et al.
Published: (2024)
by: Chen, Qian, et al.
Published: (2024)
On Distributional Reinforcement Learning in Chaotic Dynamical Systems
by: Rudd-Jones, James, et al.
Published: (2026)
by: Rudd-Jones, James, et al.
Published: (2026)
Striking a Balance in Fairness for Dynamic Systems Through Reinforcement Learning
by: Hu, Yaowei, et al.
Published: (2024)
by: Hu, Yaowei, et al.
Published: (2024)
Similar Items
-
All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Mitigation in LLM Backtesting
by: Zhang, Zeyu, et al.
Published: (2026) -
EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL
by: Zhang, Lunjun, et al.
Published: (2026) -
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
by: Zhang, Lunjun, et al.
Published: (2025) -
Tacit Learning with Adaptive Information Selection for Cooperative Multi-Agent Reinforcement Learning
by: Liu, Lunjun, et al.
Published: (2024) -
TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting
by: Zhang, Zeyu, et al.
Published: (2026)