Enhancing LLM Agents for Code Generation with Possibility and Pass-rate Prioritized Experience Replay
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Yuyang, Zhao, Kaiyan, Wang, Yiming, Yang, Ming, Zhang, Jian, Niu, Xiaoguang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
par: Zhao, Kaiyan, et autres
Publié: (2024)
par: Zhao, Kaiyan, et autres
Publié: (2024)
Investigating the Interplay of Prioritized Replay and Generalization
par: Panahi, Parham Mohammad, et autres
Publié: (2024)
par: Panahi, Parham Mohammad, et autres
Publié: (2024)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay
par: Perkins, Daniel, et autres
Publié: (2025)
par: Perkins, Daniel, et autres
Publié: (2025)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023)
par: Liu, Jinyi, et autres
Publié: (2023)
D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
Anon: Extrapolating Adaptivity Beyond SGD and Adam
par: Zhang, Yiheng, et autres
Publié: (2026)
par: Zhang, Yiheng, et autres
Publié: (2026)
Prioritized Replay for RL Post-training
par: Fatemi, Mehdi
Publié: (2026)
par: Fatemi, Mehdi
Publié: (2026)
VLM-Guided Experience Replay
par: Sharony, Elad, et autres
Publié: (2026)
par: Sharony, Elad, et autres
Publié: (2026)
Experience Replay with Random Reshuffling
par: Fujita, Yasuhiro
Publié: (2025)
par: Fujita, Yasuhiro
Publié: (2025)
Generalized Back-Stepping Experience Replay in Sparse-Reward Environments
par: Lyu, Guwen, et autres
Publié: (2024)
par: Lyu, Guwen, et autres
Publié: (2024)
ROER: Regularized Optimal Experience Replay
par: Li, Changling, et autres
Publié: (2024)
par: Li, Changling, et autres
Publié: (2024)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
par: Jiang, Zhizheng, et autres
Publié: (2026)
par: Jiang, Zhizheng, et autres
Publié: (2026)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
par: Li, Haoran, et autres
Publié: (2024)
par: Li, Haoran, et autres
Publié: (2024)
CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing
par: Yang, Chen, et autres
Publié: (2024)
par: Yang, Chen, et autres
Publié: (2024)
GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
par: Zhang, Yunan, et autres
Publié: (2025)
par: Zhang, Yunan, et autres
Publié: (2025)
Exploring Pass-Rate Reward in Reinforcement Learning for Code Generation
par: Li, Xin-Ye, et autres
Publié: (2026)
par: Li, Xin-Ye, et autres
Publié: (2026)
Better Generative Replay for Continual Federated Learning
par: Qi, Daiqing, et autres
Publié: (2023)
par: Qi, Daiqing, et autres
Publié: (2023)
ANO: A Principled Approach to Robust Policy Optimization
par: Zhang, Yiheng, et autres
Publié: (2026)
par: Zhang, Yiheng, et autres
Publié: (2026)
Mastering the Game of Go with Self-play Experience Replay
par: Liu, Jingbin, et autres
Publié: (2026)
par: Liu, Jingbin, et autres
Publié: (2026)
Contextual Experience Replay for Self-Improvement of Language Agents
par: Liu, Yitao, et autres
Publié: (2025)
par: Liu, Yitao, et autres
Publié: (2025)
Sample Efficient Experience Replay in Non-stationary Environments
par: Duan, Tianyang, et autres
Publié: (2025)
par: Duan, Tianyang, et autres
Publié: (2025)
Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents
par: Li, Ziming, et autres
Publié: (2026)
par: Li, Ziming, et autres
Publié: (2026)
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Finite-Time Analysis of Temporal Difference Learning with Experience Replay
par: Lim, Han-Dong, et autres
Publié: (2023)
par: Lim, Han-Dong, et autres
Publié: (2023)
Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
par: Ma, Weiyu, et autres
Publié: (2026)
par: Ma, Weiyu, et autres
Publié: (2026)
Experience Replay Addresses Loss of Plasticity in Continual Learning
par: Wang, Jiuqi, et autres
Publié: (2025)
par: Wang, Jiuqi, et autres
Publié: (2025)
CIER: A Novel Experience Replay Approach with Causal Inference in Deep Reinforcement Learning
par: Wang, Jingwen, et autres
Publié: (2024)
par: Wang, Jingwen, et autres
Publié: (2024)
Prioritize Alignment in Dataset Distillation
par: Li, Zekai, et autres
Publié: (2024)
par: Li, Zekai, et autres
Publié: (2024)
Catastrophic Forgetting Mitigation via Discrepancy-Weighted Experience Replay
par: Xu, Xinrun, et autres
Publié: (2025)
par: Xu, Xinrun, et autres
Publié: (2025)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
par: Romio, Gabriel, et autres
Publié: (2026)
par: Romio, Gabriel, et autres
Publié: (2026)
RePO: Replay-Enhanced Policy Optimization
par: Li, Siheng, et autres
Publié: (2025)
par: Li, Siheng, et autres
Publié: (2025)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
par: Liu, Jinmei, et autres
Publié: (2024)
par: Liu, Jinmei, et autres
Publié: (2024)
Uncertainty Prioritized Experience Replay
par: Carrasco-Davis, Rodrigo, et autres
Publié: (2025)
par: Carrasco-Davis, Rodrigo, et autres
Publié: (2025)
EVA-0: Test-Time Model Evolution with Only Two Forward Passes per Sample
par: Chen, Guohao, et autres
Publié: (2026)
par: Chen, Guohao, et autres
Publié: (2026)
On the Convergence of Experience Replay in Policy Optimization: Characterizing Bias, Variance, and Finite-Time Convergence
par: Zheng, Hua, et autres
Publié: (2021)
par: Zheng, Hua, et autres
Publié: (2021)
Decocted Experience Improves Test-Time Inference in LLM Agents
par: Shen, Maohao, et autres
Publié: (2026)
par: Shen, Maohao, et autres
Publié: (2026)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
par: Ding, Yifeng, et autres
Publié: (2026)
par: Ding, Yifeng, et autres
Publié: (2026)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
par: Lu, Yiyang, et autres
Publié: (2026)
par: Lu, Yiyang, et autres
Publié: (2026)
Documents similaires
-
Efficient Diversity-based Experience Replay for Deep Reinforcement Learning
par: Zhao, Kaiyan, et autres
Publié: (2024) -
Investigating the Interplay of Prioritized Replay and Generalization
par: Panahi, Parham Mohammad, et autres
Publié: (2024) -
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
par: Butt, Natasha, et autres
Publié: (2024) -
DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay
par: Perkins, Daniel, et autres
Publié: (2025) -
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023)