Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Junmin, Wu, Ruofan, Si, Jennie |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Actor-Critic Reinforcement Learning with Phased Actor
par: Wu, Ruofan, et autres
Publié: (2024)
par: Wu, Ruofan, et autres
Publié: (2024)
Averaging $n$-step Returns Reduces Variance in Reinforcement Learning
par: Daley, Brett, et autres
Publié: (2024)
par: Daley, Brett, et autres
Publié: (2024)
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025)
par: Chen, Zijun, et autres
Publié: (2025)
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
par: Zeng, Guanning, et autres
Publié: (2025)
par: Zeng, Guanning, et autres
Publié: (2025)
Reducing Variance Caused by Communication in Decentralized Multi-agent Deep Reinforcement Learning
par: Zhu, Changxi, et autres
Publié: (2025)
par: Zhu, Changxi, et autres
Publié: (2025)
Calibration-then-Calculation: A Variance Reduced Metric Framework in Deep Click-Through Rate Prediction Models
par: Fan, Yewen, et autres
Publié: (2024)
par: Fan, Yewen, et autres
Publié: (2024)
Effective Reward Specification in Deep Reinforcement Learning
par: Roy, Julien
Publié: (2024)
par: Roy, Julien
Publié: (2024)
Curriculum Reinforcement Learning for Complex Reward Functions
par: Freitag, Kilian, et autres
Publié: (2024)
par: Freitag, Kilian, et autres
Publié: (2024)
On the Stochastic (Variance-Reduced) Proximal Gradient Method for Regularized Expected Reward Optimization
par: Liang, Ling, et autres
Publié: (2024)
par: Liang, Ling, et autres
Publié: (2024)
Deep Reinforcement Learning with Hybrid Intrinsic Reward Model
par: Yuan, Mingqi, et autres
Publié: (2025)
par: Yuan, Mingqi, et autres
Publié: (2025)
Understanding the Generalization of Bilevel Programming in Hyperparameter Optimization: A Tale of Bias-Variance Decomposition
par: Zhou, Yubo, et autres
Publié: (2026)
par: Zhou, Yubo, et autres
Publié: (2026)
Expert Proximity as Surrogate Rewards for Single Demonstration Imitation Learning
par: Chiang, Chia-Cheng, et autres
Publié: (2024)
par: Chiang, Chia-Cheng, et autres
Publié: (2024)
Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning
par: Yin, Shuyu, et autres
Publié: (2024)
par: Yin, Shuyu, et autres
Publié: (2024)
Decoupling Task and Behavior: A Two-Stage Reward Curriculum in Reinforcement Learning for Robotics
par: Freitag, Kilian, et autres
Publié: (2026)
par: Freitag, Kilian, et autres
Publié: (2026)
Reinforcement Learning from Bagged Reward
par: Tang, Yuting, et autres
Publié: (2024)
par: Tang, Yuting, et autres
Publié: (2024)
Total Uncertainty Quantification in Inverse PDE Solutions Obtained with Reduced-Order Deep Learning Surrogate Models
par: Wang, Yuanzhe, et autres
Publié: (2024)
par: Wang, Yuanzhe, et autres
Publié: (2024)
Sample Complexity of Variance-reduced Distributionally Robust Q-learning
par: Wang, Shengbo, et autres
Publié: (2023)
par: Wang, Shengbo, et autres
Publié: (2023)
Reward Models in Deep Reinforcement Learning: A Survey
par: Yu, Rui, et autres
Publié: (2025)
par: Yu, Rui, et autres
Publié: (2025)
Variance-aware Reward Modeling with Anchor Guidance
par: Fang, Shuxing, et autres
Publié: (2026)
par: Fang, Shuxing, et autres
Publié: (2026)
Generalization in Deep Reinforcement Learning for Robotic Navigation by Reward Shaping
par: Miranda, Victor R. F., et autres
Publié: (2022)
par: Miranda, Victor R. F., et autres
Publié: (2022)
Near-Optimal Sample Complexity in Reward-Free Kernel-Based Reinforcement Learning
par: Kayal, Aya, et autres
Publié: (2025)
par: Kayal, Aya, et autres
Publié: (2025)
Autonomous Pressure Control in MuVacAS via Deep Reinforcement Learning and Deep Learning Surrogate Models
par: Rodriguez-Llorente, Guillermo, et autres
Publié: (2025)
par: Rodriguez-Llorente, Guillermo, et autres
Publié: (2025)
Variance-Reduced Cascade Q-learning: Algorithms and Sample Complexity
par: Boveiri, Mohammad, et autres
Publié: (2024)
par: Boveiri, Mohammad, et autres
Publié: (2024)
Variance-Reducing Couplings for Random Features
par: Reid, Isaac, et autres
Publié: (2024)
par: Reid, Isaac, et autres
Publié: (2024)
Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning
par: Beutel, Alex, et autres
Publié: (2024)
par: Beutel, Alex, et autres
Publié: (2024)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
par: Jia, Zhiwei, et autres
Publié: (2024)
par: Jia, Zhiwei, et autres
Publié: (2024)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
Multi-Armed Bandits With Machine Learning-Generated Surrogate Rewards
par: Ji, Wenlong, et autres
Publié: (2025)
par: Ji, Wenlong, et autres
Publié: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
Sample Complexity of Average-Reward Q-Learning: From Single-agent to Federated Reinforcement Learning
par: Jiao, Yuchen, et autres
Publié: (2026)
par: Jiao, Yuchen, et autres
Publié: (2026)
On the Reduction of Variance and Overestimation of Deep Q-Learning
par: Sabry, Mohammed, et autres
Publié: (2019)
par: Sabry, Mohammed, et autres
Publié: (2019)
Reward-Conditioned Reinforcement Learning
par: Nauman, Michal, et autres
Publié: (2026)
par: Nauman, Michal, et autres
Publié: (2026)
Testing of Deep Reinforcement Learning Agents with Surrogate Models
par: Biagiola, Matteo, et autres
Publié: (2023)
par: Biagiola, Matteo, et autres
Publié: (2023)
Reducing Variance in Meta-Learning via Laplace Approximation for Regression Tasks
par: Reichlin, Alfredo, et autres
Publié: (2024)
par: Reichlin, Alfredo, et autres
Publié: (2024)
TEACH: Temporal Variance-Driven Curriculum for Reinforcement Learning
par: Chaudhary, Gaurav, et autres
Publié: (2025)
par: Chaudhary, Gaurav, et autres
Publié: (2025)
StagePilot: A Deep Reinforcement Learning Agent for Stage-Controlled Cybergrooming Simulation
par: An, Heajun, et autres
Publié: (2026)
par: An, Heajun, et autres
Publié: (2026)
Transformers as Unsupervised Learning Algorithms: A study on Gaussian Mixtures
par: Chen, Zhiheng, et autres
Publié: (2025)
par: Chen, Zhiheng, et autres
Publié: (2025)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
par: Tang, Yuting, et autres
Publié: (2024)
par: Tang, Yuting, et autres
Publié: (2024)
TSSR: Two-Stage Swap-Reward-Driven Reinforcement Learning for Character-Level SMILES Generation
par: Levine, Jacob Ede, et autres
Publié: (2026)
par: Levine, Jacob Ede, et autres
Publié: (2026)
Shielded Deep Reinforcement Learning for Complex Spacecraft Tasking
par: Reed, Robert, et autres
Publié: (2024)
par: Reed, Robert, et autres
Publié: (2024)
Documents similaires
-
Actor-Critic Reinforcement Learning with Phased Actor
par: Wu, Ruofan, et autres
Publié: (2024) -
Averaging $n$-step Returns Reduces Variance in Reinforcement Learning
par: Daley, Brett, et autres
Publié: (2024) -
Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
par: Chen, Zijun, et autres
Publié: (2025) -
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
par: Zeng, Guanning, et autres
Publié: (2025) -
Reducing Variance Caused by Communication in Decentralized Multi-agent Deep Reinforcement Learning
par: Zhu, Changxi, et autres
Publié: (2025)