Variance Reduction Based Experience Replay for Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Hua, Xie, Wei, Feng, M. Ben, Choy, Keilung |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Convergence of Experience Replay in Policy Optimization: Characterizing Bias, Variance, and Finite-Time Convergence
di: Zheng, Hua, et al.
Pubblicazione: (2021)
di: Zheng, Hua, et al.
Pubblicazione: (2021)
Adjoint Sensitivity Analysis on Multi-Scale Bioprocess Stochastic Reaction Network
di: Choy, Keilung, et al.
Pubblicazione: (2024)
di: Choy, Keilung, et al.
Pubblicazione: (2024)
Digital Twin Calibration with Model-Based Reinforcement Learning
di: Zheng, Hua, et al.
Pubblicazione: (2025)
di: Zheng, Hua, et al.
Pubblicazione: (2025)
A Symbolic and Statistical Learning Framework to Discover Bioprocessing Regulatory Mechanism: Cell Culture Example
di: Choy, Keilung, et al.
Pubblicazione: (2025)
di: Choy, Keilung, et al.
Pubblicazione: (2025)
Variance Reduction via Resampling and Experience Replay
di: Han, Jiale, et al.
Pubblicazione: (2025)
di: Han, Jiale, et al.
Pubblicazione: (2025)
Hindsight Experience Replay Accelerates Proximal Policy Optimization
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
Global Convergence of Natural Policy Gradient with Hessian-aided Momentum Variance Reduction
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
Efficient Sign-Based Optimization: Accelerating Convergence via Variance Reduction
di: Jiang, Wei, et al.
Pubblicazione: (2024)
di: Jiang, Wei, et al.
Pubblicazione: (2024)
Match or Replay: Self Imitating Proximal Policy Optimization
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
LTL-Constrained Policy Optimization with Cycle Experience Replay
di: Shah, Ameesh, et al.
Pubblicazione: (2024)
di: Shah, Ameesh, et al.
Pubblicazione: (2024)
Maximum Entropy Hindsight Experience Replay
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
Revisiting Experience Replayable Conditions
di: Kobayashi, Taisuke
Pubblicazione: (2024)
di: Kobayashi, Taisuke
Pubblicazione: (2024)
Uncertainty Prioritized Experience Replay
di: Carrasco-Davis, Rodrigo, et al.
Pubblicazione: (2025)
di: Carrasco-Davis, Rodrigo, et al.
Pubblicazione: (2025)
Improving Tree Probability Estimation with Stochastic Optimization and Variance Reduction
di: Xie, Tianyu, et al.
Pubblicazione: (2024)
di: Xie, Tianyu, et al.
Pubblicazione: (2024)
Unifying On- and Off-Policy Variance Reduction Methods
di: Jeunen, Olivier
Pubblicazione: (2026)
di: Jeunen, Olivier
Pubblicazione: (2026)
Get Experience from Practice: LLM Agents with Record & Replay
di: Feng, Erhu, et al.
Pubblicazione: (2025)
di: Feng, Erhu, et al.
Pubblicazione: (2025)
Adaptive Variance Reduction for Stochastic Optimization under Weaker Assumptions
di: Jiang, Wei, et al.
Pubblicazione: (2024)
di: Jiang, Wei, et al.
Pubblicazione: (2024)
Diffusion Policy through Conditional Proximal Policy Optimization
di: Liu, Ben, et al.
Pubblicazione: (2026)
di: Liu, Ben, et al.
Pubblicazione: (2026)
DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay
di: Perkins, Daniel, et al.
Pubblicazione: (2025)
di: Perkins, Daniel, et al.
Pubblicazione: (2025)
ROER: Regularized Optimal Experience Replay
di: Li, Changling, et al.
Pubblicazione: (2024)
di: Li, Changling, et al.
Pubblicazione: (2024)
SPRINT: Stochastic Performative Prediction With Variance Reduction
di: Xie, Tian, et al.
Pubblicazione: (2025)
di: Xie, Tian, et al.
Pubblicazione: (2025)
Reliability-Adjusted Prioritized Experience Replay
di: Pleiss, Leonard S., et al.
Pubblicazione: (2025)
di: Pleiss, Leonard S., et al.
Pubblicazione: (2025)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
PolicyFlow: Policy Optimization with Continuous Normalizing Flow in Reinforcement Learning
di: Yang, Shunpeng, et al.
Pubblicazione: (2026)
di: Yang, Shunpeng, et al.
Pubblicazione: (2026)
VLM-Guided Experience Replay
di: Sharony, Elad, et al.
Pubblicazione: (2026)
di: Sharony, Elad, et al.
Pubblicazione: (2026)
Experience Replay with Random Reshuffling
di: Fujita, Yasuhiro
Pubblicazione: (2025)
di: Fujita, Yasuhiro
Pubblicazione: (2025)
Enhancing Deep Deterministic Policy Gradients on Continuous Control Tasks with Decoupled Prioritized Experience Replay
di: Lorasdagi, Mehmet Efe, et al.
Pubblicazione: (2025)
di: Lorasdagi, Mehmet Efe, et al.
Pubblicazione: (2025)
Optimal-Point Variance Reduction For Bayesian Optimization With Regret Guarantee
di: Takeno, Shion
Pubblicazione: (2026)
di: Takeno, Shion
Pubblicazione: (2026)
Efficient RL Training for LLMs with Experience Replay
di: Arnal, Charles, et al.
Pubblicazione: (2026)
di: Arnal, Charles, et al.
Pubblicazione: (2026)
Non-Uniform Memory Sampling in Experience Replay
di: Krutsylo, Andrii
Pubblicazione: (2025)
di: Krutsylo, Andrii
Pubblicazione: (2025)
On the Limitation and Experience Replay for GNNs in Continual Learning
di: Su, Junwei, et al.
Pubblicazione: (2023)
di: Su, Junwei, et al.
Pubblicazione: (2023)
Enabling On-Device Learning via Experience Replay with Efficient Dataset Condensation
di: Xu, Gelei, et al.
Pubblicazione: (2024)
di: Xu, Gelei, et al.
Pubblicazione: (2024)
Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization
di: Luis, Carlos E., et al.
Pubblicazione: (2023)
di: Luis, Carlos E., et al.
Pubblicazione: (2023)
Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction
di: Ying, Donghao, et al.
Pubblicazione: (2022)
di: Ying, Donghao, et al.
Pubblicazione: (2022)
On the Reduction of Variance and Overestimation of Deep Q-Learning
di: Sabry, Mohammed, et al.
Pubblicazione: (2019)
di: Sabry, Mohammed, et al.
Pubblicazione: (2019)
A Tighter Convergence Proof of Reverse Experience Replay
di: Jiang, Nan, et al.
Pubblicazione: (2024)
di: Jiang, Nan, et al.
Pubblicazione: (2024)
CUER: Corrected Uniform Experience Replay for Off-Policy Continuous Deep Reinforcement Learning Algorithms
di: Yenicesu, Arda Sarp, et al.
Pubblicazione: (2024)
di: Yenicesu, Arda Sarp, et al.
Pubblicazione: (2024)
Variance-Reduction Guidance: Sampling Trajectory Optimization for Diffusion Models
di: Xu, Shifeng, et al.
Pubblicazione: (2025)
di: Xu, Shifeng, et al.
Pubblicazione: (2025)
Non-Convex Optimization in Federated Learning via Variance Reduction and Adaptive Learning
di: Thakur, Dipanwita, et al.
Pubblicazione: (2024)
di: Thakur, Dipanwita, et al.
Pubblicazione: (2024)
Projection-Free Variance Reduction Methods for Stochastic Constrained Multi-Level Compositional Optimization
di: Jiang, Wei, et al.
Pubblicazione: (2024)
di: Jiang, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Convergence of Experience Replay in Policy Optimization: Characterizing Bias, Variance, and Finite-Time Convergence
di: Zheng, Hua, et al.
Pubblicazione: (2021) -
Adjoint Sensitivity Analysis on Multi-Scale Bioprocess Stochastic Reaction Network
di: Choy, Keilung, et al.
Pubblicazione: (2024) -
Digital Twin Calibration with Model-Based Reinforcement Learning
di: Zheng, Hua, et al.
Pubblicazione: (2025) -
A Symbolic and Statistical Learning Framework to Discover Bioprocessing Regulatory Mechanism: Cell Culture Example
di: Choy, Keilung, et al.
Pubblicazione: (2025) -
Variance Reduction via Resampling and Experience Replay
di: Han, Jiale, et al.
Pubblicazione: (2025)