Actor-Accelerated Policy Dual Averaging for Reinforcement Learning in Continuous Action Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Ji, Ju, Caleb, Lan, Guanghui, Tong, Zhaohui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Policy Optimization over General State and Action Spaces
di: Ju, Caleb, et al.
Pubblicazione: (2022)
di: Ju, Caleb, et al.
Pubblicazione: (2022)
Auto-exploration for online reinforcement learning
di: Ju, Caleb, et al.
Pubblicazione: (2025)
di: Ju, Caleb, et al.
Pubblicazione: (2025)
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
di: Dong, Jinzong, et al.
Pubblicazione: (2026)
di: Dong, Jinzong, et al.
Pubblicazione: (2026)
Strongly-polynomial time and validation analysis of policy gradient methods
di: Ju, Caleb, et al.
Pubblicazione: (2024)
di: Ju, Caleb, et al.
Pubblicazione: (2024)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)
Action Robust Reinforcement Learning via Optimal Adversary Aware Policy Optimization
di: Nie, Buqing, et al.
Pubblicazione: (2025)
di: Nie, Buqing, et al.
Pubblicazione: (2025)
Value Mirror Descent for Reinforcement Learning
di: Jia, Zhichao, et al.
Pubblicazione: (2026)
di: Jia, Zhichao, et al.
Pubblicazione: (2026)
ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning
di: Shamass, Faiq
Pubblicazione: (2026)
di: Shamass, Faiq
Pubblicazione: (2026)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
di: Yang, Tong, et al.
Pubblicazione: (2023)
di: Yang, Tong, et al.
Pubblicazione: (2023)
RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
di: Bian, Yuexin, et al.
Pubblicazione: (2026)
On the Geometry of Reinforcement Learning in Continuous State and Action Spaces
di: Tiwari, Saket, et al.
Pubblicazione: (2022)
di: Tiwari, Saket, et al.
Pubblicazione: (2022)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
Accelerated Policy Gradient: On the Convergence Rates of the Nesterov Momentum for Reinforcement Learning
di: Chen, Yen-Ju, et al.
Pubblicazione: (2023)
di: Chen, Yen-Ju, et al.
Pubblicazione: (2023)
Dual Action Policy for Robust Sim-to-Real Reinforcement Learning
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
di: Terence, Ng Wen Zheng, et al.
Pubblicazione: (2024)
Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces
di: Tiwari, Saket, et al.
Pubblicazione: (2025)
di: Tiwari, Saket, et al.
Pubblicazione: (2025)
A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic Approach
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
di: Pan, Chaofan, et al.
Pubblicazione: (2025)
Improving Policy Exploitation in Online Reinforcement Learning with Instant Retrospect Action
di: Gao, Gong, et al.
Pubblicazione: (2026)
di: Gao, Gong, et al.
Pubblicazione: (2026)
Broad Critic Deep Actor Reinforcement Learning for Continuous Control
di: Thalagala, Shiron, et al.
Pubblicazione: (2024)
di: Thalagala, Shiron, et al.
Pubblicazione: (2024)
Finite-Time Convergence and Sample Complexity of Actor-Critic Multi-Objective Reinforcement Learning
di: Zhou, Tianchen, et al.
Pubblicazione: (2024)
di: Zhou, Tianchen, et al.
Pubblicazione: (2024)
Stochastic Auto-conditioned Fast Gradient Methods with Optimal Rates
di: Ji, Yao, et al.
Pubblicazione: (2026)
di: Ji, Yao, et al.
Pubblicazione: (2026)
Dual dynamic programming for stochastic programs over an infinite horizon
di: Ju, Caleb, et al.
Pubblicazione: (2023)
di: Ju, Caleb, et al.
Pubblicazione: (2023)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
Counterfactual Learning of Stochastic Policies with Continuous Actions
di: Zenati, Houssam, et al.
Pubblicazione: (2020)
di: Zenati, Houssam, et al.
Pubblicazione: (2020)
Average-Reward Soft Actor-Critic
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
di: Hong, Joey, et al.
Pubblicazione: (2025)
di: Hong, Joey, et al.
Pubblicazione: (2025)
Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning
di: Humayoo, Mahammad, et al.
Pubblicazione: (2018)
di: Humayoo, Mahammad, et al.
Pubblicazione: (2018)
Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization
di: Landers, Matthew, et al.
Pubblicazione: (2026)
di: Landers, Matthew, et al.
Pubblicazione: (2026)
Global Optimality of Single-Timescale Actor-Critic under Continuous State-Action Space: A Study on Linear Quadratic Regulator
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
di: Chen, Xuyang, et al.
Pubblicazione: (2025)
Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
Extremum-Seeking Action Selection for Accelerating Policy Optimization
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
di: Chang, Ya-Chien, et al.
Pubblicazione: (2024)
Action-Graph Policies: Learning Action Co-dependencies in Multi-Agent Reinforcement Learning
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
di: Gupta, Nikunj, et al.
Pubblicazione: (2026)
Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
di: Kar, Avik, et al.
Pubblicazione: (2024)
di: Kar, Avik, et al.
Pubblicazione: (2024)
Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control
di: Alzorgan, Hazim, et al.
Pubblicazione: (2025)
di: Alzorgan, Hazim, et al.
Pubblicazione: (2025)
Distributed Detection of Adversarial Attacks in Multi-Agent Reinforcement Learning with Continuous Action Space
di: Kazari, Kiarash, et al.
Pubblicazione: (2025)
di: Kazari, Kiarash, et al.
Pubblicazione: (2025)
An Investigation of Offline Reinforcement Learning in Factorisable Action Spaces
di: Beeson, Alex, et al.
Pubblicazione: (2024)
di: Beeson, Alex, et al.
Pubblicazione: (2024)
Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards
di: Jiang, Zhaohui, et al.
Pubblicazione: (2024)
di: Jiang, Zhaohui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Policy Optimization over General State and Action Spaces
di: Ju, Caleb, et al.
Pubblicazione: (2022) -
Auto-exploration for online reinforcement learning
di: Ju, Caleb, et al.
Pubblicazione: (2025) -
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
di: Dong, Jinzong, et al.
Pubblicazione: (2026) -
Strongly-polynomial time and validation analysis of policy gradient methods
di: Ju, Caleb, et al.
Pubblicazione: (2024) -
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
di: Zhu, Yuanyang, et al.
Pubblicazione: (2024)