Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Tong, Cen, Shicong, Wei, Yuting, Chen, Yuxin, Chi, Yuejie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Statistical and Algorithmic Foundations of Reinforcement Learning
por: Chi, Yuejie, et al.
Publicado: (2025)
por: Chi, Yuejie, et al.
Publicado: (2025)
Beyond Expectations: Learning with Stochastic Dominance Made Practical
por: Cen, Shicong, et al.
Publicado: (2024)
por: Cen, Shicong, et al.
Publicado: (2024)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
por: Yang, Tong, et al.
Publicado: (2025)
por: Yang, Tong, et al.
Publicado: (2025)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024)
por: Cen, Shicong, et al.
Publicado: (2024)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
por: Yang, Tong, et al.
Publicado: (2026)
por: Yang, Tong, et al.
Publicado: (2026)
Actor-Critics Can Achieve Optimal Sample Efficiency
por: Tan, Kevin, et al.
Publicado: (2025)
por: Tan, Kevin, et al.
Publicado: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
por: Xu, Yang, et al.
Publicado: (2025)
por: Xu, Yang, et al.
Publicado: (2025)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
por: Lee, Jeong Woon, et al.
Publicado: (2026)
por: Lee, Jeong Woon, et al.
Publicado: (2026)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
por: Vo, Thanh Vinh, et al.
Publicado: (2025)
por: Vo, Thanh Vinh, et al.
Publicado: (2025)
Distributional Soft Actor-Critic with Diffusion Policy
por: Liu, Tong, et al.
Publicado: (2025)
por: Liu, Tong, et al.
Publicado: (2025)
The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards
por: Huang, Yu, et al.
Publicado: (2026)
por: Huang, Yu, et al.
Publicado: (2026)
${\rm E}(3)$-Equivariant Actor-Critic Methods for Cooperative Multi-Agent Reinforcement Learning
por: Chen, Dingyang, et al.
Publicado: (2023)
por: Chen, Dingyang, et al.
Publicado: (2023)
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
por: Wang, Leo Muxing, et al.
Publicado: (2026)
por: Wang, Leo Muxing, et al.
Publicado: (2026)
Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning
por: Humayoo, Mahammad, et al.
Publicado: (2018)
por: Humayoo, Mahammad, et al.
Publicado: (2018)
Flow Actor-Critic for Offline Reinforcement Learning
por: Chae, Jongseong, et al.
Publicado: (2026)
por: Chae, Jongseong, et al.
Publicado: (2026)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
por: Ma, Xiaoteng, et al.
Publicado: (2020)
por: Ma, Xiaoteng, et al.
Publicado: (2020)
Accelerating Convergence of Score-Based Diffusion Models, Provably
por: Li, Gen, et al.
Publicado: (2024)
por: Li, Gen, et al.
Publicado: (2024)
Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning
por: Chen, Haohui, et al.
Publicado: (2024)
por: Chen, Haohui, et al.
Publicado: (2024)
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
por: Dong, Jinzong, et al.
Publicado: (2026)
por: Dong, Jinzong, et al.
Publicado: (2026)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
por: Kar, Avik, et al.
Publicado: (2026)
por: Kar, Avik, et al.
Publicado: (2026)
Quantum Advantage Actor-Critic for Reinforcement Learning
por: Kölle, Michael, et al.
Publicado: (2024)
por: Kölle, Michael, et al.
Publicado: (2024)
Broad Critic Deep Actor Reinforcement Learning for Continuous Control
por: Thalagala, Shiron, et al.
Publicado: (2024)
por: Thalagala, Shiron, et al.
Publicado: (2024)
Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning
por: Garcin, Samuel, et al.
Publicado: (2025)
por: Garcin, Samuel, et al.
Publicado: (2025)
Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning
por: Küçükoğlu, Burcu, et al.
Publicado: (2025)
por: Küçükoğlu, Burcu, et al.
Publicado: (2025)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
por: Huang, Yu, et al.
Publicado: (2025)
por: Huang, Yu, et al.
Publicado: (2025)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
por: Bai, Qinxun, et al.
Publicado: (2025)
por: Bai, Qinxun, et al.
Publicado: (2025)
Natural Policy Gradient and Actor Critic Methods for Constrained Multi-Task Reinforcement Learning
por: Zeng, Sihan, et al.
Publicado: (2024)
por: Zeng, Sihan, et al.
Publicado: (2024)
Preconditioning Benefits of Spectral Orthogonalization in Muon
por: Ma, Jianhao, et al.
Publicado: (2026)
por: Ma, Jianhao, et al.
Publicado: (2026)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
por: Alon, Yoav, et al.
Publicado: (2020)
por: Alon, Yoav, et al.
Publicado: (2020)
Adviser-Actor-Critic: Eliminating Steady-State Error in Reinforcement Learning Control
por: Chen, Donghe, et al.
Publicado: (2025)
por: Chen, Donghe, et al.
Publicado: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
por: Kohler, Hector, et al.
Publicado: (2023)
por: Kohler, Hector, et al.
Publicado: (2023)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
por: Sen, Sayambhu, et al.
Publicado: (2025)
por: Sen, Sayambhu, et al.
Publicado: (2025)
A Safety Modulator Actor-Critic Method in Model-Free Safe Reinforcement Learning and Application in UAV Hovering
por: Qi, Qihan, et al.
Publicado: (2024)
por: Qi, Qihan, et al.
Publicado: (2024)
Revisiting Discrete Soft Actor-Critic
por: Zhou, Haibin, et al.
Publicado: (2022)
por: Zhou, Haibin, et al.
Publicado: (2022)
Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
por: Manivannan, Sanjeev, et al.
Publicado: (2026)
por: Manivannan, Sanjeev, et al.
Publicado: (2026)
Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning
por: Zhang, Yixian, et al.
Publicado: (2025)
por: Zhang, Yixian, et al.
Publicado: (2025)
Offline Actor-Critic Reinforcement Learning Scales to Large Models
por: Springenberg, Jost Tobias, et al.
Publicado: (2024)
por: Springenberg, Jost Tobias, et al.
Publicado: (2024)
Learning Critically: Selective Self Distillation in Federated Learning on Non-IID Data
por: He, Yuting, et al.
Publicado: (2025)
por: He, Yuting, et al.
Publicado: (2025)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
por: He, Jiamin, et al.
Publicado: (2026)
por: He, Jiamin, et al.
Publicado: (2026)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
por: Barakat, Anas, et al.
Publicado: (2024)
por: Barakat, Anas, et al.
Publicado: (2024)
Ejemplares similares
-
Statistical and Algorithmic Foundations of Reinforcement Learning
por: Chi, Yuejie, et al.
Publicado: (2025) -
Beyond Expectations: Learning with Stochastic Dominance Made Practical
por: Cen, Shicong, et al.
Publicado: (2024) -
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
por: Yang, Tong, et al.
Publicado: (2025) -
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024) -
Agentic Transformers Provably Learn to Search via Reinforcement Learning
por: Yang, Tong, et al.
Publicado: (2026)