Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Jeong Woon, Kwak, Kyoleen, Kim, Daeho, Hwang, Hyoseok |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Control Policy Smoothness by Aligning Actions with Predictions from Preceding States
di: Kwak, Kyoleen, et al.
Pubblicazione: (2026)
di: Kwak, Kyoleen, et al.
Pubblicazione: (2026)
Scale-Consistent State-Space Dynamics via Fractal of Stationary Transformations
di: Yu, Geunhyeok, et al.
Pubblicazione: (2026)
di: Yu, Geunhyeok, et al.
Pubblicazione: (2026)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Soft Deterministic Policy Gradient with Gaussian Smoothing
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
di: Na, Hyunjun, et al.
Pubblicazione: (2026)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
di: Yang, Tong, et al.
Pubblicazione: (2023)
di: Yang, Tong, et al.
Pubblicazione: (2023)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
di: He, Jiamin, et al.
Pubblicazione: (2026)
di: He, Jiamin, et al.
Pubblicazione: (2026)
Causal Policy Learning in Reinforcement Learning: Backdoor-Adjusted Soft Actor-Critic
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
di: Vo, Thanh Vinh, et al.
Pubblicazione: (2025)
Enhancing Variational Autoencoders with Smooth Robust Latent Encoding
di: Lee, Hyomin, et al.
Pubblicazione: (2025)
di: Lee, Hyomin, et al.
Pubblicazione: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
di: Kohler, Hector, et al.
Pubblicazione: (2023)
di: Kohler, Hector, et al.
Pubblicazione: (2023)
Flow Actor-Critic for Offline Reinforcement Learning
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
di: Chae, Jongseong, et al.
Pubblicazione: (2026)
Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic
di: Wang, Leo Muxing, et al.
Pubblicazione: (2026)
di: Wang, Leo Muxing, et al.
Pubblicazione: (2026)
Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable Simulation
di: Georgiev, Ignat, et al.
Pubblicazione: (2024)
di: Georgiev, Ignat, et al.
Pubblicazione: (2024)
Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning
di: Humayoo, Mahammad, et al.
Pubblicazione: (2018)
di: Humayoo, Mahammad, et al.
Pubblicazione: (2018)
Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function
di: Kang, Hyeongyu, et al.
Pubblicazione: (2025)
di: Kang, Hyeongyu, et al.
Pubblicazione: (2025)
Mitigating Suboptimality of Deterministic Policy Gradients in Complex Q-functions
di: Jain, Ayush, et al.
Pubblicazione: (2024)
di: Jain, Ayush, et al.
Pubblicazione: (2024)
Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
di: Manivannan, Sanjeev, et al.
Pubblicazione: (2026)
di: Manivannan, Sanjeev, et al.
Pubblicazione: (2026)
Deep Support Vectors
di: Lee, Junhoo, et al.
Pubblicazione: (2024)
di: Lee, Junhoo, et al.
Pubblicazione: (2024)
Value Improved Actor Critic Algorithms
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
di: Oren, Yaniv, et al.
Pubblicazione: (2024)
Diffusion Actor-Critic with Entropy Regulator
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
di: Wang, Yinuo, et al.
Pubblicazione: (2024)
Revisiting Discrete Soft Actor-Critic
di: Zhou, Haibin, et al.
Pubblicazione: (2022)
di: Zhou, Haibin, et al.
Pubblicazione: (2022)
Average-Reward Soft Actor-Critic
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
di: Adamczyk, Jacob, et al.
Pubblicazione: (2025)
ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization
di: Ji, Tianying, et al.
Pubblicazione: (2024)
di: Ji, Tianying, et al.
Pubblicazione: (2024)
Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL
di: Luo, Yu, et al.
Pubblicazione: (2024)
di: Luo, Yu, et al.
Pubblicazione: (2024)
Efficient Monte Carlo Tree Search via On-the-Fly State-Conditioned Action Abstraction
di: Kwak, Yunhyeok, et al.
Pubblicazione: (2024)
di: Kwak, Yunhyeok, et al.
Pubblicazione: (2024)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
di: Nakanishi, Kosuke, et al.
Pubblicazione: (2025)
Distributional Soft Actor-Critic with Harmonic Gradient for Safe and Efficient Autonomous Driving in Multi-lane Scenarios
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
di: Zhang, Feihong, et al.
Pubblicazione: (2025)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
di: Ji, Tianying, et al.
Pubblicazione: (2023)
di: Ji, Tianying, et al.
Pubblicazione: (2023)
Relational Object-Centric Actor-Critic
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2023)
di: Ugadiarov, Leonid, et al.
Pubblicazione: (2023)
Scalable Neighborhood-Based Multi-Agent Actor-Critic
di: Goppelsroeder, Tim, et al.
Pubblicazione: (2026)
di: Goppelsroeder, Tim, et al.
Pubblicazione: (2026)
SACn: Soft Actor-Critic with n-step Returns
di: Łyskawa, Jakub, et al.
Pubblicazione: (2025)
di: Łyskawa, Jakub, et al.
Pubblicazione: (2025)
Actor-Critics Can Achieve Optimal Sample Efficiency
di: Tan, Kevin, et al.
Pubblicazione: (2025)
di: Tan, Kevin, et al.
Pubblicazione: (2025)
FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification
di: Qiao, Nan, et al.
Pubblicazione: (2026)
di: Qiao, Nan, et al.
Pubblicazione: (2026)
Axiomatization of Gradient Smoothing in Neural Networks
di: Zhou, Linjiang, et al.
Pubblicazione: (2024)
di: Zhou, Linjiang, et al.
Pubblicazione: (2024)
Safe-Support Q-Learning: Learning without Unsafe Exploration
di: Lim, Yeeun, et al.
Pubblicazione: (2026)
di: Lim, Yeeun, et al.
Pubblicazione: (2026)
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
di: Asad, Reza, et al.
Pubblicazione: (2025)
di: Asad, Reza, et al.
Pubblicazione: (2025)
Finite-time Convergence Analysis of Actor-Critic with Evolving Reward
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Control Policy Smoothness by Aligning Actions with Predictions from Preceding States
di: Kwak, Kyoleen, et al.
Pubblicazione: (2026) -
Scale-Consistent State-Space Dynamics via Fractal of Stationary Transformations
di: Yu, Geunhyeok, et al.
Pubblicazione: (2026) -
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
di: Bai, Qinxun, et al.
Pubblicazione: (2025) -
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025) -
Soft Deterministic Policy Gradient with Gaussian Smoothing
di: Na, Hyunjun, et al.
Pubblicazione: (2026)