Actor-Critic Pretraining for Proximal Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Kernbach, Andreas, Elsheikh, Amr, Grupp, Nicolas, Nagel, René, Huber, Marco F. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion
di: Fan, Jiale, et al.
Pubblicazione: (2025)
di: Fan, Jiale, et al.
Pubblicazione: (2025)
Sample-Efficient Bayesian Transfer Learning for Online Machine Parameter Optimization
di: Wagner, Philipp, et al.
Pubblicazione: (2025)
di: Wagner, Philipp, et al.
Pubblicazione: (2025)
ReLU to the Rescue: Improve Your On-Policy Actor-Critic with Positive Advantages
di: Jesson, Andrew, et al.
Pubblicazione: (2023)
di: Jesson, Andrew, et al.
Pubblicazione: (2023)
Actor-Critic without Actor
di: Ki, Donghyeon, et al.
Pubblicazione: (2025)
di: Ki, Donghyeon, et al.
Pubblicazione: (2025)
Generative Actor-Critic with Soft Bridge Policies
di: He, Ke, et al.
Pubblicazione: (2026)
di: He, Ke, et al.
Pubblicazione: (2026)
Distributional Soft Actor-Critic with Diffusion Policy
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
di: Dong, Jinzong, et al.
Pubblicazione: (2026)
di: Dong, Jinzong, et al.
Pubblicazione: (2026)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
di: Wang, Li, et al.
Pubblicazione: (2025)
di: Wang, Li, et al.
Pubblicazione: (2025)
Comparison of Model Predictive Control and Proximal Policy Optimization for a 1-DOF Helicopter System
di: Schäfer, Georg, et al.
Pubblicazione: (2024)
di: Schäfer, Georg, et al.
Pubblicazione: (2024)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
di: He, Jiamin, et al.
Pubblicazione: (2026)
di: He, Jiamin, et al.
Pubblicazione: (2026)
Actor-Critic or Critic-Actor? A Tale of Two Time Scales
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
di: Bhatnagar, Shalabh, et al.
Pubblicazione: (2022)
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
di: Zhang, Lunjun, et al.
Pubblicazione: (2025)
di: Zhang, Lunjun, et al.
Pubblicazione: (2025)
Actor-Critic Reinforcement Learning with Phased Actor
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
di: Wu, Ruofan, et al.
Pubblicazione: (2024)
Central Path Proximal Policy Optimization
di: Milosevic, Nikola, et al.
Pubblicazione: (2025)
di: Milosevic, Nikola, et al.
Pubblicazione: (2025)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
Generative Actor Critic
di: Qin, Aoyang, et al.
Pubblicazione: (2025)
di: Qin, Aoyang, et al.
Pubblicazione: (2025)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
di: Shankar, Kaaustaaub, et al.
Pubblicazione: (2025)
di: Shankar, Kaaustaaub, et al.
Pubblicazione: (2025)
Reparameterization Proximal Policy Optimization
di: Zhong, Hai, et al.
Pubblicazione: (2025)
di: Zhong, Hai, et al.
Pubblicazione: (2025)
Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
di: Lee, Jeong Woon, et al.
Pubblicazione: (2026)
Diffusion Policy through Conditional Proximal Policy Optimization
di: Liu, Ben, et al.
Pubblicazione: (2026)
di: Liu, Ben, et al.
Pubblicazione: (2026)
Quasi-Newton Compatible Actor-Critic for Deterministic Policies
di: Kordabad, Arash Bahari, et al.
Pubblicazione: (2025)
di: Kordabad, Arash Bahari, et al.
Pubblicazione: (2025)
Transductive Off-policy Proximal Policy Optimization
di: Gan, Yaozhong, et al.
Pubblicazione: (2024)
di: Gan, Yaozhong, et al.
Pubblicazione: (2024)
Deep Gaussian Process Proximal Policy Optimization
di: van der Lende, Matthijs, et al.
Pubblicazione: (2025)
di: van der Lende, Matthijs, et al.
Pubblicazione: (2025)
Functional Critics Are Essential for Actor-Critic: From Off-Policy Stability to Efficient Exploration
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
di: Bai, Qinxun, et al.
Pubblicazione: (2025)
Goal Recognition using Actor-Critic Optimization
di: Nageris, Ben, et al.
Pubblicazione: (2024)
di: Nageris, Ben, et al.
Pubblicazione: (2024)
Complexity-Regularized Proximal Policy Optimization
di: Serfilippi, Luca, et al.
Pubblicazione: (2025)
di: Serfilippi, Luca, et al.
Pubblicazione: (2025)
Beyond the Boundaries of Proximal Policy Optimization
di: Tan, Charlie B., et al.
Pubblicazione: (2024)
di: Tan, Charlie B., et al.
Pubblicazione: (2024)
Proximal Policy Optimization with Adaptive Exploration
di: Lixandru, Andrei
Pubblicazione: (2024)
di: Lixandru, Andrei
Pubblicazione: (2024)
Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs
di: Kohler, Hector, et al.
Pubblicazione: (2023)
di: Kohler, Hector, et al.
Pubblicazione: (2023)
Enabling Off-Policy Imitation Learning with Deep Actor Critic Stabilization
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
di: Sen, Sayambhu, et al.
Pubblicazione: (2025)
Maximum Entropy On-Policy Actor-Critic via Entropy Advantage Estimation
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
di: Choe, Jean Seong Bjorn, et al.
Pubblicazione: (2024)
Can an Actor-Critic Optimization Framework Improve Analog Design Optimization?
di: Dutta, Sounak, et al.
Pubblicazione: (2026)
di: Dutta, Sounak, et al.
Pubblicazione: (2026)
XQCfD: Accelerating Fast Actor-Critic Algorithms with Prior Data and Prior Policies
di: Palenicek, Daniel, et al.
Pubblicazione: (2026)
di: Palenicek, Daniel, et al.
Pubblicazione: (2026)
A Communication-Efficient Decentralized Actor-Critic Algorithm
di: Ren, Xiaoxing, et al.
Pubblicazione: (2025)
di: Ren, Xiaoxing, et al.
Pubblicazione: (2025)
Match or Replay: Self Imitating Proximal Policy Optimization
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
Hindsight Experience Replay Accelerates Proximal Policy Optimization
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
di: Crowder, Douglas C., et al.
Pubblicazione: (2024)
Token-level Proximal Policy Optimization for Query Generation
di: Ouyang, Yichen, et al.
Pubblicazione: (2024)
di: Ouyang, Yichen, et al.
Pubblicazione: (2024)
Finite-Time Analysis of Three-Timescale Constrained Actor-Critic and Constrained Natural Actor-Critic Algorithms
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
di: Panda, Prashansa, et al.
Pubblicazione: (2023)
Risk-Sensitive Exponential Actor Critic
di: Granados, Alonso, et al.
Pubblicazione: (2026)
di: Granados, Alonso, et al.
Pubblicazione: (2026)
Safe Langevin Soft Actor Critic
di: Keswani, Mahesh, et al.
Pubblicazione: (2026)
di: Keswani, Mahesh, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion
di: Fan, Jiale, et al.
Pubblicazione: (2025) -
Sample-Efficient Bayesian Transfer Learning for Online Machine Parameter Optimization
di: Wagner, Philipp, et al.
Pubblicazione: (2025) -
ReLU to the Rescue: Improve Your On-Policy Actor-Critic with Positive Advantages
di: Jesson, Andrew, et al.
Pubblicazione: (2023) -
Actor-Critic without Actor
di: Ki, Donghyeon, et al.
Pubblicazione: (2025) -
Generative Actor-Critic with Soft Bridge Policies
di: He, Ke, et al.
Pubblicazione: (2026)