A Reinforcement Learning Method for Environments with Stochastic Variables: Post-Decision Proximal Policy Optimization with Dual Critic Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Felizardo, Leonardo Kanashiro, Fadda, Edoardo, Brandimarte, Paolo, Del-Moral-Hernandez, Emilio, Nascimento, Mariá Cristina Vasconcelos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic Policy Search using Population-Based Hyper-heuristics for the Integrated Procurement and Perishable Inventory Problem
di: Felizardo, Leonardo Kanashiro, et al.
Pubblicazione: (2025)
di: Felizardo, Leonardo Kanashiro, et al.
Pubblicazione: (2025)
Fusing Rewards and Preferences in Reinforcement Learning
di: Khorasani, Sadegh, et al.
Pubblicazione: (2025)
di: Khorasani, Sadegh, et al.
Pubblicazione: (2025)
A Practical Approach to Formal Methods: An Eclipse Integrated Development Environment (IDE) for Security Protocols
di: Garcia, Rémi, et al.
Pubblicazione: (2024)
di: Garcia, Rémi, et al.
Pubblicazione: (2024)
AI and Machine Learning Approaches for Predicting Nanoparticles Toxicity The Critical Role of Physiochemical Properties
di: Yousaf, Iqra
Pubblicazione: (2024)
di: Yousaf, Iqra
Pubblicazione: (2024)
Efficient Reinforcement Learning for Global Decision Making in the Presence of Local Agents at Scale
di: Anand, Emile, et al.
Pubblicazione: (2024)
di: Anand, Emile, et al.
Pubblicazione: (2024)
Identifying Policy Gradient Subspaces
di: Schneider, Jan, et al.
Pubblicazione: (2024)
di: Schneider, Jan, et al.
Pubblicazione: (2024)
Multi-Task Reinforcement Learning with Language-Encoded Gated Policy Networks
di: Arora, Rushiv
Pubblicazione: (2025)
di: Arora, Rushiv
Pubblicazione: (2025)
RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning
di: Hisaki, Yukinari, et al.
Pubblicazione: (2024)
di: Hisaki, Yukinari, et al.
Pubblicazione: (2024)
Learning Stochastic Nonlinear Dynamics with Embedded Latent Transfer Operators
di: Ke, Naichang, et al.
Pubblicazione: (2025)
di: Ke, Naichang, et al.
Pubblicazione: (2025)
CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling
di: Lymperopoulos, Panagiotis, et al.
Pubblicazione: (2026)
di: Lymperopoulos, Panagiotis, et al.
Pubblicazione: (2026)
Improving Value Estimation Critically Enhances Vanilla Policy Gradient
di: Wang, Tao, et al.
Pubblicazione: (2025)
di: Wang, Tao, et al.
Pubblicazione: (2025)
HGCN(O): A Self-Tuning GCN HyperModel Toolkit for Outcome Prediction in Event-Sequence Data
di: Wang, Fang, et al.
Pubblicazione: (2025)
di: Wang, Fang, et al.
Pubblicazione: (2025)
Deep Memory Search: A Metaheuristic Approach for Optimizing Heuristic Search
di: Hedar, Abdel-Rahman, et al.
Pubblicazione: (2024)
di: Hedar, Abdel-Rahman, et al.
Pubblicazione: (2024)
Data-Incremental Continual Offline Reinforcement Learning
di: Gai, Sibo, et al.
Pubblicazione: (2024)
di: Gai, Sibo, et al.
Pubblicazione: (2024)
Hierarchical Reinforcement Learning with Targeted Causal Interventions
di: Khorasani, Sadegh, et al.
Pubblicazione: (2025)
di: Khorasani, Sadegh, et al.
Pubblicazione: (2025)
Explainable Wastewater Digital Twins: Adaptive Context-Conditioned Structured Simulators with Self-Falsifying Decision Support
di: Simethy, Gary, et al.
Pubblicazione: (2026)
di: Simethy, Gary, et al.
Pubblicazione: (2026)
A Survey of Reinforcement Learning from Human Feedback
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
di: Kaufmann, Timo, et al.
Pubblicazione: (2023)
Fractional Policy Gradients: Reinforcement Learning with Long-Term Memory
di: Pawar, Urvi, et al.
Pubblicazione: (2025)
di: Pawar, Urvi, et al.
Pubblicazione: (2025)
OER: Offline Experience Replay for Continual Offline Reinforcement Learning
di: Gai, Sibo, et al.
Pubblicazione: (2023)
di: Gai, Sibo, et al.
Pubblicazione: (2023)
LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning
di: Quadros, André, et al.
Pubblicazione: (2025)
di: Quadros, André, et al.
Pubblicazione: (2025)
Learning Affine-Equivariant Proximal Operators
di: Savir, Oriel, et al.
Pubblicazione: (2026)
di: Savir, Oriel, et al.
Pubblicazione: (2026)
Rewarded Region Replay (R3) for Policy Learning with Discrete Action Space
di: Li, Bangzheng, et al.
Pubblicazione: (2024)
di: Li, Bangzheng, et al.
Pubblicazione: (2024)
Label-Free Detection of Governance Evidence Degradation in Risk Decision Systems
di: Solozobov, Oleg
Pubblicazione: (2026)
di: Solozobov, Oleg
Pubblicazione: (2026)
Primal-Dual Sample Complexity Bounds for Constrained Markov Decision Processes with Multiple Constraints
di: Buckley, Max, et al.
Pubblicazione: (2025)
di: Buckley, Max, et al.
Pubblicazione: (2025)
CaMeRL: Collision-Aware and Memory-Enhanced Reinforcement Learning for UAV Navigation in Multi-Scale Obstacle Environments
di: Hong, Hong, et al.
Pubblicazione: (2026)
di: Hong, Hong, et al.
Pubblicazione: (2026)
Playing Hex and Counter Wargames using Reinforcement Learning and Recurrent Neural Networks
di: Palma, Guilherme, et al.
Pubblicazione: (2025)
di: Palma, Guilherme, et al.
Pubblicazione: (2025)
Multi-Objective Optimization with Desirability and Morris-Mitchell Criterion
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2025)
di: Bartz-Beielstein, Thomas, et al.
Pubblicazione: (2025)
Perfecting Aircraft Maneuvers with Reinforcement Learning
di: Cilan, Atahan, et al.
Pubblicazione: (2026)
di: Cilan, Atahan, et al.
Pubblicazione: (2026)
Upside Down Reinforcement Learning with Policy Generators
di: Di Ventura, Jacopo, et al.
Pubblicazione: (2025)
di: Di Ventura, Jacopo, et al.
Pubblicazione: (2025)
Evidence Sufficiency Under Delayed Ground Truth: Proxy Monitoring for Risk Decision Systems
di: Solozobov, Oleg
Pubblicazione: (2026)
di: Solozobov, Oleg
Pubblicazione: (2026)
A Simple Approximate Bayesian Inference Neural Surrogate for Stochastic Petri Net Models
di: Manu, Bright Kwaku, et al.
Pubblicazione: (2025)
di: Manu, Bright Kwaku, et al.
Pubblicazione: (2025)
Adversarial Constrained Policy Optimization: Improving Constrained Reinforcement Learning by Adapting Budgets
di: Ma, Jianmina, et al.
Pubblicazione: (2024)
di: Ma, Jianmina, et al.
Pubblicazione: (2024)
A Comparative Analysis of Reinforcement Learning and Conventional Deep Learning Approaches for Bearing Fault Diagnosis
di: Çakır, Efe, et al.
Pubblicazione: (2025)
di: Çakır, Efe, et al.
Pubblicazione: (2025)
ES-C51: Expected Sarsa Based C51 Distributional Reinforcement Learning Algorithm
di: Tandon, Rijul, et al.
Pubblicazione: (2025)
di: Tandon, Rijul, et al.
Pubblicazione: (2025)
Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
di: Pasupuleti, Vinil, et al.
Pubblicazione: (2026)
Semi-Supervised Learning for AVO Inversion with Strong Spatial Feature Constraints
di: Liu, Yingtian, et al.
Pubblicazione: (2025)
di: Liu, Yingtian, et al.
Pubblicazione: (2025)
Actor-Critic Model Predictive Control: Differentiable Optimization meets Reinforcement Learning for Agile Flight
di: Romero, Angel, et al.
Pubblicazione: (2023)
di: Romero, Angel, et al.
Pubblicazione: (2023)
Action-Dependent Optimality-Preserving Reward Shaping
di: Forbes, Grant C., et al.
Pubblicazione: (2025)
di: Forbes, Grant C., et al.
Pubblicazione: (2025)
Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards
di: Forbes, Grant C., et al.
Pubblicazione: (2024)
di: Forbes, Grant C., et al.
Pubblicazione: (2024)
E-CONDOR: Efficient Contour-Based Detection Of Random Spatial Signals From UAV Observations Using Dual Stochastic Gradient
di: Zahra, Maryam, et al.
Pubblicazione: (2024)
di: Zahra, Maryam, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Automatic Policy Search using Population-Based Hyper-heuristics for the Integrated Procurement and Perishable Inventory Problem
di: Felizardo, Leonardo Kanashiro, et al.
Pubblicazione: (2025) -
Fusing Rewards and Preferences in Reinforcement Learning
di: Khorasani, Sadegh, et al.
Pubblicazione: (2025) -
A Practical Approach to Formal Methods: An Eclipse Integrated Development Environment (IDE) for Security Protocols
di: Garcia, Rémi, et al.
Pubblicazione: (2024) -
AI and Machine Learning Approaches for Predicting Nanoparticles Toxicity The Critical Role of Physiochemical Properties
di: Yousaf, Iqra
Pubblicazione: (2024) -
Efficient Reinforcement Learning for Global Decision Making in the Presence of Local Agents at Scale
di: Anand, Emile, et al.
Pubblicazione: (2024)