Proximal Policy Optimization with Adaptive Exploration
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Lixandru, Andrei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KIPPO: Koopman-Inspired Proximal Policy Optimization
par: Cozma, Andrei, et autres
Publié: (2025)
par: Cozma, Andrei, et autres
Publié: (2025)
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
par: Shankar, Kaaustaaub, et autres
Publié: (2025)
par: Shankar, Kaaustaaub, et autres
Publié: (2025)
Reparameterization Proximal Policy Optimization
par: Zhong, Hai, et autres
Publié: (2025)
par: Zhong, Hai, et autres
Publié: (2025)
The Relationship Between Head Injury and Alzheimer's Disease: A Causal Analysis with Bayesian Networks
par: Lixandru, Andrei
Publié: (2025)
par: Lixandru, Andrei
Publié: (2025)
Beyond the Boundaries of Proximal Policy Optimization
par: Tan, Charlie B., et autres
Publié: (2024)
par: Tan, Charlie B., et autres
Publié: (2024)
Complexity-Regularized Proximal Policy Optimization
par: Serfilippi, Luca, et autres
Publié: (2025)
par: Serfilippi, Luca, et autres
Publié: (2025)
ESPO: Early-Stopping Proximal Policy Optimization
par: Li, Zihang, et autres
Publié: (2026)
par: Li, Zihang, et autres
Publié: (2026)
Learning Branching Policies for MILPs with Proximal Policy Optimization
par: Mhamed, Abdelouahed Ben, et autres
Publié: (2025)
par: Mhamed, Abdelouahed Ben, et autres
Publié: (2025)
Proximal Policy Distillation
par: Spigler, Giacomo
Publié: (2024)
par: Spigler, Giacomo
Publié: (2024)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
par: Liu, Jiashun, et autres
Publié: (2025)
par: Liu, Jiashun, et autres
Publié: (2025)
CIM-PPO:Proximal Policy Optimization with Liu-Correntropy Induced Metric
par: Guo, Yunxiao, et autres
Publié: (2021)
par: Guo, Yunxiao, et autres
Publié: (2021)
A dynamical clipping approach with task feedback for Proximal Policy Optimization
par: Zhang, Ziqi, et autres
Publié: (2023)
par: Zhang, Ziqi, et autres
Publié: (2023)
Efficient Deep Reinforcement Learning with Predictive Processing Proximal Policy Optimization
par: Küçükoğlu, Burcu, et autres
Publié: (2022)
par: Küçükoğlu, Burcu, et autres
Publié: (2022)
ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm
par: Wang, Hanyong, et autres
Publié: (2026)
par: Wang, Hanyong, et autres
Publié: (2026)
How Log-Barrier Helps Exploration in Policy Optimization
par: Cesani, Leonardo, et autres
Publié: (2026)
par: Cesani, Leonardo, et autres
Publié: (2026)
More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration
par: Yuan, Xiaoyang, et autres
Publié: (2025)
par: Yuan, Xiaoyang, et autres
Publié: (2025)
Trust-Region Adaptive Policy Optimization
par: Su, Mingyu, et autres
Publié: (2025)
par: Su, Mingyu, et autres
Publié: (2025)
Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards
par: Ahmad, Ahmad, et autres
Publié: (2024)
par: Ahmad, Ahmad, et autres
Publié: (2024)
Sequential Policy Gradient for Adaptive Hyperparameter Optimization
par: Li, Zheng, et autres
Publié: (2025)
par: Li, Zheng, et autres
Publié: (2025)
A Deep Reinforcement Learning Approach to Battery Management in Dairy Farming via Proximal Policy Optimization
par: Ali, Nawazish, et autres
Publié: (2024)
par: Ali, Nawazish, et autres
Publié: (2024)
Fractional Order Distributed Optimization
par: Lixandru, Andrei, et autres
Publié: (2024)
par: Lixandru, Andrei, et autres
Publié: (2024)
Neural Ordinary Differential Equations for Simulating Metabolic Pathway Dynamics from Time-Series Multiomics Data
par: Habaraduwa, Udesh, et autres
Publié: (2025)
par: Habaraduwa, Udesh, et autres
Publié: (2025)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
par: Fakoor, Rasool, et autres
Publié: (2026)
par: Fakoor, Rasool, et autres
Publié: (2026)
Exploration Behavior of Untrained Policies
par: Adamczyk, Jacob
Publié: (2025)
par: Adamczyk, Jacob
Publié: (2025)
AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization
par: Sane, Soham
Publié: (2025)
par: Sane, Soham
Publié: (2025)
Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning
par: Batra, Sumeet, et autres
Publié: (2023)
par: Batra, Sumeet, et autres
Publié: (2023)
Soft Adaptive Policy Optimization
par: Gao, Chang, et autres
Publié: (2025)
par: Gao, Chang, et autres
Publié: (2025)
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
par: Hu, Miaobo, et autres
Publié: (2026)
par: Hu, Miaobo, et autres
Publié: (2026)
Adaptive Diffusion Policy Optimization for Robotic Manipulation
par: Jiang, Huiyun, et autres
Publié: (2025)
par: Jiang, Huiyun, et autres
Publié: (2025)
Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control
par: Islam, SM Mazharul, et autres
Publié: (2025)
par: Islam, SM Mazharul, et autres
Publié: (2025)
PROMA: Projected Microbatch Accumulation for Reference-Free Proximal Policy Updates
par: Abrahamsen, Nilin
Publié: (2026)
par: Abrahamsen, Nilin
Publié: (2026)
Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
par: Cao, Ruike, et autres
Publié: (2026)
par: Cao, Ruike, et autres
Publié: (2026)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals
par: Pappalardo, Octavio
Publié: (2026)
par: Pappalardo, Octavio
Publié: (2026)
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
par: Kapoor, Aditya, et autres
Publié: (2024)
par: Kapoor, Aditya, et autres
Publié: (2024)
Proximal Policy Optimization with Evolutionary Mutations
par: Czworkowski, Casimir, et autres
Publié: (2026)
par: Czworkowski, Casimir, et autres
Publié: (2026)
Safe Exploration via Policy Priors
par: Wendl, Manuel, et autres
Publié: (2026)
par: Wendl, Manuel, et autres
Publié: (2026)
Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization
par: Du, Yihan, et autres
Publié: (2024)
par: Du, Yihan, et autres
Publié: (2024)
Documents similaires
-
KIPPO: Koopman-Inspired Proximal Policy Optimization
par: Cozma, Andrei, et autres
Publié: (2025) -
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
par: Shankar, Kaaustaaub, et autres
Publié: (2025) -
Reparameterization Proximal Policy Optimization
par: Zhong, Hai, et autres
Publié: (2025) -
The Relationship Between Head Injury and Alzheimer's Disease: A Causal Analysis with Bayesian Networks
par: Lixandru, Andrei
Publié: (2025) -
Beyond the Boundaries of Proximal Policy Optimization
par: Tan, Charlie B., et autres
Publié: (2024)