Revisiting Regularized Policy Optimization for Stable and Efficient Reinforcement Learning in Two-Player Games
Fuente:
arXiv
Salvato in:
| Autori principali: | Ota, Kazuki, Osa, Takayuki, Omura, Motoki, Harada, Tatsuya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Offline Reinforcement Learning with Wasserstein Regularization via Optimal Transport Maps
di: Omura, Motoki, et al.
Pubblicazione: (2025)
di: Omura, Motoki, et al.
Pubblicazione: (2025)
Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning
di: Omura, Motoki, et al.
Pubblicazione: (2025)
di: Omura, Motoki, et al.
Pubblicazione: (2025)
Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning
di: Shitanda, Naoki, et al.
Pubblicazione: (2026)
di: Shitanda, Naoki, et al.
Pubblicazione: (2026)
Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning
di: Omura, Motoki, et al.
Pubblicazione: (2024)
di: Omura, Motoki, et al.
Pubblicazione: (2024)
Stabilizing Extreme Q-learning by Maclaurin Expansion
di: Omura, Motoki, et al.
Pubblicazione: (2024)
di: Omura, Motoki, et al.
Pubblicazione: (2024)
Discovering Multiple Solutions from a Single Task in Offline Reinforcement Learning
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
Robustifying a Policy in Multi-Agent RL with Diverse Cooperative Behaviors and Adversarial Style Sampling for Assistive Tasks
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
di: Osa, Takayuki, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning from Datasets with Structured Non-Stationarity
di: Ackermann, Johannes, et al.
Pubblicazione: (2024)
di: Ackermann, Johannes, et al.
Pubblicazione: (2024)
Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets
di: Abe, Haruki, et al.
Pubblicazione: (2026)
di: Abe, Haruki, et al.
Pubblicazione: (2026)
Entropy Controllable Direct Preference Optimization
di: Omura, Motoki, et al.
Pubblicazione: (2024)
di: Omura, Motoki, et al.
Pubblicazione: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2025)
Enhancing Two-Player Performance Through Single-Player Knowledge Transfer: An Empirical Study on Atari 2600 Games
di: Saadat, Kimiya, et al.
Pubblicazione: (2024)
di: Saadat, Kimiya, et al.
Pubblicazione: (2024)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces
di: Ota, Toshihiro
Pubblicazione: (2024)
di: Ota, Toshihiro
Pubblicazione: (2024)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
Revisiting Mixture Policies in Entropy-Regularized Actor-Critic
di: He, Jiamin, et al.
Pubblicazione: (2026)
di: He, Jiamin, et al.
Pubblicazione: (2026)
EXPO: Stable Reinforcement Learning with Expressive Policies
di: Dong, Perry, et al.
Pubblicazione: (2025)
di: Dong, Perry, et al.
Pubblicazione: (2025)
Efficient Deep Reinforcement Learning with Predictive Processing Proximal Policy Optimization
di: Küçükoğlu, Burcu, et al.
Pubblicazione: (2022)
di: Küçükoğlu, Burcu, et al.
Pubblicazione: (2022)
DeepStock: Reinforcement Learning with Policy Regularizations for Inventory Management
di: Xie, Yaqi, et al.
Pubblicazione: (2026)
di: Xie, Yaqi, et al.
Pubblicazione: (2026)
Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective
di: Zhang, Jinouwen, et al.
Pubblicazione: (2024)
di: Zhang, Jinouwen, et al.
Pubblicazione: (2024)
Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning
di: Luo, Yu, et al.
Pubblicazione: (2026)
di: Luo, Yu, et al.
Pubblicazione: (2026)
Stable Reinforcement Learning for Efficient Reasoning
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
di: Xue, Zhenghai, et al.
Pubblicazione: (2025)
di: Xue, Zhenghai, et al.
Pubblicazione: (2025)
MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
Enhancing Player Enjoyment with a Two-Tier DRL and LLM-Based Agent System for Fighting Games
di: Wang, Shouren, et al.
Pubblicazione: (2025)
di: Wang, Shouren, et al.
Pubblicazione: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
di: Liu, Tenglong, et al.
Pubblicazione: (2024)
Complexity-Regularized Proximal Policy Optimization
di: Serfilippi, Luca, et al.
Pubblicazione: (2025)
di: Serfilippi, Luca, et al.
Pubblicazione: (2025)
Symmetric Behavior Regularized Policy Optimization
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
di: Zhu, Lingwei, et al.
Pubblicazione: (2025)
Conformal Symplectic Optimization for Stable Reinforcement Learning
di: Lyu, Yao, et al.
Pubblicazione: (2024)
di: Lyu, Yao, et al.
Pubblicazione: (2024)
Stable CDE Autoencoders with Acuity Regularization for Offline Reinforcement Learning in Sepsis Treatment
di: Gao, Yue
Pubblicazione: (2025)
di: Gao, Yue
Pubblicazione: (2025)
Efficient Reinforcement Learning for Zero-Shot Coordination in Evolving Games
di: Hui, Bingyu, et al.
Pubblicazione: (2025)
di: Hui, Bingyu, et al.
Pubblicazione: (2025)
GCHR : Goal-Conditioned Hindsight Regularization for Sample-Efficient Reinforcement Learning
di: Lei, Xing, et al.
Pubblicazione: (2025)
di: Lei, Xing, et al.
Pubblicazione: (2025)
Federated Offline Policy Optimization with Dual Regularization
di: Yue, Sheng, et al.
Pubblicazione: (2024)
di: Yue, Sheng, et al.
Pubblicazione: (2024)
Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
di: Doo, JaeHyeok, et al.
Pubblicazione: (2026)
di: Doo, JaeHyeok, et al.
Pubblicazione: (2026)
Mirror Mode in Fire Emblem: Beating Players at their own Game with Imitation and Reinforcement Learning
di: Smid, Yanna Elizabeth, et al.
Pubblicazione: (2025)
di: Smid, Yanna Elizabeth, et al.
Pubblicazione: (2025)
Learning Regularizers: Learning Optimizers that can Regularize
di: Sahoo, Suraj Kumar, et al.
Pubblicazione: (2025)
di: Sahoo, Suraj Kumar, et al.
Pubblicazione: (2025)
Continuous Reasoning for Vision-Language-Action
di: Wu, Yueh-Hua, et al.
Pubblicazione: (2026)
di: Wu, Yueh-Hua, et al.
Pubblicazione: (2026)
State Regularized Policy Optimization on Data with Dynamics Shift
di: Xue, Zhenghai, et al.
Pubblicazione: (2023)
di: Xue, Zhenghai, et al.
Pubblicazione: (2023)
Revisiting Adam for Streaming Reinforcement Learning
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
di: Gogianu, Florin, et al.
Pubblicazione: (2026)
GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning
di: Liu, Ziru, et al.
Pubblicazione: (2025)
di: Liu, Ziru, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Offline Reinforcement Learning with Wasserstein Regularization via Optimal Transport Maps
di: Omura, Motoki, et al.
Pubblicazione: (2025) -
Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning
di: Omura, Motoki, et al.
Pubblicazione: (2025) -
Rethinking Policy Diversity in Ensemble Policy Gradient in Large-Scale Reinforcement Learning
di: Shitanda, Naoki, et al.
Pubblicazione: (2026) -
Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning
di: Omura, Motoki, et al.
Pubblicazione: (2024) -
Stabilizing Extreme Q-learning by Maclaurin Expansion
di: Omura, Motoki, et al.
Pubblicazione: (2024)