Mirror Learning: A Unifying Framework of Policy Optimisation
Fuente:
arXiv
Salvato in:
| Autori principali: | Kuba, Jakub Grudzien, de Witt, Christian Schroeder, Foerster, Jakob |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cliqueformer: Model-Based Optimization with Structured Transformers
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
Functional Graphical Models: Structure Enables Offline Data-Driven Optimization
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024)
Rethinking Out-of-Distribution Detection for Reinforcement Learning: Advancing Methods for Evaluation and Detection
di: Nasvytis, Linas, et al.
Pubblicazione: (2024)
di: Nasvytis, Linas, et al.
Pubblicazione: (2024)
DEEDEE: Fast and Scalable Out-of-Distribution Dynamics Detection
di: Aljaafari, Tala, et al.
Pubblicazione: (2025)
di: Aljaafari, Tala, et al.
Pubblicazione: (2025)
JaxUED: A simple and useable UED library in Jax
di: Coward, Samuel, et al.
Pubblicazione: (2024)
di: Coward, Samuel, et al.
Pubblicazione: (2024)
Beyond the Boundaries of Proximal Policy Optimization
di: Tan, Charlie B., et al.
Pubblicazione: (2024)
di: Tan, Charlie B., et al.
Pubblicazione: (2024)
Learning Multi-Agent Communication with Contrastive Learning
di: Lo, Yat Long, et al.
Pubblicazione: (2023)
di: Lo, Yat Long, et al.
Pubblicazione: (2023)
The Edge-of-Reach Problem in Offline Model-Based Reinforcement Learning
di: Sims, Anya, et al.
Pubblicazione: (2024)
di: Sims, Anya, et al.
Pubblicazione: (2024)
Holder Policy Optimisation
di: Chen, Yuxiang, et al.
Pubblicazione: (2026)
di: Chen, Yuxiang, et al.
Pubblicazione: (2026)
A Universal Banach--Bregman Framework for Stochastic Iterations: Unifying Stochastic Mirror Descent, Learning and LLM Training
di: Zhang, Johnny R., et al.
Pubblicazione: (2025)
di: Zhang, Johnny R., et al.
Pubblicazione: (2025)
Policy-Guided Diffusion
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
Abstraction for Offline Goal-Conditioned Reinforcement Learning
di: Wibault, Clarisse, et al.
Pubblicazione: (2026)
di: Wibault, Clarisse, et al.
Pubblicazione: (2026)
Policy Mirror Descent with Lookahead
di: Protopapas, Kimon, et al.
Pubblicazione: (2024)
di: Protopapas, Kimon, et al.
Pubblicazione: (2024)
Offline Materials Optimization with CliqueFlowmer
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2026)
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2026)
A Model-Based Solution to the Offline Multi-Agent Reinforcement Learning Coordination Problem
di: Barde, Paul, et al.
Pubblicazione: (2023)
di: Barde, Paul, et al.
Pubblicazione: (2023)
DITTO: Offline Imitation Learning with World Models
di: DeMoss, Branton, et al.
Pubblicazione: (2023)
di: DeMoss, Branton, et al.
Pubblicazione: (2023)
How Should We Meta-Learn Reinforcement Learning Algorithms?
di: Goldie, Alexander David, et al.
Pubblicazione: (2025)
di: Goldie, Alexander David, et al.
Pubblicazione: (2025)
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
di: Matthews, Michael, et al.
Pubblicazione: (2024)
di: Matthews, Michael, et al.
Pubblicazione: (2024)
Recurrent Reinforcement Learning with Memoroids
di: Morad, Steven, et al.
Pubblicazione: (2024)
di: Morad, Steven, et al.
Pubblicazione: (2024)
Meta-Learning Objectives for Preference Optimization
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
Highway Reinforcement Learning
di: Wang, Yuhui, et al.
Pubblicazione: (2024)
di: Wang, Yuhui, et al.
Pubblicazione: (2024)
Can Learned Optimization Make Reinforcement Learning Less Difficult?
di: Goldie, Alexander David, et al.
Pubblicazione: (2024)
di: Goldie, Alexander David, et al.
Pubblicazione: (2024)
A Clean Slate for Offline Reinforcement Learning
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2025)
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2025)
h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
SPO: Sequential Monte Carlo Policy Optimisation
di: Macfarlane, Matthew V, et al.
Pubblicazione: (2024)
di: Macfarlane, Matthew V, et al.
Pubblicazione: (2024)
Learning to Reason at the Frontier of Learnability
di: Foster, Thomas, et al.
Pubblicazione: (2025)
di: Foster, Thomas, et al.
Pubblicazione: (2025)
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
di: Wu, Qingyuan, et al.
Pubblicazione: (2026)
di: Wu, Qingyuan, et al.
Pubblicazione: (2026)
OpenSanctions Pairs: Large-Scale Entity Matching with LLMs
di: Smith, Chandler, et al.
Pubblicazione: (2026)
di: Smith, Chandler, et al.
Pubblicazione: (2026)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Symmetry-Breaking Augmentations for Ad Hoc Teamwork
di: Hammond, Ravi, et al.
Pubblicazione: (2024)
di: Hammond, Ravi, et al.
Pubblicazione: (2024)
The Yokai Learning Environment: Tracking Beliefs Over Space and Time
di: Ruhdorfer, Constantin, et al.
Pubblicazione: (2025)
di: Ruhdorfer, Constantin, et al.
Pubblicazione: (2025)
SOReL and TOReL: Two Methods for Fully Offline Reinforcement Learning
di: Fellows, Mattie, et al.
Pubblicazione: (2025)
di: Fellows, Mattie, et al.
Pubblicazione: (2025)
Discovering Temporally-Aware Reinforcement Learning Algorithms
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
di: Jackson, Matthew Thomas, et al.
Pubblicazione: (2024)
Fast Convergence of Softmax Policy Mirror Ascent
di: Asad, Reza, et al.
Pubblicazione: (2024)
di: Asad, Reza, et al.
Pubblicazione: (2024)
OMPO: A Unified Framework for RL under Policy and Dynamics Shifts
di: Luo, Yu, et al.
Pubblicazione: (2024)
di: Luo, Yu, et al.
Pubblicazione: (2024)
StaQ it! Growing neural networks for Policy Mirror Descent
di: Shilova, Alena, et al.
Pubblicazione: (2025)
di: Shilova, Alena, et al.
Pubblicazione: (2025)
QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning
di: Weinberg, Abraham Itzhak
Pubblicazione: (2026)
di: Weinberg, Abraham Itzhak
Pubblicazione: (2026)
Behaviour Distillation
di: Lupu, Andrei, et al.
Pubblicazione: (2024)
di: Lupu, Andrei, et al.
Pubblicazione: (2024)
Goal-Conditioned Agents that Learn Everything All at Once
di: Matthews, Michael, et al.
Pubblicazione: (2026)
di: Matthews, Michael, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Cliqueformer: Model-Based Optimization with Structured Transformers
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024) -
Functional Graphical Models: Structure Enables Offline Data-Driven Optimization
di: Kuba, Jakub Grudzien, et al.
Pubblicazione: (2024) -
Rethinking Out-of-Distribution Detection for Reinforcement Learning: Advancing Methods for Evaluation and Detection
di: Nasvytis, Linas, et al.
Pubblicazione: (2024) -
DEEDEE: Fast and Scalable Out-of-Distribution Dynamics Detection
di: Aljaafari, Tala, et al.
Pubblicazione: (2025) -
JaxUED: A simple and useable UED library in Jax
di: Coward, Samuel, et al.
Pubblicazione: (2024)