Refining Minimax Regret for Unsupervised Environment Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Beukman, Michael, Coward, Samuel, Matthews, Michael, Fellows, Mattie, Jiang, Minqi, Dennis, Michael, Foerster, Jakob |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
JaxUED: A simple and useable UED library in Jax
par: Coward, Samuel, et autres
Publié: (2024)
par: Coward, Samuel, et autres
Publié: (2024)
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
par: Matthews, Michael, et autres
Publié: (2024)
par: Matthews, Michael, et autres
Publié: (2024)
No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
par: Rutherford, Alexander, et autres
Publié: (2024)
par: Rutherford, Alexander, et autres
Publié: (2024)
SOReL and TOReL: Two Methods for Fully Offline Reinforcement Learning
par: Fellows, Mattie, et autres
Publié: (2025)
par: Fellows, Mattie, et autres
Publié: (2025)
Learning to Reason at the Frontier of Learnability
par: Foster, Thomas, et autres
Publié: (2025)
par: Foster, Thomas, et autres
Publié: (2025)
Goal-Conditioned Agents that Learn Everything All at Once
par: Matthews, Michael, et autres
Publié: (2026)
par: Matthews, Michael, et autres
Publié: (2026)
Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning
par: Matthews, Michael, et autres
Publié: (2024)
par: Matthews, Michael, et autres
Publié: (2024)
JaxLife: An Open-Ended Agentic Simulator
par: Lu, Chris, et autres
Publié: (2024)
par: Lu, Chris, et autres
Publié: (2024)
An Optimisation Framework for Unsupervised Environment Design
par: Monette, Nathan, et autres
Publié: (2025)
par: Monette, Nathan, et autres
Publié: (2025)
DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems
par: Röpke, Willem, et autres
Publié: (2026)
par: Röpke, Willem, et autres
Publié: (2026)
minimax: Efficient Baselines for Autocurricula in JAX
par: Jiang, Minqi, et autres
Publié: (2023)
par: Jiang, Minqi, et autres
Publié: (2023)
Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments
par: Beukman, Michael, et autres
Publié: (2026)
par: Beukman, Michael, et autres
Publié: (2026)
Beyond Fixed Tasks: Unsupervised Environment Design for Task-Level Pairs
par: Furelos-Blanco, Daniel, et autres
Publié: (2025)
par: Furelos-Blanco, Daniel, et autres
Publié: (2025)
Hierarchical Behaviour Spaces
par: Matthews, Michael Tryfan, et autres
Publié: (2026)
par: Matthews, Michael Tryfan, et autres
Publié: (2026)
Improving Regret Approximation for Unsupervised Dynamic Environment Generation
par: Mead, Harry, et autres
Publié: (2026)
par: Mead, Harry, et autres
Publié: (2026)
Scalable Option Learning in High-Throughput Environments
par: Henaff, Mikael, et autres
Publié: (2025)
par: Henaff, Mikael, et autres
Publié: (2025)
Policy-Guided Diffusion
par: Jackson, Matthew Thomas, et autres
Publié: (2024)
par: Jackson, Matthew Thomas, et autres
Publié: (2024)
Learning Multi-Agent Communication with Contrastive Learning
par: Lo, Yat Long, et autres
Publié: (2023)
par: Lo, Yat Long, et autres
Publié: (2023)
Learning to Act without Actions
par: Schmidt, Dominik, et autres
Publié: (2023)
par: Schmidt, Dominik, et autres
Publié: (2023)
Adversarial Environment Design via Regret-Guided Diffusion Models
par: Chung, Hojun, et autres
Publié: (2024)
par: Chung, Hojun, et autres
Publié: (2024)
TRACED: Transition-aware Regret Approximation with Co-learnability for Environment Design
par: Cho, Geonwoo, et autres
Publié: (2025)
par: Cho, Geonwoo, et autres
Publié: (2025)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
par: Boudart, Pierre, et autres
Publié: (2026)
par: Boudart, Pierre, et autres
Publié: (2026)
The Yokai Learning Environment: Tracking Beliefs Over Space and Time
par: Ruhdorfer, Constantin, et autres
Publié: (2025)
par: Ruhdorfer, Constantin, et autres
Publié: (2025)
High entropy leads to symmetry equivariant policies in Dec-POMDPs
par: Forkel, Johannes, et autres
Publié: (2025)
par: Forkel, Johannes, et autres
Publié: (2025)
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
Mixture of Experts in a Mixture of RL settings
par: Willi, Timon, et autres
Publié: (2024)
par: Willi, Timon, et autres
Publié: (2024)
Simplifying Deep Temporal Difference Learning
par: Gallici, Matteo, et autres
Publié: (2024)
par: Gallici, Matteo, et autres
Publié: (2024)
The Generalization Gap in Offline Reinforcement Learning
par: Mediratta, Ishita, et autres
Publié: (2023)
par: Mediratta, Ishita, et autres
Publié: (2023)
The Edge-of-Reach Problem in Offline Model-Based Reinforcement Learning
par: Sims, Anya, et autres
Publié: (2024)
par: Sims, Anya, et autres
Publié: (2024)
Mirror Learning: A Unifying Framework of Policy Optimisation
par: Kuba, Jakub Grudzien, et autres
Publié: (2022)
par: Kuba, Jakub Grudzien, et autres
Publié: (2022)
Evolution Strategies at the Hyperscale
par: Sarkar, Bidipta, et autres
Publié: (2025)
par: Sarkar, Bidipta, et autres
Publié: (2025)
Symmetry-Breaking Augmentations for Ad Hoc Teamwork
par: Hammond, Ravi, et autres
Publié: (2024)
par: Hammond, Ravi, et autres
Publié: (2024)
Abstraction for Offline Goal-Conditioned Reinforcement Learning
par: Wibault, Clarisse, et autres
Publié: (2026)
par: Wibault, Clarisse, et autres
Publié: (2026)
Graph Persistence goes Spectral
par: Ji, Mattie, et autres
Publié: (2025)
par: Ji, Mattie, et autres
Publié: (2025)
Refining Filter Global Feature Weighting for Fully-Unsupervised Clustering
par: Galis, Fabian, et autres
Publié: (2025)
par: Galis, Fabian, et autres
Publié: (2025)
Adam on Local Time: Addressing Nonstationarity in RL with Relative Adam Timesteps
par: Ellis, Benjamin, et autres
Publié: (2024)
par: Ellis, Benjamin, et autres
Publié: (2024)
Rethinking Early Stopping: Refine, Then Calibrate
par: Berta, Eugène, et autres
Publié: (2025)
par: Berta, Eugène, et autres
Publié: (2025)
Behaviour Distillation
par: Lupu, Andrei, et autres
Publié: (2024)
par: Lupu, Andrei, et autres
Publié: (2024)
DITTO: Offline Imitation Learning with World Models
par: DeMoss, Branton, et autres
Publié: (2023)
par: DeMoss, Branton, et autres
Publié: (2023)
Procedural Generation of Algorithm Discovery Tasks in Machine Learning
par: Goldie, Alexander D., et autres
Publié: (2026)
par: Goldie, Alexander D., et autres
Publié: (2026)
Documents similaires
-
JaxUED: A simple and useable UED library in Jax
par: Coward, Samuel, et autres
Publié: (2024) -
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
par: Matthews, Michael, et autres
Publié: (2024) -
No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery
par: Rutherford, Alexander, et autres
Publié: (2024) -
SOReL and TOReL: Two Methods for Fully Offline Reinforcement Learning
par: Fellows, Mattie, et autres
Publié: (2025) -
Learning to Reason at the Frontier of Learnability
par: Foster, Thomas, et autres
Publié: (2025)