AlphaZeroES: Direct score maximization outperforms planning loss minimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Martin, Carlos, Sandholm, Tuomas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ApproxED: Approximate exploitability descent via learned best responses
par: Martin, Carlos, et autres
Publié: (2023)
par: Martin, Carlos, et autres
Publié: (2023)
Domain-Independent Game Abstraction using Word Embedding Techniques
par: Kim, Juho, et autres
Publié: (2026)
par: Kim, Juho, et autres
Publié: (2026)
Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques
par: Kim, Juho, et autres
Publié: (2026)
par: Kim, Juho, et autres
Publié: (2026)
Parallelizing Counterfactual Regret Minimization
par: Kim, Juho, et autres
Publié: (2026)
par: Kim, Juho, et autres
Publié: (2026)
General search techniques without common knowledge for imperfect-information games, and application to superhuman Fog of War chess
par: Zhang, Brian Hu, et autres
Publié: (2025)
par: Zhang, Brian Hu, et autres
Publié: (2025)
Watermarking Game-Playing Agents in Perfect-Information Extensive-Form Games
par: Kim, Juho, et autres
Publié: (2026)
par: Kim, Juho, et autres
Publié: (2026)
AlphaZero-Edu: Democratizing Access to AlphaZero
par: Li, Ruitong, et autres
Publié: (2025)
par: Li, Ruitong, et autres
Publié: (2025)
Optimal Correlated Equilibria in General-Sum Extensive-Form Games: Fixed-Parameter Algorithms, Hardness, and Two-Sided Column-Generation
par: Zhang, Brian, et autres
Publié: (2022)
par: Zhang, Brian, et autres
Publié: (2022)
Learning Potentials for Dynamic Matching and Application to Heart Transplantation
par: Zilberstein, Itai, et autres
Publié: (2026)
par: Zilberstein, Itai, et autres
Publié: (2026)
Near-Optimal Dynamic Matching via Coarsening with Application to Heart Transplantation
par: Zilberstein, Itai, et autres
Publié: (2026)
par: Zilberstein, Itai, et autres
Publié: (2026)
Game-Theoretic Multiagent Reinforcement Learning
par: Yang, Yaodong, et autres
Publié: (2020)
par: Yang, Yaodong, et autres
Publié: (2020)
MiniZero: Comparative Analysis of AlphaZero and MuZero on Go, Othello, and Atari Games
par: Wu, Ti-Rong, et autres
Publié: (2023)
par: Wu, Ti-Rong, et autres
Publié: (2023)
Diversifying AI: Towards Creative Chess with AlphaZero
par: Zahavy, Tom, et autres
Publié: (2023)
par: Zahavy, Tom, et autres
Publié: (2023)
A multi-scale loss formulation for learning a probabilistic model with proper score optimisation
par: Lang, Simon, et autres
Publié: (2025)
par: Lang, Simon, et autres
Publié: (2025)
Faster Optimal Coalition Structure Generation via Offline Coalition Selection and Graph-Based Search
par: Taguelmimt, Redha, et autres
Publié: (2024)
par: Taguelmimt, Redha, et autres
Publié: (2024)
Alpha Zero for Physics: Application of Symbolic Regression with Alpha Zero to find the analytical methods in physics
par: Michishita, Yoshihiro
Publié: (2023)
par: Michishita, Yoshihiro
Publié: (2023)
Joint-perturbation simultaneous pseudo-gradient
par: Martin, Carlos, et autres
Publié: (2024)
par: Martin, Carlos, et autres
Publié: (2024)
Simultaneous incremental support adjustment and metagame solving: An equilibrium-finding framework for continuous-action games
par: Martin, Carlos, et autres
Publié: (2024)
par: Martin, Carlos, et autres
Publié: (2024)
Solving Infinite-Player Games with Player-to-Strategy Networks
par: Martin, Carlos, et autres
Publié: (2025)
par: Martin, Carlos, et autres
Publié: (2025)
AlphaMath Almost Zero: Process Supervision without Process
par: Chen, Guoxin, et autres
Publié: (2024)
par: Chen, Guoxin, et autres
Publié: (2024)
Regret-Guided Search Control for Efficient Learning in AlphaZero
par: Tsai, Yun-Jui, et autres
Publié: (2026)
par: Tsai, Yun-Jui, et autres
Publié: (2026)
Game-Theoretic Robust Reinforcement Learning Handles Temporally-Coupled Perturbations
par: Liang, Yongyuan, et autres
Publié: (2023)
par: Liang, Yongyuan, et autres
Publié: (2023)
Improving Robustness of AlphaZero Algorithms to Test-Time Environment Changes
par: Tamassia, Isidoro, et autres
Publié: (2025)
par: Tamassia, Isidoro, et autres
Publié: (2025)
Representation Matters for Mastering Chess: Improved Feature Representation in AlphaZero Outperforms Switching to Transformers
par: Czech, Johannes, et autres
Publié: (2023)
par: Czech, Johannes, et autres
Publié: (2023)
Multi-agent AI systems outperform human teams in creativity
par: Hu, Tiancheng, et autres
Publié: (2026)
par: Hu, Tiancheng, et autres
Publié: (2026)
Zero loss guarantees and explicit minimizers for generic overparametrized Deep Learning networks
par: Chen, Thomas, et autres
Publié: (2025)
par: Chen, Thomas, et autres
Publié: (2025)
A Multiagent Path Search Algorithm for Large-Scale Coalition Structure Generation
par: Taguelmimt, Redha, et autres
Publié: (2025)
par: Taguelmimt, Redha, et autres
Publié: (2025)
Convergence of $\text{log}(1/ε)$ for Gradient-Based Algorithms in Zero-Sum Games without the Condition Number: A Smoothed Analysis
par: Anagnostides, Ioannis, et autres
Publié: (2024)
par: Anagnostides, Ioannis, et autres
Publié: (2024)
MAPLE: Multi-State Aggregated Policy Evaluation for AlphaZero in Imperfect-Information Games
par: Li, Qian-Rong, et autres
Publié: (2026)
par: Li, Qian-Rong, et autres
Publié: (2026)
Exponential Lower Bounds on the Double Oracle Algorithm in Zero-Sum Games
par: Zhang, Brian Hu, et autres
Publié: (2024)
par: Zhang, Brian Hu, et autres
Publié: (2024)
Code-enabled language models can outperform reasoning models on diverse tasks
par: Zhang, Cedegao E., et autres
Publié: (2025)
par: Zhang, Cedegao E., et autres
Publié: (2025)
Pretrained deep models outperform GBDTs in Learning-To-Rank under label scarcity
par: Hou, Charlie, et autres
Publié: (2023)
par: Hou, Charlie, et autres
Publié: (2023)
Finding Increasingly Large Extremal Graphs with AlphaZero and Tabu Search
par: Mehrabian, Abbas, et autres
Publié: (2023)
par: Mehrabian, Abbas, et autres
Publié: (2023)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
AlphaPROBE: Alpha Mining via Principled Retrieval and On-graph biased evolution
par: Guo, Taian, et autres
Publié: (2026)
par: Guo, Taian, et autres
Publié: (2026)
Can OpenAI o1 outperform humans in higher-order cognitive thinking?
par: Latif, Ehsan, et autres
Publié: (2024)
par: Latif, Ehsan, et autres
Publié: (2024)
Dual-attention ResNet outperforms transformers in HER2 prediction on DCE-MRI
par: Fridman, Naomi, et autres
Publié: (2025)
par: Fridman, Naomi, et autres
Publié: (2025)
Towards Faster Matrix Diagonalization with Graph Isomorphism Networks and the AlphaZero Framework
par: Zollicoffer, Geigh, et autres
Publié: (2024)
par: Zollicoffer, Geigh, et autres
Publié: (2024)
Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
par: Jørgensen, Mikkel Godsk, et autres
Publié: (2026)
Scalable Mechanism Design for Multi-Agent Path Finding
par: Friedrich, Paul, et autres
Publié: (2024)
par: Friedrich, Paul, et autres
Publié: (2024)
Documents similaires
-
ApproxED: Approximate exploitability descent via learned best responses
par: Martin, Carlos, et autres
Publié: (2023) -
Domain-Independent Game Abstraction using Word Embedding Techniques
par: Kim, Juho, et autres
Publié: (2026) -
Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques
par: Kim, Juho, et autres
Publié: (2026) -
Parallelizing Counterfactual Regret Minimization
par: Kim, Juho, et autres
Publié: (2026) -
General search techniques without common knowledge for imperfect-information games, and application to superhuman Fog of War chess
par: Zhang, Brian Hu, et autres
Publié: (2025)