Demystifying MuZero Planning: Interpreting the Learned Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guei, Hung, Ju, Yan-Ru, Chen, Wei-Yu, Wu, Ti-Rong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MiniZero: Comparative Analysis of AlphaZero and MuZero on Go, Othello, and Atari Games
par: Wu, Ti-Rong, et autres
Publié: (2023)
par: Wu, Ti-Rong, et autres
Publié: (2023)
OptionZero: Planning with Learned Options
par: Huang, Po-Wei, et autres
Publié: (2025)
par: Huang, Po-Wei, et autres
Publié: (2025)
What model does MuZero learn?
par: He, Jinke, et autres
Publié: (2023)
par: He, Jinke, et autres
Publié: (2023)
MAPLE: Multi-State Aggregated Policy Evaluation for AlphaZero in Imperfect-Information Games
par: Li, Qian-Rong, et autres
Publié: (2026)
par: Li, Qian-Rong, et autres
Publié: (2026)
Regret-Guided Search Control for Efficient Learning in AlphaZero
par: Tsai, Yun-Jui, et autres
Publié: (2026)
par: Tsai, Yun-Jui, et autres
Publié: (2026)
TransZero: Parallel Tree Expansion in MuZero using Transformer Networks
par: Malmsten, Emil, et autres
Publié: (2025)
par: Malmsten, Emil, et autres
Publié: (2025)
Evaluating Game Difficulty in Tetris Block Puzzle
par: Wang, Chun-Jui, et autres
Publié: (2026)
par: Wang, Chun-Jui, et autres
Publié: (2026)
Bridging Local and Global Knowledge via Transformer in Board Games
par: Ju, Yan-Ru, et autres
Publié: (2024)
par: Ju, Yan-Ru, et autres
Publié: (2024)
Dynamic Sight Range Selection in Multi-Agent Reinforcement Learning
par: Liao, Wei-Chen, et autres
Publié: (2025)
par: Liao, Wei-Chen, et autres
Publié: (2025)
A Novel Approach to Solving Goal-Achieving Problems for Board Games
par: Shih, Chung-Chin, et autres
Publié: (2021)
par: Shih, Chung-Chin, et autres
Publié: (2021)
MiMu: Mitigating Multiple Shortcut Learning Behavior of Transformers
par: Zhao, Lili, et autres
Publié: (2025)
par: Zhao, Lili, et autres
Publié: (2025)
Interpreting Emergent Planning in Model-Free Reinforcement Learning
par: Bush, Thomas, et autres
Publié: (2025)
par: Bush, Thomas, et autres
Publié: (2025)
Learning Human-Like RL Agents Through Trajectory Optimization With Action Quantization
par: Guo, Jian-Ting, et autres
Publié: (2025)
par: Guo, Jian-Ting, et autres
Publié: (2025)
Model Collapse Demystified: The Case of Regression
par: Dohmatob, Elvis, et autres
Publié: (2024)
par: Dohmatob, Elvis, et autres
Publié: (2024)
Demystifying the Recency Heuristic in Temporal-Difference Learning
par: Daley, Brett, et autres
Publié: (2024)
par: Daley, Brett, et autres
Publié: (2024)
Demystifying the Optimal Fair Classifier in Multi-Class Classification
par: Zhang, Li, et autres
Publié: (2026)
par: Zhang, Li, et autres
Publié: (2026)
A Study of Solving Life-and-Death Problems in Go Using Relevance-Zone Based Solvers
par: Shih, Chung-Chin, et autres
Publié: (2025)
par: Shih, Chung-Chin, et autres
Publié: (2025)
HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs
par: Zeng, Xinyue, et autres
Publié: (2026)
par: Zeng, Xinyue, et autres
Publié: (2026)
Demystifying the Accuracy-Interpretability Trade-Off: A Case Study of Inferring Ratings from Reviews
par: Atrey, Pranjal, et autres
Publié: (2025)
par: Atrey, Pranjal, et autres
Publié: (2025)
Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions
par: Pei, Yan Ru
Publié: (2025)
par: Pei, Yan Ru
Publié: (2025)
Strength Estimation and Human-Like Strength Adjustment in Games
par: Chen, Chun Jung, et autres
Publié: (2025)
par: Chen, Chun Jung, et autres
Publié: (2025)
Meta Additive Model: Interpretable Sparse Learning With Auto Weighting
par: Zhang, Xuelin, et autres
Publié: (2026)
par: Zhang, Xuelin, et autres
Publié: (2026)
Revitalizing Black-Box Interpretability: Actionable Interpretability for LLMs via Proxy Models
par: Liu, Junhao, et autres
Publié: (2025)
par: Liu, Junhao, et autres
Publié: (2025)
GeMuCo: Generalized Multisensory Correlational Model for Body Schema Learning
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Demystifying Embedding Spaces using Large Language Models
par: Tennenholtz, Guy, et autres
Publié: (2023)
par: Tennenholtz, Guy, et autres
Publié: (2023)
Conversational Orientation Reasoning: Egocentric-to-Allocentric Navigation with Multimodal Chain-of-Thought
par: Huang, Yu Ti
Publié: (2025)
par: Huang, Yu Ti
Publié: (2025)
Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective
par: Xie, Hong, et autres
Publié: (2026)
par: Xie, Hong, et autres
Publié: (2026)
Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Remediation Throughput
par: Pesoli, Alfredo, et autres
Publié: (2026)
par: Pesoli, Alfredo, et autres
Publié: (2026)
AlphaZero-Edu: Democratizing Access to AlphaZero
par: Li, Ruitong, et autres
Publié: (2025)
par: Li, Ruitong, et autres
Publié: (2025)
Interpretable by AI Mother Tongue: Native Symbolic Reasoning in Neural Models
par: Liu, Hung Ming
Publié: (2025)
par: Liu, Hung Ming
Publié: (2025)
Shortcut to Nowhere: Demystifying Deep Spurious Regression
par: Xu, Guanrong, et autres
Publié: (2026)
par: Xu, Guanrong, et autres
Publié: (2026)
Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
par: Halder, Indranil, et autres
Publié: (2025)
par: Halder, Indranil, et autres
Publié: (2025)
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search
par: Liu, Max, et autres
Publié: (2024)
par: Liu, Max, et autres
Publié: (2024)
Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning
par: Wang, Sai, et autres
Publié: (2025)
par: Wang, Sai, et autres
Publié: (2025)
Oversmoothing, Oversquashing, Heterophily, Long-Range, and more: Demystifying Common Beliefs in Graph Machine Learning
par: Arnaiz-Rodriguez, Adrian, et autres
Publié: (2025)
par: Arnaiz-Rodriguez, Adrian, et autres
Publié: (2025)
Fast and Interpretable Mixed-Integer Linear Program Solving by Learning Model Reduction
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
No Black Box Anymore: Demystifying Clinical Predictive Modeling with Temporal-Feature Cross Attention Mechanism
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Demystifying the Physics of Deep Reinforcement Learning-Based Autonomous Vehicle Decision-Making
par: Wan, Hanxi, et autres
Publié: (2024)
par: Wan, Hanxi, et autres
Publié: (2024)
Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning
par: Yan, John, et autres
Publié: (2026)
par: Yan, John, et autres
Publié: (2026)
Explanation-Guided Adversarial Training for Robust and Interpretable Models
par: Chen, Chao, et autres
Publié: (2026)
par: Chen, Chao, et autres
Publié: (2026)
Documents similaires
-
MiniZero: Comparative Analysis of AlphaZero and MuZero on Go, Othello, and Atari Games
par: Wu, Ti-Rong, et autres
Publié: (2023) -
OptionZero: Planning with Learned Options
par: Huang, Po-Wei, et autres
Publié: (2025) -
What model does MuZero learn?
par: He, Jinke, et autres
Publié: (2023) -
MAPLE: Multi-State Aggregated Policy Evaluation for AlphaZero in Imperfect-Information Games
par: Li, Qian-Rong, et autres
Publié: (2026) -
Regret-Guided Search Control for Efficient Learning in AlphaZero
par: Tsai, Yun-Jui, et autres
Publié: (2026)