Exploring Adaptive MCTS with TD Learning in miniXCOM
Fuente:
arXiv
Salvato in:
| Autori principali: | Saadat, Kimiya, Zhao, Richard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Two-Player Performance Through Single-Player Knowledge Transfer: An Empirical Study on Atari 2600 Games
di: Saadat, Kimiya, et al.
Pubblicazione: (2024)
di: Saadat, Kimiya, et al.
Pubblicazione: (2024)
What Does Flow Matching Bring To TD Learning?
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026)
FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control
di: Seo, Younggyo, et al.
Pubblicazione: (2025)
di: Seo, Younggyo, et al.
Pubblicazione: (2025)
Mitigating Estimation Bias with Representation Learning in TD Error-Driven Regularization
di: Chen, Haohui, et al.
Pubblicazione: (2025)
di: Chen, Haohui, et al.
Pubblicazione: (2025)
Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning
di: Chen, Haohui, et al.
Pubblicazione: (2024)
di: Chen, Haohui, et al.
Pubblicazione: (2024)
C-MCTS: Safe Planning with Monte Carlo Tree Search
di: Parthasarathy, Dinesh, et al.
Pubblicazione: (2023)
di: Parthasarathy, Dinesh, et al.
Pubblicazione: (2023)
Analysis of Off-Policy $n$-Step TD-Learning with Linear Function Approximation
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
di: Lim, Han-Dong, et al.
Pubblicazione: (2025)
IQL-TD-MPC: Implicit Q-Learning for Hierarchical Model Predictive Control
di: Chitnis, Rohan, et al.
Pubblicazione: (2023)
di: Chitnis, Rohan, et al.
Pubblicazione: (2023)
Adam-mini: Use Fewer Learning Rates To Gain More
di: Zhang, Yushun, et al.
Pubblicazione: (2024)
di: Zhang, Yushun, et al.
Pubblicazione: (2024)
MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation
di: Wang, Yutong, et al.
Pubblicazione: (2025)
di: Wang, Yutong, et al.
Pubblicazione: (2025)
Hybrid DQN-TD3 Reinforcement Learning for Autonomous Navigation in Dynamic Environments
di: He, Xiaoyi, et al.
Pubblicazione: (2025)
di: He, Xiaoyi, et al.
Pubblicazione: (2025)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
di: Ma, Yiran, et al.
Pubblicazione: (2024)
di: Ma, Yiran, et al.
Pubblicazione: (2024)
Multi-State TD Target for Model-Free Reinforcement Learning
di: Wang, Wuhao, et al.
Pubblicazione: (2024)
di: Wang, Wuhao, et al.
Pubblicazione: (2024)
Search-contempt: a hybrid MCTS algorithm for training AlphaZero-like engines with better computational efficiency
di: Joshi, Ameya
Pubblicazione: (2025)
di: Joshi, Ameya
Pubblicazione: (2025)
MRC-GAT: A Meta-Relational Copula-Based Graph Attention Network for Interpretable Multimodal Alzheimer's Disease Diagnosis
di: Khalvandi, Fatemeh, et al.
Pubblicazione: (2026)
di: Khalvandi, Fatemeh, et al.
Pubblicazione: (2026)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
di: Liu, Jiashun, et al.
Pubblicazione: (2025)
di: Liu, Jiashun, et al.
Pubblicazione: (2025)
Chaos-based reinforcement learning with TD3
di: Matsuki, Toshitaka, et al.
Pubblicazione: (2024)
di: Matsuki, Toshitaka, et al.
Pubblicazione: (2024)
Make Every Move Count: LLM-based High-Quality RTL Code Generation Using MCTS
di: DeLorenzo, Matthew, et al.
Pubblicazione: (2024)
di: DeLorenzo, Matthew, et al.
Pubblicazione: (2024)
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
The Relationship Between Reasoning and Performance in Large Language Models -- o3 (mini) Thinks Harder, Not Longer
di: Ballon, Marthe, et al.
Pubblicazione: (2025)
di: Ballon, Marthe, et al.
Pubblicazione: (2025)
AdaptCL: Adaptive Continual Learning for Tackling Heterogeneity in Sequential Datasets
di: Zhao, Yuqing, et al.
Pubblicazione: (2022)
di: Zhao, Yuqing, et al.
Pubblicazione: (2022)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
di: Hong, Ilgee, et al.
Pubblicazione: (2024)
Adaptive Online Mirror Descent for Tchebycheff Scalarization in Multi-Objective Learning
di: Liu, Meitong, et al.
Pubblicazione: (2024)
di: Liu, Meitong, et al.
Pubblicazione: (2024)
Adaptive Alignment: Dynamic Preference Adjustments via Multi-Objective Reinforcement Learning for Pluralistic AI
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
di: Harland, Hadassah, et al.
Pubblicazione: (2024)
Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection
di: Ling, Zhiwei, et al.
Pubblicazione: (2026)
di: Ling, Zhiwei, et al.
Pubblicazione: (2026)
miniCodeProps: a Minimal Benchmark for Proving Code Properties
di: Lohn, Evan, et al.
Pubblicazione: (2024)
di: Lohn, Evan, et al.
Pubblicazione: (2024)
Adaptive Multi-Agent Deep Reinforcement Learning for Timely Healthcare Interventions
di: Shaik, Thanveer, et al.
Pubblicazione: (2023)
di: Shaik, Thanveer, et al.
Pubblicazione: (2023)
Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
mini-vec2vec: Scaling Universal Geometry Alignment with Linear Transformations
di: Dar, Guy
Pubblicazione: (2025)
di: Dar, Guy
Pubblicazione: (2025)
Abduction of Domain Relationships from Data for VQA
di: Chowdhury, Al Mehdi Saadat, et al.
Pubblicazione: (2025)
di: Chowdhury, Al Mehdi Saadat, et al.
Pubblicazione: (2025)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
di: Zhou, Yang, et al.
Pubblicazione: (2026)
di: Zhou, Yang, et al.
Pubblicazione: (2026)
Meta-Learning Adaptive Loss Functions
di: Raymond, Christian, et al.
Pubblicazione: (2023)
di: Raymond, Christian, et al.
Pubblicazione: (2023)
On the Convergence of Continual Learning with Adaptive Methods
di: Han, Seungyub, et al.
Pubblicazione: (2024)
di: Han, Seungyub, et al.
Pubblicazione: (2024)
Forward Target Propagation: A Forward-Only Approach to Global Error Credit Assignment via Local Losses
di: As-Saquib, Nazmus Saadat, et al.
Pubblicazione: (2025)
di: As-Saquib, Nazmus Saadat, et al.
Pubblicazione: (2025)
PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning
di: Qian, Tianhao
Pubblicazione: (2026)
di: Qian, Tianhao
Pubblicazione: (2026)
Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
di: Mao, Yixiu, et al.
Pubblicazione: (2025)
di: Mao, Yixiu, et al.
Pubblicazione: (2025)
Adaptive Layer Splitting for Wireless LLM Inference in Edge Computing: A Model-Based Reinforcement Learning Approach
di: Chen, Yuxuan, et al.
Pubblicazione: (2024)
di: Chen, Yuxuan, et al.
Pubblicazione: (2024)
Learning To Explore With Predictive World Model Via Self-Supervised Learning
di: Santana, Alana, et al.
Pubblicazione: (2025)
di: Santana, Alana, et al.
Pubblicazione: (2025)
Adaptive Policy Synchronization for Scalable Reinforcement Learning
di: Lafuente-Mercado, Rodney
Pubblicazione: (2025)
di: Lafuente-Mercado, Rodney
Pubblicazione: (2025)
Variational Learning Induces Adaptive Label Smoothing
di: Yang, Sin-Han, et al.
Pubblicazione: (2025)
di: Yang, Sin-Han, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Two-Player Performance Through Single-Player Knowledge Transfer: An Empirical Study on Atari 2600 Games
di: Saadat, Kimiya, et al.
Pubblicazione: (2024) -
What Does Flow Matching Bring To TD Learning?
di: Agrawalla, Bhavya, et al.
Pubblicazione: (2026) -
FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control
di: Seo, Younggyo, et al.
Pubblicazione: (2025) -
Mitigating Estimation Bias with Representation Learning in TD Error-Driven Regularization
di: Chen, Haohui, et al.
Pubblicazione: (2025) -
Double Actor-Critic with TD Error-Driven Regularization in Reinforcement Learning
di: Chen, Haohui, et al.
Pubblicazione: (2024)