Meta-Gradient Search Control: A Method for Improving the Efficiency of Dyna-style Planning
Fuente:
arXiv
Guardado en:
| Autores principales: | Burega, Bradley, Martin, John D., Kapeluck, Luke, Bowling, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Value Hallucination in Dyna Planning via Multistep Predecessor Models
por: Aminmansour, Farzane, et al.
Publicado: (2020)
por: Aminmansour, Farzane, et al.
Publicado: (2020)
On the Interplay Between Sparsity and Training in Deep Reinforcement Learning
por: Davelouis, Fatima, et al.
Publicado: (2025)
por: Davelouis, Fatima, et al.
Publicado: (2025)
A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning
por: Adkins, Jacob, et al.
Publicado: (2024)
por: Adkins, Jacob, et al.
Publicado: (2024)
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
por: Asri, Zakariae El, et al.
Publicado: (2024)
por: Asri, Zakariae El, et al.
Publicado: (2024)
Proper Laplacian Representation Learning
por: Gomez, Diego, et al.
Publicado: (2023)
por: Gomez, Diego, et al.
Publicado: (2023)
Real-Time Recurrent Learning using Trace Units in Reinforcement Learning
por: Elelimy, Esraa, et al.
Publicado: (2024)
por: Elelimy, Esraa, et al.
Publicado: (2024)
Rethinking the Foundations for Continual Reinforcement Learning
por: Elelimy, Esraa, et al.
Publicado: (2025)
por: Elelimy, Esraa, et al.
Publicado: (2025)
Improving MoE Compute Efficiency by Composing Weight and Data Sparsity
por: Kilian, Maciej, et al.
Publicado: (2026)
por: Kilian, Maciej, et al.
Publicado: (2026)
DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning
por: Hao, Chuzhan, et al.
Publicado: (2025)
por: Hao, Chuzhan, et al.
Publicado: (2025)
Search-Based Adversarial Estimates for Improving Sample Efficiency in Off-Policy Reinforcement Learning
por: Malato, Federico, et al.
Publicado: (2025)
por: Malato, Federico, et al.
Publicado: (2025)
Learning to Be Cautious
por: Mohammedalamen, Montaser, et al.
Publicado: (2021)
por: Mohammedalamen, Montaser, et al.
Publicado: (2021)
GradMetaNet: An Equivariant Architecture for Learning on Gradients
por: Gelberg, Yoav, et al.
Publicado: (2025)
por: Gelberg, Yoav, et al.
Publicado: (2025)
Improving Line Search Methods for Large Scale Neural Network Training
por: Kenneweg, Philip, et al.
Publicado: (2024)
por: Kenneweg, Philip, et al.
Publicado: (2024)
Hypothesis Network Planned Exploration for Rapid Meta-Reinforcement Learning Adaptation
por: Jacobson, Maxwell Joseph, et al.
Publicado: (2023)
por: Jacobson, Maxwell Joseph, et al.
Publicado: (2023)
A Theoretical Understanding of Gradient Bias in Meta-Reinforcement Learning
por: Feng, Xidong, et al.
Publicado: (2021)
por: Feng, Xidong, et al.
Publicado: (2021)
Toward Agents That Reason About Their Computation
por: Orenstein, Adrian, et al.
Publicado: (2025)
por: Orenstein, Adrian, et al.
Publicado: (2025)
Planning In Natural Language Improves LLM Search For Code Generation
por: Wang, Evan, et al.
Publicado: (2024)
por: Wang, Evan, et al.
Publicado: (2024)
Neural Bayesian Filtering
por: Solinas, Christopher, et al.
Publicado: (2025)
por: Solinas, Christopher, et al.
Publicado: (2025)
Randomness and Interpolation Improve Gradient Descent
por: Li, Jiawen, et al.
Publicado: (2025)
por: Li, Jiawen, et al.
Publicado: (2025)
Efficient Search for Customized Activation Functions with Gradient Descent
por: Strack, Lukas, et al.
Publicado: (2024)
por: Strack, Lukas, et al.
Publicado: (2024)
Conformal Generative Modeling with Improved Sample Efficiency through Sequential Greedy Filtering
por: Kladny, Klaus-Rudolf, et al.
Publicado: (2024)
por: Kladny, Klaus-Rudolf, et al.
Publicado: (2024)
Gradient Descent Efficiency Index
por: Dhingra, Aviral
Publicado: (2024)
por: Dhingra, Aviral
Publicado: (2024)
Scheduled Curiosity-Deep Dyna-Q: Efficient Exploration for Dialog Policy Learning
por: Niu, Xuecheng, et al.
Publicado: (2024)
por: Niu, Xuecheng, et al.
Publicado: (2024)
A Method on Searching Better Activation Functions
por: Sun, Haoyuan, et al.
Publicado: (2024)
por: Sun, Haoyuan, et al.
Publicado: (2024)
Weight-Entanglement Meets Gradient-Based Neural Architecture Search
por: Sukthanker, Rhea Sanjay, et al.
Publicado: (2023)
por: Sukthanker, Rhea Sanjay, et al.
Publicado: (2023)
Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search
por: Zhang, Yifei, et al.
Publicado: (2026)
por: Zhang, Yifei, et al.
Publicado: (2026)
Beyond Gradient Averaging in Parallel Optimization: Improved Robustness through Gradient Agreement Filtering
por: Chaubard, Francois, et al.
Publicado: (2024)
por: Chaubard, Francois, et al.
Publicado: (2024)
MANGO: Meta-Adaptive Network Gradient Optimization for Online Continual Learning
por: Awasthi, Ankita, et al.
Publicado: (2026)
por: Awasthi, Ankita, et al.
Publicado: (2026)
Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation
por: Zhang, Zhenshuo, et al.
Publicado: (2025)
por: Zhang, Zhenshuo, et al.
Publicado: (2025)
DynaTab: Dynamic Feature Ordering as Neural Rewiring for High-Dimensional Tabular Data
por: Habib, Al Zadid Sultan Bin, et al.
Publicado: (2026)
por: Habib, Al Zadid Sultan Bin, et al.
Publicado: (2026)
DynaGen: Unifying Temporal Knowledge Graph Reasoning with Dynamic Subgraphs and Generative Regularization
por: Shen, Jiawei, et al.
Publicado: (2025)
por: Shen, Jiawei, et al.
Publicado: (2025)
Improving the Computational Efficiency and Explainability of GeoAggregator
por: Deng, Rui, et al.
Publicado: (2025)
por: Deng, Rui, et al.
Publicado: (2025)
Interpreting Affine Recurrence Learning in GPT-style Transformers
por: Bhargav, Samarth, et al.
Publicado: (2024)
por: Bhargav, Samarth, et al.
Publicado: (2024)
Logit Dynamics in Softmax Policy Gradient Methods
por: Li, Yingru
Publicado: (2025)
por: Li, Yingru
Publicado: (2025)
Gradient Based Method for the Fusion of Lattice Quantizers
por: Zhang, Liyuan, et al.
Publicado: (2025)
por: Zhang, Liyuan, et al.
Publicado: (2025)
Learning General Policies with Policy Gradient Methods
por: Ståhlberg, Simon, et al.
Publicado: (2025)
por: Ståhlberg, Simon, et al.
Publicado: (2025)
Enhancing UAV Path Planning Efficiency Through Accelerated Learning
por: Viana, Joseanne, et al.
Publicado: (2025)
por: Viana, Joseanne, et al.
Publicado: (2025)
Meta-World+: An Improved, Standardized, RL Benchmark
por: McLean, Reginald, et al.
Publicado: (2025)
por: McLean, Reginald, et al.
Publicado: (2025)
Meta-Learning Transformers to Improve In-Context Generalization
por: Braccaioli, Lorenzo, et al.
Publicado: (2025)
por: Braccaioli, Lorenzo, et al.
Publicado: (2025)
Mitigating Gradient Overlap in Deep Residual Networks with Gradient Normalization for Improved Non-Convex Optimization
por: Yun, Juyoung
Publicado: (2024)
por: Yun, Juyoung
Publicado: (2024)
Ejemplares similares
-
Mitigating Value Hallucination in Dyna Planning via Multistep Predecessor Models
por: Aminmansour, Farzane, et al.
Publicado: (2020) -
On the Interplay Between Sparsity and Training in Deep Reinforcement Learning
por: Davelouis, Fatima, et al.
Publicado: (2025) -
A Method for Evaluating Hyperparameter Sensitivity in Reinforcement Learning
por: Adkins, Jacob, et al.
Publicado: (2024) -
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
por: Asri, Zakariae El, et al.
Publicado: (2024) -
Proper Laplacian Representation Learning
por: Gomez, Diego, et al.
Publicado: (2023)