Rejecting Hallucinated State Targets during Planning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Mingde, Sylvain, Tristan, Laroche, Romain, Precup, Doina, Bengio, Yoshua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Consciousness-Inspired Spatio-Temporal Abstractions for Better Generalization in Reinforcement Learning
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
Relative Trajectory Balance is equivalent to Trust-PCL
di: Deleu, Tristan, et al.
Pubblicazione: (2025)
di: Deleu, Tristan, et al.
Pubblicazione: (2025)
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022)
di: Alver, Safa, et al.
Pubblicazione: (2022)
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
Diversity-Enriched Option-Critic
di: Kamat, Anand, et al.
Pubblicazione: (2020)
di: Kamat, Anand, et al.
Pubblicazione: (2020)
Discrete Probabilistic Inference as Control in Multi-path Environments
di: Deleu, Tristan, et al.
Pubblicazione: (2024)
di: Deleu, Tristan, et al.
Pubblicazione: (2024)
Machine learning and information theory concepts towards an AI Mathematician
di: Bengio, Yoshua, et al.
Pubblicazione: (2024)
di: Bengio, Yoshua, et al.
Pubblicazione: (2024)
Fast Monte Carlo Tree Diffusion: 100x Speedup via Parallel Sparse Planning
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
GFlowNet Foundations
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
Policy Gradient Methods in the Presence of Symmetries and State Abstractions
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
Brain-Inspired Planning for Better Generalization in Reinforcement Learning
di: Zhao, Mingde "Harry"
Pubblicazione: (2025)
di: Zhao, Mingde "Harry"
Pubblicazione: (2025)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
Partial Models for Building Adaptive Model-Based Reinforcement Learning Agents
di: Alver, Safa, et al.
Pubblicazione: (2024)
di: Alver, Safa, et al.
Pubblicazione: (2024)
Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
Monte Carlo Tree Diffusion for System 2 Planning
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
SCAR: Shapley Credit Assignment for More Efficient RLHF
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
Fluid-Agent Reinforcement Learning
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
Parseval Regularization for Continual Reinforcement Learning
di: Chung, Wesley, et al.
Pubblicazione: (2024)
di: Chung, Wesley, et al.
Pubblicazione: (2024)
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
In-Context Parametric Inference: Point or Distribution Estimators?
di: Mittal, Sarthak, et al.
Pubblicazione: (2025)
di: Mittal, Sarthak, et al.
Pubblicazione: (2025)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
Finite time analysis of temporal difference learning with linear function approximation: Tail averaging and regularisation
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
Cracking the Code of Action: a Generative Approach to Affordances for Reinforcement Learning
di: Cherif, Lynn, et al.
Pubblicazione: (2025)
di: Cherif, Lynn, et al.
Pubblicazione: (2025)
A Complexity-Based Theory of Compositionality
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
Capacity-Constrained Continual Learning
di: Wen, Zheng, et al.
Pubblicazione: (2025)
di: Wen, Zheng, et al.
Pubblicazione: (2025)
Discovering Temporal Structure: An Overview of Hierarchical Reinforcement Learning
di: Klissarov, Martin, et al.
Pubblicazione: (2025)
di: Klissarov, Martin, et al.
Pubblicazione: (2025)
Shaping Inductive Bias in Diffusion Models through Frequency-Based Noise Control
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2025)
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2025)
In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior
di: Berkes, Anaïs, et al.
Pubblicazione: (2026)
di: Berkes, Anaïs, et al.
Pubblicazione: (2026)
Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
Language models recognize dropout and Gaussian noise applied to their activations
di: Fornasiere, Damiano, et al.
Pubblicazione: (2026)
di: Fornasiere, Damiano, et al.
Pubblicazione: (2026)
Generative Recursive Reasoning
di: Baek, Junyeob, et al.
Pubblicazione: (2026)
di: Baek, Junyeob, et al.
Pubblicazione: (2026)
Efficient Causal Graph Discovery Using Large Language Models
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2024)
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2024)
Learning Fused State Representations for Control from Multi-View Observations
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Were RNNs All We Needed?
di: Feng, Leo, et al.
Pubblicazione: (2024)
di: Feng, Leo, et al.
Pubblicazione: (2024)
FALCON: Few-step Accurate Likelihoods for Continuous Flows
di: Rehman, Danyal, et al.
Pubblicazione: (2025)
di: Rehman, Danyal, et al.
Pubblicazione: (2025)
Rotation-Preserving Supervised Fine-Tuning
di: Jin, Hangzhan, et al.
Pubblicazione: (2026)
di: Jin, Hangzhan, et al.
Pubblicazione: (2026)
Effective Protein-Protein Interaction Exploration with PPIretrieval
di: Hua, Chenqing, et al.
Pubblicazione: (2024)
di: Hua, Chenqing, et al.
Pubblicazione: (2024)
Distributional GFlowNets with Quantile Flows
di: Zhang, Dinghuai, et al.
Pubblicazione: (2023)
di: Zhang, Dinghuai, et al.
Pubblicazione: (2023)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
di: Budaghyan, David, et al.
Pubblicazione: (2023)
di: Budaghyan, David, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Consciousness-Inspired Spatio-Temporal Abstractions for Better Generalization in Reinforcement Learning
di: Zhao, Mingde, et al.
Pubblicazione: (2023) -
Relative Trajectory Balance is equivalent to Trust-PCL
di: Deleu, Tristan, et al.
Pubblicazione: (2025) -
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022) -
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024) -
Diversity-Enriched Option-Critic
di: Kamat, Anand, et al.
Pubblicazione: (2020)