Relative Trajectory Balance is equivalent to Trust-PCL
Fuente:
arXiv
Salvato in:
| Autori principali: | Deleu, Tristan, Nouri, Padideh, Bengio, Yoshua, Precup, Doina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Discrete Probabilistic Inference as Control in Multi-path Environments
di: Deleu, Tristan, et al.
Pubblicazione: (2024)
di: Deleu, Tristan, et al.
Pubblicazione: (2024)
Bayesian learning of Causal Structure and Mechanisms with GFlowNets and Variational Bayes
di: Nishikawa-Toomey, Mizu, et al.
Pubblicazione: (2022)
di: Nishikawa-Toomey, Mizu, et al.
Pubblicazione: (2022)
GFlowNet Foundations
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
di: Bengio, Yoshua, et al.
Pubblicazione: (2021)
Consciousness-Inspired Spatio-Temporal Abstractions for Better Generalization in Reinforcement Learning
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
di: Zhao, Mingde, et al.
Pubblicazione: (2023)
Generative Flow Networks: Theory and Applications to Structure Learning
di: Deleu, Tristan
Pubblicazione: (2025)
di: Deleu, Tristan
Pubblicazione: (2025)
Balancing Plasticity and Stability with Fast and Slow Successor Features
di: Chua, Raymond, et al.
Pubblicazione: (2026)
di: Chua, Raymond, et al.
Pubblicazione: (2026)
QGFN: Controllable Greediness with Action Values
di: Lau, Elaine, et al.
Pubblicazione: (2024)
di: Lau, Elaine, et al.
Pubblicazione: (2024)
Conditions on Preference Relations that Guarantee the Existence of Optimal Policies
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2023)
Rejecting Hallucinated State Targets during Planning
di: Zhao, Mingde, et al.
Pubblicazione: (2024)
di: Zhao, Mingde, et al.
Pubblicazione: (2024)
Diversity-Enriched Option-Critic
di: Kamat, Anand, et al.
Pubblicazione: (2020)
di: Kamat, Anand, et al.
Pubblicazione: (2020)
Functional Acceleration for Policy Mirror Descent
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
di: Chelu, Veronica, et al.
Pubblicazione: (2024)
A Look at Value-Based Decision-Time vs. Background Planning Methods Across Different Settings
di: Alver, Safa, et al.
Pubblicazione: (2022)
di: Alver, Safa, et al.
Pubblicazione: (2022)
Baking Symmetry into GFlowNets
di: Ma, George, et al.
Pubblicazione: (2024)
di: Ma, George, et al.
Pubblicazione: (2024)
On the Privacy of Selection Mechanisms with Gaussian Noise
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
di: Lebensold, Jonathan, et al.
Pubblicazione: (2024)
Sparse-Reg: Improving Sample Complexity in Offline Reinforcement Learning using Sparsity
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
di: Arnob, Samin Yeasar, et al.
Pubblicazione: (2025)
Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
di: Bartoldson, Brian, et al.
Pubblicazione: (2025)
di: Bartoldson, Brian, et al.
Pubblicazione: (2025)
Adaptive Exploration for Data-Efficient General Value Function Evaluations
di: Jain, Arushi, et al.
Pubblicazione: (2024)
di: Jain, Arushi, et al.
Pubblicazione: (2024)
Partial Models for Building Adaptive Model-Based Reinforcement Learning Agents
di: Alver, Safa, et al.
Pubblicazione: (2024)
di: Alver, Safa, et al.
Pubblicazione: (2024)
Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2026)
di: Jiralerspong, Thomas, et al.
Pubblicazione: (2026)
Fluid-Agent Reinforcement Learning
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
di: Sharma, Shishir, et al.
Pubblicazione: (2026)
Langevin Soft Actor-Critic: Efficient Exploration through Uncertainty-Driven Critic Learning
di: Ishfaq, Haque, et al.
Pubblicazione: (2025)
di: Ishfaq, Haque, et al.
Pubblicazione: (2025)
Parseval Regularization for Continual Reinforcement Learning
di: Chung, Wesley, et al.
Pubblicazione: (2024)
di: Chung, Wesley, et al.
Pubblicazione: (2024)
On Generalization for Generative Flow Networks
di: Krichel, Anas, et al.
Pubblicazione: (2024)
di: Krichel, Anas, et al.
Pubblicazione: (2024)
Interventional Causal Representation Learning
di: Ahuja, Kartik, et al.
Pubblicazione: (2022)
di: Ahuja, Kartik, et al.
Pubblicazione: (2022)
Incorporating Spatial Information into Goal-Conditioned Hierarchical Reinforcement Learning via Graph Representations
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shuyuan, et al.
Pubblicazione: (2025)
Trajectory Flow Matching with Applications to Clinical Time Series Modeling
di: Zhang, Xi, et al.
Pubblicazione: (2024)
di: Zhang, Xi, et al.
Pubblicazione: (2024)
RL, but don't do anything I wouldn't do
di: Cohen, Michael K., et al.
Pubblicazione: (2024)
di: Cohen, Michael K., et al.
Pubblicazione: (2024)
Local Search GFlowNets
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
In-Context Parametric Inference: Point or Distribution Estimators?
di: Mittal, Sarthak, et al.
Pubblicazione: (2025)
di: Mittal, Sarthak, et al.
Pubblicazione: (2025)
Learning Successor Features the Simple Way
di: Chua, Raymond, et al.
Pubblicazione: (2024)
di: Chua, Raymond, et al.
Pubblicazione: (2024)
Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
di: Carr, Jonathan Colaço, et al.
Pubblicazione: (2026)
Finite time analysis of temporal difference learning with linear function approximation: Tail averaging and regularisation
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
di: Patil, Gandharv, et al.
Pubblicazione: (2022)
A Complexity-Based Theory of Compositionality
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
di: Elmoznino, Eric, et al.
Pubblicazione: (2024)
Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
di: Luo, Ziyan, et al.
Pubblicazione: (2025)
Fairness in Reinforcement Learning with Bisimulation Metrics
di: Rezaei-Shoshtari, Sahand, et al.
Pubblicazione: (2024)
di: Rezaei-Shoshtari, Sahand, et al.
Pubblicazione: (2024)
Policy Gradient Methods in the Presence of Symmetries and State Abstractions
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
di: Panangaden, Prakash, et al.
Pubblicazione: (2023)
Capacity-Constrained Continual Learning
di: Wen, Zheng, et al.
Pubblicazione: (2025)
di: Wen, Zheng, et al.
Pubblicazione: (2025)
Tree Cross Attention
di: Feng, Leo, et al.
Pubblicazione: (2023)
di: Feng, Leo, et al.
Pubblicazione: (2023)
Code as Reward: Empowering Reinforcement Learning with VLMs
di: Venuto, David, et al.
Pubblicazione: (2024)
di: Venuto, David, et al.
Pubblicazione: (2024)
Monte Carlo Tree Diffusion for System 2 Planning
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
di: Yoon, Jaesik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Discrete Probabilistic Inference as Control in Multi-path Environments
di: Deleu, Tristan, et al.
Pubblicazione: (2024) -
Bayesian learning of Causal Structure and Mechanisms with GFlowNets and Variational Bayes
di: Nishikawa-Toomey, Mizu, et al.
Pubblicazione: (2022) -
GFlowNet Foundations
di: Bengio, Yoshua, et al.
Pubblicazione: (2021) -
Consciousness-Inspired Spatio-Temporal Abstractions for Better Generalization in Reinforcement Learning
di: Zhao, Mingde, et al.
Pubblicazione: (2023) -
Generative Flow Networks: Theory and Applications to Structure Learning
di: Deleu, Tristan
Pubblicazione: (2025)