Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ni, Tianwei, Derman, Esther, Jain, Vineet, Taboga, Vincent, Ravanbakhsh, Siamak, Bacon, Pierre-Luc |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning to Reach Goals via Diffusion
par: Jain, Vineet, et autres
Publié: (2023)
par: Jain, Vineet, et autres
Publié: (2023)
Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity
par: Muni, Aneri, et autres
Publié: (2026)
par: Muni, Aneri, et autres
Publié: (2026)
The Three Regimes of Offline-to-Online Reinforcement Learning
par: Li, Lu, et autres
Publié: (2025)
par: Li, Lu, et autres
Publié: (2025)
Sampling from Energy-based Policies using Diffusion
par: Jain, Vineet, et autres
Publié: (2024)
par: Jain, Vineet, et autres
Publié: (2024)
On Diffusion Modeling for Anomaly Detection
par: Livernoche, Victor, et autres
Publié: (2023)
par: Livernoche, Victor, et autres
Publié: (2023)
Discovery of Sustainable Refrigerants through Physics-Informed RL Fine-Tuning of Sequence Models
par: Goldszal, Adrien, et autres
Publié: (2025)
par: Goldszal, Adrien, et autres
Publié: (2025)
State Entropy Regularization for Robust Reinforcement Learning
par: Ashlag, Yonatan, et autres
Publié: (2025)
par: Ashlag, Yonatan, et autres
Publié: (2025)
Diffusion Tree Sampling: Scalable inference-time alignment of diffusion models
par: Jain, Vineet, et autres
Publié: (2025)
par: Jain, Vineet, et autres
Publié: (2025)
Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments
par: Luo, Ziyan, et autres
Publié: (2025)
par: Luo, Ziyan, et autres
Publié: (2025)
Discrete Compositional Generation via General Soft Operators and Robust Reinforcement Learning
par: Jiralerspong, Marco, et autres
Publié: (2025)
par: Jiralerspong, Marco, et autres
Publié: (2025)
Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning
par: Cho, Minjae, et autres
Publié: (2024)
par: Cho, Minjae, et autres
Publié: (2024)
Multi-Armed Sampling Problem and the End of Exploration
par: Pedramfar, Mohammad, et autres
Publié: (2025)
par: Pedramfar, Mohammad, et autres
Publié: (2025)
Compositional Conservatism: A Transductive Approach in Offline Reinforcement Learning
par: Song, Yeda, et autres
Publié: (2024)
par: Song, Yeda, et autres
Publié: (2024)
Symmetry Breaking and Equivariant Neural Networks
par: Kaba, Sékou-Oumar, et autres
Publié: (2023)
par: Kaba, Sékou-Oumar, et autres
Publié: (2023)
Scaling Laws and Symmetry, Evidence from Neural Force Fields
par: Ngo, Khang, et autres
Publié: (2025)
par: Ngo, Khang, et autres
Publié: (2025)
Do Transformer World Models Give Better Policy Gradients?
par: Ma, Michel, et autres
Publié: (2024)
par: Ma, Michel, et autres
Publié: (2024)
A Distributed ADMM-based Deep Learning Approach for Thermal Control in Multi-Zone Buildings under Demand Response Events
par: Taboga, Vincent, et autres
Publié: (2023)
par: Taboga, Vincent, et autres
Publié: (2023)
Offline Reinforcement Learning with Universal Horizon Models
par: Chung, Hojun, et autres
Publié: (2026)
par: Chung, Hojun, et autres
Publié: (2026)
Beyond Scalar Rewards: An Axiomatic Framework for Lexicographic MDPs
par: Shakerinava, Mehran, et autres
Publié: (2025)
par: Shakerinava, Mehran, et autres
Publié: (2025)
On the Identifiability of Causal Abstractions
par: Li, Xiusi, et autres
Publié: (2025)
par: Li, Xiusi, et autres
Publié: (2025)
Rotation-Preserving Supervised Fine-Tuning
par: Jin, Hangzhan, et autres
Publié: (2026)
par: Jin, Hangzhan, et autres
Publié: (2026)
DyDiff: Long-Horizon Rollout via Dynamics Diffusion for Offline Reinforcement Learning
par: Zhao, Hanye, et autres
Publié: (2024)
par: Zhao, Hanye, et autres
Publié: (2024)
The Expressive Limits of Diagonal SSMs for State-Tracking
par: Shakerinava, Mehran, et autres
Publié: (2026)
par: Shakerinava, Mehran, et autres
Publié: (2026)
In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior
par: Berkes, Anaïs, et autres
Publié: (2026)
par: Berkes, Anaïs, et autres
Publié: (2026)
Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens
par: Clinton, Joseph, et autres
Publié: (2024)
par: Clinton, Joseph, et autres
Publié: (2024)
Horizon Reduction as Information Loss in Offline Reinforcement Learning
par: Nidadala, Uday Kumar, et autres
Publié: (2025)
par: Nidadala, Uday Kumar, et autres
Publié: (2025)
Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning
par: Ke, Kaiqiang, et autres
Publié: (2026)
par: Ke, Kaiqiang, et autres
Publié: (2026)
Bridging State and History Representations: Understanding Self-Predictive RL
par: Ni, Tianwei, et autres
Publié: (2024)
par: Ni, Tianwei, et autres
Publié: (2024)
What Makes Value Learning Efficient in Residual Reinforcement Learning?
par: Ma, Guozheng, et autres
Publié: (2026)
par: Ma, Guozheng, et autres
Publié: (2026)
Weight-Sharing Regularization
par: Shakerinava, Mehran, et autres
Publié: (2023)
par: Shakerinava, Mehran, et autres
Publié: (2023)
Heterogeneous RBCs via Deep Multi-Agent Reinforcement Learning
par: Gabriele, Federico, et autres
Publié: (2025)
par: Gabriele, Federico, et autres
Publié: (2025)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
par: Zhang, Jing, et autres
Publié: (2023)
par: Zhang, Jing, et autres
Publié: (2023)
Offline Learning and Forgetting for Reasoning with Large Language Models
par: Ni, Tianwei, et autres
Publié: (2025)
par: Ni, Tianwei, et autres
Publié: (2025)
Symmetry-Aware Generative Modeling through Learned Canonicalization
par: Sareen, Kusha, et autres
Publié: (2025)
par: Sareen, Kusha, et autres
Publié: (2025)
Robust Bandwidth Estimation for Real-Time Communication with Offline Reinforcement Learning
par: Kai, Jian, et autres
Publié: (2025)
par: Kai, Jian, et autres
Publié: (2025)
Network Sparsity Unlocks the Scaling Potential of Deep Reinforcement Learning
par: Ma, Guozheng, et autres
Publié: (2025)
par: Ma, Guozheng, et autres
Publié: (2025)
Decoupling regularization from the action space
par: Mohammadpour, Sobhan, et autres
Publié: (2024)
par: Mohammadpour, Sobhan, et autres
Publié: (2024)
Efficient Dynamics Modeling in Interactive Environments with Koopman Theory
par: Mondal, Arnab Kumar, et autres
Publié: (2023)
par: Mondal, Arnab Kumar, et autres
Publié: (2023)
Energy Loss Functions for Physical Systems
par: Kaba, Sékou-Oumar, et autres
Publié: (2025)
par: Kaba, Sékou-Oumar, et autres
Publié: (2025)
Stable Gradients for Stable Learning at Scale in Deep Reinforcement Learning
par: Castanyer, Roger Creus, et autres
Publié: (2025)
par: Castanyer, Roger Creus, et autres
Publié: (2025)
Documents similaires
-
Learning to Reach Goals via Diffusion
par: Jain, Vineet, et autres
Publié: (2023) -
Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity
par: Muni, Aneri, et autres
Publié: (2026) -
The Three Regimes of Offline-to-Online Reinforcement Learning
par: Li, Lu, et autres
Publié: (2025) -
Sampling from Energy-based Policies using Diffusion
par: Jain, Vineet, et autres
Publié: (2024) -
On Diffusion Modeling for Anomaly Detection
par: Livernoche, Victor, et autres
Publié: (2023)