Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Nan, Xie, Tengyang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits
von: Chen, Fan, et al.
Veröffentlicht: (2025)
von: Chen, Fan, et al.
Veröffentlicht: (2025)
Reinforce LLM Reasoning through Multi-Agent Reflection
von: Yuan, Yurun, et al.
Veröffentlicht: (2025)
von: Yuan, Yurun, et al.
Veröffentlicht: (2025)
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
von: Yuan, Yurun, et al.
Veröffentlicht: (2026)
von: Yuan, Yurun, et al.
Veröffentlicht: (2026)
Variational OOD State Correction for Offline Reinforcement Learning
von: Jiang, Ke, et al.
Veröffentlicht: (2025)
von: Jiang, Ke, et al.
Veröffentlicht: (2025)
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
von: Ji, Xiang, et al.
Veröffentlicht: (2024)
Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling
von: He, Shenghong
Veröffentlicht: (2025)
von: He, Shenghong
Veröffentlicht: (2025)
State-Constrained Offline Reinforcement Learning
von: Hepburn, Charles A., et al.
Veröffentlicht: (2024)
von: Hepburn, Charles A., et al.
Veröffentlicht: (2024)
Sample Efficient Active Algorithms for Offline Reinforcement Learning
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification
von: Qiao, Nan, et al.
Veröffentlicht: (2026)
von: Qiao, Nan, et al.
Veröffentlicht: (2026)
The Generalization Gap in Offline Reinforcement Learning
von: Mediratta, Ishita, et al.
Veröffentlicht: (2023)
von: Mediratta, Ishita, et al.
Veröffentlicht: (2023)
FOVA: Offline Federated Reinforcement Learning with Mixed-Quality Data
von: Qiao, Nan, et al.
Veröffentlicht: (2025)
von: Qiao, Nan, et al.
Veröffentlicht: (2025)
In-Context Compositional Q-Learning for Offline Reinforcement Learning
von: Xu, Qiushui, et al.
Veröffentlicht: (2025)
von: Xu, Qiushui, et al.
Veröffentlicht: (2025)
Offline Reinforcement Learning with Imbalanced Datasets
von: Jiang, Li, et al.
Veröffentlicht: (2023)
von: Jiang, Li, et al.
Veröffentlicht: (2023)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
von: Li, Xiang, et al.
Veröffentlicht: (2026)
von: Li, Xiang, et al.
Veröffentlicht: (2026)
Offline Inverse Constrained Reinforcement Learning for Safe-Critical Decision Making in Healthcare
von: Fang, Nan, et al.
Veröffentlicht: (2024)
von: Fang, Nan, et al.
Veröffentlicht: (2024)
Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective
von: Jia, Zeyu, et al.
Veröffentlicht: (2025)
von: Jia, Zeyu, et al.
Veröffentlicht: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Doubly Mild Generalization for Offline Reinforcement Learning
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
SAMG: Offline-to-Online Reinforcement Learning via State-Action-Conditional Offline Model Guidance
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
von: Zhang, Liyu, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
von: Jia, Zeyu, et al.
Veröffentlicht: (2024)
von: Jia, Zeyu, et al.
Veröffentlicht: (2024)
Towards Principled Representation Learning from Videos for Reinforcement Learning
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
von: Misra, Dipendra, et al.
Veröffentlicht: (2024)
Offline Regularised Reinforcement Learning for Large Language Models Alignment
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
von: Richemond, Pierre Harvey, et al.
Veröffentlicht: (2024)
Diverse Transformer Decoding for Offline Reinforcement Learning Using Financial Algorithmic Approaches
von: Elbaz, Dan, et al.
Veröffentlicht: (2025)
von: Elbaz, Dan, et al.
Veröffentlicht: (2025)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
Minimax Optimal and Computationally Efficient Algorithms for Distributionally Robust Offline Reinforcement Learning
von: Liu, Zhishuai, et al.
Veröffentlicht: (2024)
von: Liu, Zhishuai, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with OOD State Correction and OOD Action Suppression
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
von: Mao, Yixiu, et al.
Veröffentlicht: (2024)
Decoupled Guidance Diffusion for Adaptive Offline Safe Reinforcement Learning
von: Chen, Rufeng, et al.
Veröffentlicht: (2026)
von: Chen, Rufeng, et al.
Veröffentlicht: (2026)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
von: Pang, Jing-Cheng, et al.
Veröffentlicht: (2024)
Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2023)
von: Ramesh, Shyam Sundhar, et al.
Veröffentlicht: (2023)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration
von: Zhang, Ziqi, et al.
Veröffentlicht: (2023)
von: Zhang, Ziqi, et al.
Veröffentlicht: (2023)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Simple Ingredients for Offline Reinforcement Learning
von: Cetin, Edoardo, et al.
Veröffentlicht: (2024)
von: Cetin, Edoardo, et al.
Veröffentlicht: (2024)
Dataset Distillation for Offline Reinforcement Learning
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with Imputed Rewards
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
Offline Actor-Critic Reinforcement Learning Scales to Large Models
von: Springenberg, Jost Tobias, et al.
Veröffentlicht: (2024)
von: Springenberg, Jost Tobias, et al.
Veröffentlicht: (2024)
A Note on Loss Functions and Error Compounding in Model-based Reinforcement Learning
von: Jiang, Nan
Veröffentlicht: (2024)
von: Jiang, Nan
Veröffentlicht: (2024)
POLCA: Stochastic Generative Optimization with LLM
von: Ren, Xuanfei, et al.
Veröffentlicht: (2026)
von: Ren, Xuanfei, et al.
Veröffentlicht: (2026)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits
von: Chen, Fan, et al.
Veröffentlicht: (2025) -
Reinforce LLM Reasoning through Multi-Agent Reflection
von: Yuan, Yurun, et al.
Veröffentlicht: (2025) -
Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States
von: Yuan, Yurun, et al.
Veröffentlicht: (2026) -
Variational OOD State Correction for Offline Reinforcement Learning
von: Jiang, Ke, et al.
Veröffentlicht: (2025) -
Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
von: Ji, Xiang, et al.
Veröffentlicht: (2024)