Efficient Multi-Policy Evaluation for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Shuze Daniel, Chen, Claire, Zhang, Shangtong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
par: Chen, Claire, et autres
Publié: (2024)
par: Chen, Claire, et autres
Publié: (2024)
Doubly Optimal Policy Evaluation for Reinforcement Learning
par: Liu, Shuze Daniel, et autres
Publié: (2024)
par: Liu, Shuze Daniel, et autres
Publié: (2024)
Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design
par: Liu, Shuze, et autres
Publié: (2023)
par: Liu, Shuze, et autres
Publié: (2023)
Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning
par: Mahadevan, Vagul, et autres
Publié: (2026)
par: Mahadevan, Vagul, et autres
Publié: (2026)
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
par: Liu, Shuze Daniel, et autres
Publié: (2024)
par: Liu, Shuze Daniel, et autres
Publié: (2024)
Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
par: Xie, Zixuan, et autres
Publié: (2026)
par: Xie, Zixuan, et autres
Publié: (2026)
Predicting Plasticity in Deep Continual Learning: A Theoretical Perspective
par: Wang, Jiuqi, et autres
Publié: (2026)
par: Wang, Jiuqi, et autres
Publié: (2026)
Towards Formalizing Reinforcement Learning Theory
par: Zhang, Shangtong
Publié: (2025)
par: Zhang, Shangtong
Publié: (2025)
MathlibLemma: Folklore Lemma Generation and Benchmark for Formal Mathematics
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
Group Fairness in Multi-Task Reinforcement Learning
par: Song, Kefan, et autres
Publié: (2025)
par: Song, Kefan, et autres
Publié: (2025)
Extensions of Robbins-Siegmund Theorem with Applications in Reinforcement Learning
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Towards Provable Emergence of In-Context Reinforcement Learning
par: Wang, Jiuqi, et autres
Publié: (2025)
par: Wang, Jiuqi, et autres
Publié: (2025)
Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought
par: Xie, Zixuan, et autres
Publié: (2026)
par: Xie, Zixuan, et autres
Publié: (2026)
Multi-agent Markov Entanglement
par: Chen, Shuze, et autres
Publié: (2025)
par: Chen, Shuze, et autres
Publié: (2025)
Counterfactual Explanations for Continuous Action Reinforcement Learning
par: Dong, Shuyang, et autres
Publié: (2025)
par: Dong, Shuyang, et autres
Publié: (2025)
Almost Sure Convergence Rates of Stochastic Approximation and Reinforcement Learning via a Poisson-Moreau Drift
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
CRASH: Challenging Reinforcement-Learning Based Adversarial Scenarios For Safety Hardening
par: Kulkarni, Amar, et autres
Publié: (2024)
par: Kulkarni, Amar, et autres
Publié: (2024)
Transformers Can Learn Temporal Difference Methods for In-Context Reinforcement Learning
par: Wang, Jiuqi, et autres
Publié: (2024)
par: Wang, Jiuqi, et autres
Publié: (2024)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
par: Bozkurt, Alper Kamil, et autres
Publié: (2026)
par: Bozkurt, Alper Kamil, et autres
Publié: (2026)
Almost Sure Convergence Rates and Concentration of Stochastic Approximation and Reinforcement Learning with Markovian Noise
par: Qian, Xiaochi, et autres
Publié: (2024)
par: Qian, Xiaochi, et autres
Publié: (2024)
Revisiting a Design Choice in Gradient Temporal Difference Learning
par: Qian, Xiaochi, et autres
Publié: (2023)
par: Qian, Xiaochi, et autres
Publié: (2023)
On the Divergence of Differential Temporal Difference Learning without Local Clocks
par: Antrobius, David, et autres
Publié: (2026)
par: Antrobius, David, et autres
Publié: (2026)
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch
par: Zhang, Shangtong, et autres
Publié: (2021)
par: Zhang, Shangtong, et autres
Publié: (2021)
Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning
par: Liu, Weidong, et autres
Publié: (2023)
par: Liu, Weidong, et autres
Publié: (2023)
Almost Sure Convergence of Linear Temporal Difference Learning with Arbitrary Features
par: Wang, Jiuqi, et autres
Publié: (2024)
par: Wang, Jiuqi, et autres
Publié: (2024)
Offline Two-Player Zero-Sum Markov Games with KL Regularization
par: Chen, Claire, et autres
Publié: (2026)
par: Chen, Claire, et autres
Publié: (2026)
A Survey of In-Context Reinforcement Learning
par: Moeini, Amir, et autres
Publié: (2025)
par: Moeini, Amir, et autres
Publié: (2025)
Safe In-Context Reinforcement Learning
par: Moeini, Amir, et autres
Publié: (2025)
par: Moeini, Amir, et autres
Publié: (2025)
Linear $Q$-Learning Does Not Diverge in $L^2$: Convergence Rates to a Bounded Set
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
Efficient Online Reinforcement Learning for Diffusion Policy
par: Ma, Haitong, et autres
Publié: (2025)
par: Ma, Haitong, et autres
Publié: (2025)
Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning
par: Qiu, Shuang, et autres
Publié: (2024)
par: Qiu, Shuang, et autres
Publié: (2024)
Finite Sample Analysis of Linear Temporal Difference Learning with Arbitrary Features
par: Xie, Zixuan, et autres
Publié: (2025)
par: Xie, Zixuan, et autres
Publié: (2025)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
par: Blaser, Ethan, et autres
Publié: (2026)
par: Blaser, Ethan, et autres
Publié: (2026)
Sample-Efficient Policy Constraint Offline Deep Reinforcement Learning based on Sample Filtering
par: Chen, Yuanhao, et autres
Publié: (2025)
par: Chen, Yuanhao, et autres
Publié: (2025)
Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance
par: He, Jinmin, et autres
Publié: (2025)
par: He, Jinmin, et autres
Publié: (2025)
Asymptotic and Finite Sample Analysis of Nonexpansive Stochastic Approximations with Markovian Noise
par: Blaser, Ethan, et autres
Publié: (2024)
par: Blaser, Ethan, et autres
Publié: (2024)
Experience Replay Addresses Loss of Plasticity in Continual Learning
par: Wang, Jiuqi, et autres
Publié: (2025)
par: Wang, Jiuqi, et autres
Publié: (2025)
Mildly Constrained Evaluation Policy for Offline Reinforcement Learning
par: Xu, Linjie, et autres
Publié: (2023)
par: Xu, Linjie, et autres
Publié: (2023)
Distorted Distributional Policy Evaluation for Offline Reinforcement Learning
par: Iwaki, Ryo, et autres
Publié: (2026)
par: Iwaki, Ryo, et autres
Publié: (2026)
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
par: Zheng, Xiang, et autres
Publié: (2023)
par: Zheng, Xiang, et autres
Publié: (2023)
Documents similaires
-
Efficient Policy Evaluation with Safety Constraint for Reinforcement Learning
par: Chen, Claire, et autres
Publié: (2024) -
Doubly Optimal Policy Evaluation for Reinforcement Learning
par: Liu, Shuze Daniel, et autres
Publié: (2024) -
Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design
par: Liu, Shuze, et autres
Publié: (2023) -
Convergence of Two-Timescale Markovian Stochastic Approximations with Applications in Reinforcement Learning
par: Mahadevan, Vagul, et autres
Publié: (2026) -
The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise
par: Liu, Shuze Daniel, et autres
Publié: (2024)