Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuheng, Jiang, Nan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
A Unifying View of Coverage in Linear Off-Policy Evaluation
par: Amortila, Philip, et autres
Publié: (2026)
par: Amortila, Philip, et autres
Publié: (2026)
Model Selection for Off-policy Evaluation: New Algorithms and Experimental Protocol
par: Liu, Pai, et autres
Publié: (2025)
par: Liu, Pai, et autres
Publié: (2025)
Scalable Policy-Based RL Algorithms for POMDPs
par: Anjarlekar, Ameya, et autres
Publié: (2025)
par: Anjarlekar, Ameya, et autres
Publié: (2025)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Sequential Monte Carlo for Policy Optimization in Continuous POMDPs
par: Abdulsamad, Hany, et autres
Publié: (2025)
par: Abdulsamad, Hany, et autres
Publié: (2025)
Robust Finite-Memory Policy Gradients for Hidden-Model POMDPs
par: Galesloot, Maris F. L., et autres
Publié: (2025)
par: Galesloot, Maris F. L., et autres
Publié: (2025)
Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning
par: Lanier, Michael, et autres
Publié: (2024)
par: Lanier, Michael, et autres
Publié: (2024)
Clustering Context in Off-Policy Evaluation
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
Concept-driven Off Policy Evaluation
par: Majumdar, Ritam, et autres
Publié: (2024)
par: Majumdar, Ritam, et autres
Publié: (2024)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Rethinking Transformers in Solving POMDPs
par: Lu, Chenhao, et autres
Publié: (2024)
par: Lu, Chenhao, et autres
Publié: (2024)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm
par: Wang, Hanyong, et autres
Publié: (2026)
par: Wang, Hanyong, et autres
Publié: (2026)
Online Planning in POMDPs with State-Requests
par: Avalos, Raphael, et autres
Publié: (2024)
par: Avalos, Raphael, et autres
Publié: (2024)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
par: Lee, Haanvid, et autres
Publié: (2024)
par: Lee, Haanvid, et autres
Publié: (2024)
Low Variance Off-policy Evaluation with State-based Importance Sampling
par: Bossens, David M., et autres
Publié: (2022)
par: Bossens, David M., et autres
Publié: (2022)
Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
par: Jiang, Jie, et autres
Publié: (2026)
par: Jiang, Jie, et autres
Publié: (2026)
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
par: Wang, Yibo, et autres
Publié: (2024)
par: Wang, Yibo, et autres
Publié: (2024)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
par: Aouali, Imad, et autres
Publié: (2024)
par: Aouali, Imad, et autres
Publié: (2024)
Restructuring Tractable Probabilistic Circuits
par: Zhang, Honghua, et autres
Publié: (2024)
par: Zhang, Honghua, et autres
Publié: (2024)
Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
par: Dai, Runpeng, et autres
Publié: (2024)
par: Dai, Runpeng, et autres
Publié: (2024)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
par: Galesloot, Maris F. L., et autres
Publié: (2024)
par: Galesloot, Maris F. L., et autres
Publié: (2024)
Primal-Dual Spectral Representation for Off-policy Evaluation
par: Hu, Yang, et autres
Publié: (2024)
par: Hu, Yang, et autres
Publié: (2024)
Bootstrap Off-policy with World Model
par: Zhan, Guojian, et autres
Publié: (2025)
par: Zhan, Guojian, et autres
Publié: (2025)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
par: Romeo, Carlo, et autres
Publié: (2026)
par: Romeo, Carlo, et autres
Publié: (2026)
Balancing Immediate Revenue and Future Off-Policy Evaluation in Coupon Allocation
par: Nishimura, Naoki, et autres
Publié: (2024)
par: Nishimura, Naoki, et autres
Publié: (2024)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
par: Bennett, Andrew, et autres
Publié: (2024)
par: Bennett, Andrew, et autres
Publié: (2024)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
par: Kiyohara, Haruka, et autres
Publié: (2023)
par: Kiyohara, Haruka, et autres
Publié: (2023)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
par: Meng, Wenjia, et autres
Publié: (2024)
par: Meng, Wenjia, et autres
Publié: (2024)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
par: Lobo, Elita, et autres
Publié: (2024)
par: Lobo, Elita, et autres
Publié: (2024)
Explainable Representation of Finite-Memory Policies for POMDPs using Decision Trees
par: Azeem, Muqsit, et autres
Publié: (2024)
par: Azeem, Muqsit, et autres
Publié: (2024)
Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs
par: Wendland, Joshua, et autres
Publié: (2026)
par: Wendland, Joshua, et autres
Publié: (2026)
Value of Information and Reward Specification in Active Inference and POMDPs
par: Wei, Ran
Publié: (2024)
par: Wei, Ran
Publié: (2024)
Documents similaires
-
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
par: Zhang, Yuheng, et autres
Publié: (2024) -
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
par: Li, Xiang, et autres
Publié: (2026) -
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
par: Li, Xiang, et autres
Publié: (2026) -
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
par: Kwon, Jeongyeol, et autres
Publié: (2024) -
A Unifying View of Coverage in Linear Off-Policy Evaluation
par: Amortila, Philip, et autres
Publié: (2026)