Distributional Off-policy Evaluation with Bellman Residual Minimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Hong, Sungee, Qi, Zhengling, Wong, Raymond K. W. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Principled Path to Fitted Distributional Evaluation
di: Hong, Sungee, et al.
Pubblicazione: (2025)
di: Hong, Sungee, et al.
Pubblicazione: (2025)
Off-policy Evaluation in Doubly Inhomogeneous Environments
di: Bian, Zeyu, et al.
Pubblicazione: (2023)
di: Bian, Zeyu, et al.
Pubblicazione: (2023)
Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
di: Yu, Shuguang, et al.
Pubblicazione: (2024)
di: Yu, Shuguang, et al.
Pubblicazione: (2024)
Bellman Residual Minimization for Control: Geometry, Stationarity, and Convergence
di: Lee, Donghwan, et al.
Pubblicazione: (2026)
di: Lee, Donghwan, et al.
Pubblicazione: (2026)
Stability and Generalization for Bellman Residuals
di: Kang, Enoch H., et al.
Pubblicazione: (2025)
di: Kang, Enoch H., et al.
Pubblicazione: (2025)
A Generalized Projected Bellman Error for Off-policy Value Estimation in Reinforcement Learning
di: Patterson, Andrew, et al.
Pubblicazione: (2021)
di: Patterson, Andrew, et al.
Pubblicazione: (2021)
Contraction-Aligned Analysis of Soft Bellman Residual Minimization with Weighted Lp-Norm for Markov Decision Problem
di: Yang, Hyukjun, et al.
Pubblicazione: (2026)
di: Yang, Hyukjun, et al.
Pubblicazione: (2026)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
A Tale of Two Cities: Pessimism and Opportunism in Offline Dynamic Pricing
di: Bian, Zeyu, et al.
Pubblicazione: (2024)
di: Bian, Zeyu, et al.
Pubblicazione: (2024)
InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
STEEL: Singularity-aware Reinforcement Learning
di: Chen, Xiaohong, et al.
Pubblicazione: (2023)
di: Chen, Xiaohong, et al.
Pubblicazione: (2023)
Distributional Bellman Operators over Mean Embeddings
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2023)
di: Wenliang, Li Kevin, et al.
Pubblicazione: (2023)
Beyond Demand Estimation: Consumer Surplus Evaluation via Cumulative Propensity Weights
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
Off-policy Evaluation for Payments at Adyen
di: Egg, Alex
Pubblicazione: (2025)
di: Egg, Alex
Pubblicazione: (2025)
Distributional Off-Policy Evaluation with Deep Quantile Process Regression
di: Kuang, Qi, et al.
Pubblicazione: (2026)
di: Kuang, Qi, et al.
Pubblicazione: (2026)
Off-policy Distributional Q($λ$): Distributional RL without Importance Sampling
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
di: Tang, Yunhao, et al.
Pubblicazione: (2024)
Double Fairness Policy Learning: Integrating Action Fairness and Outcome Fairness in Decision-making
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
di: Bian, Zeyu, et al.
Pubblicazione: (2026)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
A Spectral Revisit of the Distributional Bellman Operator under the Cramér Metric
di: Wang, Keru, et al.
Pubblicazione: (2026)
di: Wang, Keru, et al.
Pubblicazione: (2026)
SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation
di: Lee, Jongmin, et al.
Pubblicazione: (2025)
di: Lee, Jongmin, et al.
Pubblicazione: (2025)
Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space
di: Li, Yangming, et al.
Pubblicazione: (2024)
di: Li, Yangming, et al.
Pubblicazione: (2024)
Nonparametric Bellman Mappings for Value Iteration in Distributed Reinforcement Learning
di: Akiyama, Yuki, et al.
Pubblicazione: (2025)
di: Akiyama, Yuki, et al.
Pubblicazione: (2025)
Offline Dynamic Inventory and Pricing Strategy: Addressing Censored and Dependent Demand
di: Gundem, Korel, et al.
Pubblicazione: (2025)
di: Gundem, Korel, et al.
Pubblicazione: (2025)
Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting
di: van der Laan, Lars, et al.
Pubblicazione: (2025)
di: van der Laan, Lars, et al.
Pubblicazione: (2025)
Bellman Diffusion Models
di: Schramm, Liam, et al.
Pubblicazione: (2024)
di: Schramm, Liam, et al.
Pubblicazione: (2024)
Quantile-Optimal Policy Learning under Unmeasured Confounding
di: Chen, Zhongren, et al.
Pubblicazione: (2025)
di: Chen, Zhongren, et al.
Pubblicazione: (2025)
Primal-Dual Spectral Representation for Off-policy Evaluation
di: Hu, Yang, et al.
Pubblicazione: (2024)
di: Hu, Yang, et al.
Pubblicazione: (2024)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Low Variance Off-policy Evaluation with State-based Importance Sampling
di: Bossens, David M., et al.
Pubblicazione: (2022)
di: Bossens, David M., et al.
Pubblicazione: (2022)
Model Selection for Off-policy Evaluation: New Algorithms and Experimental Protocol
di: Liu, Pai, et al.
Pubblicazione: (2025)
di: Liu, Pai, et al.
Pubblicazione: (2025)
On Bellman equations for continuous-time policy evaluation I: discretization and approximation
di: Mou, Wenlong, et al.
Pubblicazione: (2024)
di: Mou, Wenlong, et al.
Pubblicazione: (2024)
Transductive Off-policy Proximal Policy Optimization
di: Gan, Yaozhong, et al.
Pubblicazione: (2024)
di: Gan, Yaozhong, et al.
Pubblicazione: (2024)
Bellman Error Centering
di: Chen, Xingguo, et al.
Pubblicazione: (2025)
di: Chen, Xingguo, et al.
Pubblicazione: (2025)
Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics
di: Chen, Ming-Hong, et al.
Pubblicazione: (2026)
di: Chen, Ming-Hong, et al.
Pubblicazione: (2026)
Path-Coupled Bellman Flows for Distributional Reinforcement Learning
di: Xu, Boyang, et al.
Pubblicazione: (2026)
di: Xu, Boyang, et al.
Pubblicazione: (2026)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
di: Zhu, Jin, et al.
Pubblicazione: (2023)
di: Zhu, Jin, et al.
Pubblicazione: (2023)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
di: Dai, Runpeng, et al.
Pubblicazione: (2024)
di: Dai, Runpeng, et al.
Pubblicazione: (2024)
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
di: Zhang, Yuheng, et al.
Pubblicazione: (2024)
Residual Off-Policy RL for Finetuning Behavior Cloning Policies
di: Ankile, Lars, et al.
Pubblicazione: (2025)
di: Ankile, Lars, et al.
Pubblicazione: (2025)
Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning
di: Kaya, Ege C., et al.
Pubblicazione: (2026)
di: Kaya, Ege C., et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Principled Path to Fitted Distributional Evaluation
di: Hong, Sungee, et al.
Pubblicazione: (2025) -
Off-policy Evaluation in Doubly Inhomogeneous Environments
di: Bian, Zeyu, et al.
Pubblicazione: (2023) -
Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
di: Yu, Shuguang, et al.
Pubblicazione: (2024) -
Bellman Residual Minimization for Control: Geometry, Stationarity, and Convergence
di: Lee, Donghwan, et al.
Pubblicazione: (2026) -
Stability and Generalization for Bellman Residuals
di: Kang, Enoch H., et al.
Pubblicazione: (2025)