Two-way Deconfounder for Off-policy Evaluation in Causal Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Shuguang, Fang, Shuxing, Peng, Ruixin, Qi, Zhengling, Zhou, Fan, Shi, Chengchun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Off-policy Evaluation in Doubly Inhomogeneous Environments
by: Bian, Zeyu, et al.
Published: (2023)
by: Bian, Zeyu, et al.
Published: (2023)
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
by: Dai, Runpeng, et al.
Published: (2024)
by: Dai, Runpeng, et al.
Published: (2024)
Distributional Off-policy Evaluation with Bellman Residual Minimization
by: Hong, Sungee, et al.
Published: (2024)
by: Hong, Sungee, et al.
Published: (2024)
Double Fairness Policy Learning: Integrating Action Fairness and Outcome Fairness in Decision-making
by: Bian, Zeyu, et al.
Published: (2026)
by: Bian, Zeyu, et al.
Published: (2026)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)
by: Zhu, Jin, et al.
Published: (2023)
Sequential Knockoffs for Variable Selection in Reinforcement Learning
by: Ma, Tao, et al.
Published: (2023)
by: Ma, Tao, et al.
Published: (2023)
Statistical Inference in Reinforcement Learning: A Selective Survey
by: Shi, Chengchun
Published: (2025)
by: Shi, Chengchun
Published: (2025)
Counterfactually Safe Reinforcement Learning
by: Li, Jingyi, et al.
Published: (2026)
by: Li, Jingyi, et al.
Published: (2026)
Spatial Deconfounder: Interference-Aware Deconfounding for Spatial Causal Inference
by: Khot, Ayush, et al.
Published: (2025)
by: Khot, Ayush, et al.
Published: (2025)
Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data
by: Wang, Danyang, et al.
Published: (2024)
by: Wang, Danyang, et al.
Published: (2024)
Off-policy Evaluation with Deeply-abstracted States
by: Hao, Meiling, et al.
Published: (2024)
by: Hao, Meiling, et al.
Published: (2024)
STEEL: Singularity-aware Reinforcement Learning
by: Chen, Xiaohong, et al.
Published: (2023)
by: Chen, Xiaohong, et al.
Published: (2023)
Dual Active Learning for Reinforcement Learning from Human Feedback
by: Liu, Pangpang, et al.
Published: (2024)
by: Liu, Pangpang, et al.
Published: (2024)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
by: Behnamnia, Armin, et al.
Published: (2025)
by: Behnamnia, Armin, et al.
Published: (2025)
A Tale of Two Cities: Pessimism and Opportunism in Offline Dynamic Pricing
by: Bian, Zeyu, et al.
Published: (2024)
by: Bian, Zeyu, et al.
Published: (2024)
Reinforcement Learning from Human Feedback: A Statistical Perspective
by: Liu, Pangpang, et al.
Published: (2026)
by: Liu, Pangpang, et al.
Published: (2026)
Deconfounding Scores and Representation Learning for Causal Effect Estimation with Weak Overlap
by: Clivio, Oscar, et al.
Published: (2026)
by: Clivio, Oscar, et al.
Published: (2026)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
by: Zhou, Hongyi, et al.
Published: (2025)
by: Zhou, Hongyi, et al.
Published: (2025)
Deconfounded Time Series Forecasting: A Causal Inference Approach
by: Gao, Wentao, et al.
Published: (2024)
by: Gao, Wentao, et al.
Published: (2024)
Variance-aware Reward Modeling with Anchor Guidance
by: Fang, Shuxing, et al.
Published: (2026)
by: Fang, Shuxing, et al.
Published: (2026)
Testing Stationarity and Change Point Detection in Reinforcement Learning
by: Li, Mengbing, et al.
Published: (2022)
by: Li, Mengbing, et al.
Published: (2022)
Deconfounding Imitation Learning with Variational Inference
by: Vuorio, Risto, et al.
Published: (2022)
by: Vuorio, Risto, et al.
Published: (2022)
Reinforcement Learning with Continuous Actions Under Unmeasured Confounding
by: Li, Yuhan, et al.
Published: (2025)
by: Li, Yuhan, et al.
Published: (2025)
PASTA: A Unified Framework for Offline Assortment Learning
by: Dong, Juncheng, et al.
Published: (2025)
by: Dong, Juncheng, et al.
Published: (2025)
Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention
by: Liu, Moyang, et al.
Published: (2025)
by: Liu, Moyang, et al.
Published: (2025)
Doubly Inhomogeneous Reinforcement Learning
by: Hu, Liyuan, et al.
Published: (2022)
by: Hu, Liyuan, et al.
Published: (2022)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization
by: Li, Yu, et al.
Published: (2025)
by: Li, Yu, et al.
Published: (2025)
Improved Off-policy Reinforcement Learning in Biological Sequence Design
by: Kim, Hyeonah, et al.
Published: (2024)
by: Kim, Hyeonah, et al.
Published: (2024)
A Principled Path to Fitted Distributional Evaluation
by: Hong, Sungee, et al.
Published: (2025)
by: Hong, Sungee, et al.
Published: (2025)
A Two-armed Bandit Framework for A/B Testing
by: Wang, Jinjuan, et al.
Published: (2025)
by: Wang, Jinjuan, et al.
Published: (2025)
Semi-pessimistic Reinforcement Learning
by: Zhu, Jin, et al.
Published: (2025)
by: Zhu, Jin, et al.
Published: (2025)
Distributional Off-Policy Evaluation with Deep Quantile Process Regression
by: Kuang, Qi, et al.
Published: (2026)
by: Kuang, Qi, et al.
Published: (2026)
Balancing Interference and Correlation in Spatial Experimental Designs: A Causal Graph Cut Approach
by: Zhu, Jin, et al.
Published: (2025)
by: Zhu, Jin, et al.
Published: (2025)
MLFEF: Machine Learning Fusion Model with Empirical Formula to Explore the Momentum in Competitive Sports
by: Peng, Ruixin, et al.
Published: (2024)
by: Peng, Ruixin, et al.
Published: (2024)
Beyond Demand Estimation: Consumer Surplus Evaluation via Cumulative Propensity Weights
by: Bian, Zeyu, et al.
Published: (2026)
by: Bian, Zeyu, et al.
Published: (2026)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Designing Time Series Experiments in A/B Testing with Transformer Reinforcement Learning
by: Wu, Xiangkun, et al.
Published: (2026)
by: Wu, Xiangkun, et al.
Published: (2026)
From Authors to Reviewers: Leveraging Rankings to Improve Peer Review
by: Wang, Weichen, et al.
Published: (2025)
by: Wang, Weichen, et al.
Published: (2025)
Off-policy Evaluation for Payments at Adyen
by: Egg, Alex
Published: (2025)
by: Egg, Alex
Published: (2025)
Similar Items
-
Off-policy Evaluation in Doubly Inhomogeneous Environments
by: Bian, Zeyu, et al.
Published: (2023) -
Causal Deepsets for Off-policy Evaluation under Spatial or Spatio-temporal Interferences
by: Dai, Runpeng, et al.
Published: (2024) -
Distributional Off-policy Evaluation with Bellman Residual Minimization
by: Hong, Sungee, et al.
Published: (2024) -
Double Fairness Policy Learning: Integrating Action Fairness and Outcome Fairness in Decision-making
by: Bian, Zeyu, et al.
Published: (2026) -
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
by: Zhu, Jin, et al.
Published: (2023)