Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lee, Kyungbok, Paik, Myunghee Cho |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
von: Behnamnia, Armin, et al.
Veröffentlicht: (2025)
von: Behnamnia, Armin, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
Off-Policy Evaluation from Logged Human Feedback
von: Bhargava, Aniruddha, et al.
Veröffentlicht: (2024)
von: Bhargava, Aniruddha, et al.
Veröffentlicht: (2024)
Doubly-Robust Estimation of Counterfactual Policy Mean Embeddings
von: Zenati, Houssam, et al.
Veröffentlicht: (2025)
von: Zenati, Houssam, et al.
Veröffentlicht: (2025)
Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning
von: Shen, Ye, et al.
Veröffentlicht: (2021)
von: Shen, Ye, et al.
Veröffentlicht: (2021)
Logging Policy Design for Off-Policy Evaluation
von: Douglas, Connor, et al.
Veröffentlicht: (2026)
von: Douglas, Connor, et al.
Veröffentlicht: (2026)
Doubly Optimal Policy Evaluation for Reinforcement Learning
von: Liu, Shuze Daniel, et al.
Veröffentlicht: (2024)
von: Liu, Shuze Daniel, et al.
Veröffentlicht: (2024)
CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation
von: Mandyam, Aishwarya, et al.
Veröffentlicht: (2024)
von: Mandyam, Aishwarya, et al.
Veröffentlicht: (2024)
Doubly Robust Fusion of Many Treatments for Policy Learning
von: Zhu, Ke, et al.
Veröffentlicht: (2025)
von: Zhu, Ke, et al.
Veröffentlicht: (2025)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
von: Lee, Haanvid, et al.
Veröffentlicht: (2024)
From Weighting to Modeling: A Nonparametric Estimator for Off-Policy Evaluation
von: Zhu, Rong J. B.
Veröffentlicht: (2026)
von: Zhu, Rong J. B.
Veröffentlicht: (2026)
Efficient Training of Boltzmann Generators Using Off-Policy Log-Dispersion Regularization
von: Schopmans, Henrik, et al.
Veröffentlicht: (2026)
von: Schopmans, Henrik, et al.
Veröffentlicht: (2026)
Meta Off-Policy Estimation
von: Jeunen, Olivier
Veröffentlicht: (2025)
von: Jeunen, Olivier
Veröffentlicht: (2025)
Robustness of Refugee-Matching Gains to Off-Policy Evaluation Choices
von: Bansak, Kirk, et al.
Veröffentlicht: (2026)
von: Bansak, Kirk, et al.
Veröffentlicht: (2026)
Cross-Validated Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2024)
von: Cief, Matej, et al.
Veröffentlicht: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
von: Zhou, Hongyi, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2024)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2024)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
von: Chandak, Kushagra, et al.
Veröffentlicht: (2025)
Off-policy Evaluation in Doubly Inhomogeneous Environments
von: Bian, Zeyu, et al.
Veröffentlicht: (2023)
von: Bian, Zeyu, et al.
Veröffentlicht: (2023)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
von: Bennett, Andrew, et al.
Veröffentlicht: (2024)
von: Bennett, Andrew, et al.
Veröffentlicht: (2024)
Long-term Off-Policy Evaluation and Learning
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
von: Saito, Yuta, et al.
Veröffentlicht: (2024)
$Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies
von: Jeunen, Olivier, et al.
Veröffentlicht: (2024)
von: Jeunen, Olivier, et al.
Veröffentlicht: (2024)
Concept-driven Off Policy Evaluation
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
von: Majumdar, Ritam, et al.
Veröffentlicht: (2024)
Clustering Context in Off-Policy Evaluation
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
von: Guzman-Olivares, Daniel, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
von: Takahashi, Tatsuki, et al.
Veröffentlicht: (2025)
Off-Policy Evaluation Under Nonignorable Missing Data
von: Wang, Han, et al.
Veröffentlicht: (2025)
von: Wang, Han, et al.
Veröffentlicht: (2025)
Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning
von: Liu, Weidong, et al.
Veröffentlicht: (2023)
von: Liu, Weidong, et al.
Veröffentlicht: (2023)
Exploiting Similarities in A/B Testing with Off-Policy Estimation
von: Sakhi, Otmane, et al.
Veröffentlicht: (2025)
von: Sakhi, Otmane, et al.
Veröffentlicht: (2025)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
von: Nakanishi, Kosuke, et al.
Veröffentlicht: (2025)
von: Nakanishi, Kosuke, et al.
Veröffentlicht: (2025)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
von: Mambelli, Davide, et al.
Veröffentlicht: (2024)
von: Mambelli, Davide, et al.
Veröffentlicht: (2024)
Off-Policy Evaluation and Learning for Matching Markets
von: Hayashi, Yudai, et al.
Veröffentlicht: (2025)
von: Hayashi, Yudai, et al.
Veröffentlicht: (2025)
Learning Action Embeddings for Off-Policy Evaluation
von: Cief, Matej, et al.
Veröffentlicht: (2023)
von: Cief, Matej, et al.
Veröffentlicht: (2023)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
von: Mroueh, Youssef, et al.
Veröffentlicht: (2025)
von: Mroueh, Youssef, et al.
Veröffentlicht: (2025)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
von: Sakhi, Otmane, et al.
Veröffentlicht: (2024)
von: Sakhi, Otmane, et al.
Veröffentlicht: (2024)
Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
von: Jiang, Jie, et al.
Veröffentlicht: (2026)
von: Jiang, Jie, et al.
Veröffentlicht: (2026)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
von: Goodall, Alexander W., et al.
Veröffentlicht: (2025)
IntOPE: Off-Policy Evaluation in the Presence of Interference
von: Bai, Yuqi, et al.
Veröffentlicht: (2024)
von: Bai, Yuqi, et al.
Veröffentlicht: (2024)
Automated Off-Policy Estimator Selection via Supervised Learning
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
von: Felicioni, Nicolò, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
von: Behnamnia, Armin, et al.
Veröffentlicht: (2025) -
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026) -
Off-Policy Evaluation from Logged Human Feedback
von: Bhargava, Aniruddha, et al.
Veröffentlicht: (2024) -
Doubly-Robust Estimation of Counterfactual Policy Mean Embeddings
von: Zenati, Houssam, et al.
Veröffentlicht: (2025) -
Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning
von: Shen, Ye, et al.
Veröffentlicht: (2021)