Enregistré dans:
| Auteurs principaux: | Lee, Kyungbok, Paik, Myunghee Cho |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.01830 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
par: Behnamnia, Armin, et autres
Publié: (2025)
par: Behnamnia, Armin, et autres
Publié: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
par: Tanaka, Koichi, et autres
Publié: (2026)
par: Tanaka, Koichi, et autres
Publié: (2026)
Off-Policy Evaluation from Logged Human Feedback
par: Bhargava, Aniruddha, et autres
Publié: (2024)
par: Bhargava, Aniruddha, et autres
Publié: (2024)
Doubly-Robust Estimation of Counterfactual Policy Mean Embeddings
par: Zenati, Houssam, et autres
Publié: (2025)
par: Zenati, Houssam, et autres
Publié: (2025)
Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning
par: Shen, Ye, et autres
Publié: (2021)
par: Shen, Ye, et autres
Publié: (2021)
Logging Policy Design for Off-Policy Evaluation
par: Douglas, Connor, et autres
Publié: (2026)
par: Douglas, Connor, et autres
Publié: (2026)
Doubly Optimal Policy Evaluation for Reinforcement Learning
par: Liu, Shuze Daniel, et autres
Publié: (2024)
par: Liu, Shuze Daniel, et autres
Publié: (2024)
Doubly Robust Fusion of Many Treatments for Policy Learning
par: Zhu, Ke, et autres
Publié: (2025)
par: Zhu, Ke, et autres
Publié: (2025)
CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation
par: Mandyam, Aishwarya, et autres
Publié: (2024)
par: Mandyam, Aishwarya, et autres
Publié: (2024)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
par: Lee, Haanvid, et autres
Publié: (2024)
par: Lee, Haanvid, et autres
Publié: (2024)
Meta Off-Policy Estimation
par: Jeunen, Olivier
Publié: (2025)
par: Jeunen, Olivier
Publié: (2025)
Robustness of Refugee-Matching Gains to Off-Policy Evaluation Choices
par: Bansak, Kirk, et autres
Publié: (2026)
par: Bansak, Kirk, et autres
Publié: (2026)
Efficient Training of Boltzmann Generators Using Off-Policy Log-Dispersion Regularization
par: Schopmans, Henrik, et autres
Publié: (2026)
par: Schopmans, Henrik, et autres
Publié: (2026)
From Weighting to Modeling: A Nonparametric Estimator for Off-Policy Evaluation
par: Zhu, Rong J. B.
Publié: (2026)
par: Zhu, Rong J. B.
Publié: (2026)
Cross-Validated Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2024)
par: Cief, Matej, et autres
Publié: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
par: Kiyohara, Haruka, et autres
Publié: (2024)
par: Kiyohara, Haruka, et autres
Publié: (2024)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
par: Chandak, Kushagra, et autres
Publié: (2025)
par: Chandak, Kushagra, et autres
Publié: (2025)
Off-policy Evaluation in Doubly Inhomogeneous Environments
par: Bian, Zeyu, et autres
Publié: (2023)
par: Bian, Zeyu, et autres
Publié: (2023)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
par: Bennett, Andrew, et autres
Publié: (2024)
par: Bennett, Andrew, et autres
Publié: (2024)
$Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies
par: Jeunen, Olivier, et autres
Publié: (2024)
par: Jeunen, Olivier, et autres
Publié: (2024)
Concept-driven Off Policy Evaluation
par: Majumdar, Ritam, et autres
Publié: (2024)
par: Majumdar, Ritam, et autres
Publié: (2024)
Clustering Context in Off-Policy Evaluation
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
Long-term Off-Policy Evaluation and Learning
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
par: Lobo, Elita, et autres
Publié: (2024)
par: Lobo, Elita, et autres
Publié: (2024)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
par: Nakanishi, Kosuke, et autres
Publié: (2025)
par: Nakanishi, Kosuke, et autres
Publié: (2025)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
par: Takahashi, Tatsuki, et autres
Publié: (2025)
par: Takahashi, Tatsuki, et autres
Publié: (2025)
Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards
par: Takahashi, Tatsuki, et autres
Publié: (2025)
par: Takahashi, Tatsuki, et autres
Publié: (2025)
Off-Policy Evaluation Under Nonignorable Missing Data
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
Off-Policy Evaluation and Learning for Matching Markets
par: Hayashi, Yudai, et autres
Publié: (2025)
par: Hayashi, Yudai, et autres
Publié: (2025)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Exploiting Similarities in A/B Testing with Off-Policy Estimation
par: Sakhi, Otmane, et autres
Publié: (2025)
par: Sakhi, Otmane, et autres
Publié: (2025)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
par: Mambelli, Davide, et autres
Publié: (2024)
par: Mambelli, Davide, et autres
Publié: (2024)
Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning
par: Liu, Weidong, et autres
Publié: (2023)
par: Liu, Weidong, et autres
Publié: (2023)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
par: Mroueh, Youssef, et autres
Publié: (2025)
par: Mroueh, Youssef, et autres
Publié: (2025)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
par: Sakhi, Otmane, et autres
Publié: (2024)
par: Sakhi, Otmane, et autres
Publié: (2024)
Breaking the Curse of Repulsion: Optimistic Distributionally Robust Policy Optimization for Off-Policy Generative Recommendation
par: Jiang, Jie, et autres
Publié: (2026)
par: Jiang, Jie, et autres
Publié: (2026)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
par: Goodall, Alexander W., et autres
Publié: (2025)
par: Goodall, Alexander W., et autres
Publié: (2025)
IntOPE: Off-Policy Evaluation in the Presence of Interference
par: Bai, Yuqi, et autres
Publié: (2024)
par: Bai, Yuqi, et autres
Publié: (2024)
Automated Off-Policy Estimator Selection via Supervised Learning
par: Felicioni, Nicolò, et autres
Publié: (2024)
par: Felicioni, Nicolò, et autres
Publié: (2024)
Documents similaires
-
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
par: Behnamnia, Armin, et autres
Publié: (2025) -
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
par: Tanaka, Koichi, et autres
Publié: (2026) -
Off-Policy Evaluation from Logged Human Feedback
par: Bhargava, Aniruddha, et autres
Publié: (2024) -
Doubly-Robust Estimation of Counterfactual Policy Mean Embeddings
par: Zenati, Houssam, et autres
Publié: (2025) -
Doubly Robust Interval Estimation for Optimal Policy Evaluation in Online Learning
par: Shen, Ye, et autres
Publié: (2021)