From Weighting to Modeling: A Nonparametric Estimator for Off-Policy Evaluation
Fuente:
arXiv
Guardado en:
| Autor principal: | Zhu, Rong J. B. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks
por: Li, Zihao, et al.
Publicado: (2023)
por: Li, Zihao, et al.
Publicado: (2023)
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
por: Lee, Kyungbok, et al.
Publicado: (2024)
por: Lee, Kyungbok, et al.
Publicado: (2024)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
por: Behnamnia, Armin, et al.
Publicado: (2025)
por: Behnamnia, Armin, et al.
Publicado: (2025)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
por: Zhou, Hongyi, et al.
Publicado: (2025)
por: Zhou, Hongyi, et al.
Publicado: (2025)
Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
por: Gong, Shijin, et al.
Publicado: (2026)
por: Gong, Shijin, et al.
Publicado: (2026)
Off-Policy Evaluation via Adaptive Weighting with Data from Contextual Bandits
por: Zhan, Ruohan, et al.
Publicado: (2021)
por: Zhan, Ruohan, et al.
Publicado: (2021)
Cross-Validated Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2024)
por: Cief, Matej, et al.
Publicado: (2024)
Meta Off-Policy Estimation
por: Jeunen, Olivier
Publicado: (2025)
por: Jeunen, Olivier
Publicado: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Exploiting Similarities in A/B Testing with Off-Policy Estimation
por: Sakhi, Otmane, et al.
Publicado: (2025)
por: Sakhi, Otmane, et al.
Publicado: (2025)
IntOPE: Off-Policy Evaluation in the Presence of Interference
por: Bai, Yuqi, et al.
Publicado: (2024)
por: Bai, Yuqi, et al.
Publicado: (2024)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
Long-term Off-Policy Evaluation and Learning
por: Saito, Yuta, et al.
Publicado: (2024)
por: Saito, Yuta, et al.
Publicado: (2024)
Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization
por: Palenicek, Daniel, et al.
Publicado: (2025)
por: Palenicek, Daniel, et al.
Publicado: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024)
por: Kiyohara, Haruka, et al.
Publicado: (2024)
Clustering Context in Off-Policy Evaluation
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
por: Guzman-Olivares, Daniel, et al.
Publicado: (2025)
Concept-driven Off Policy Evaluation
por: Majumdar, Ritam, et al.
Publicado: (2024)
por: Majumdar, Ritam, et al.
Publicado: (2024)
Off-Policy Evaluation from Logged Human Feedback
por: Bhargava, Aniruddha, et al.
Publicado: (2024)
por: Bhargava, Aniruddha, et al.
Publicado: (2024)
Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
Off-Policy Evaluation Under Nonignorable Missing Data
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
Breaking Determinism: Stochastic Modeling for Reliable Off-Policy Evaluation in Ad Auctions
por: Yeom, Hongseon, et al.
Publicado: (2025)
por: Yeom, Hongseon, et al.
Publicado: (2025)
$Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies
por: Jeunen, Olivier, et al.
Publicado: (2024)
por: Jeunen, Olivier, et al.
Publicado: (2024)
Batched Nonparametric Contextual Bandits
por: Jiang, Rong, et al.
Publicado: (2024)
por: Jiang, Rong, et al.
Publicado: (2024)
Off-Policy Evaluation and Learning for Matching Markets
por: Hayashi, Yudai, et al.
Publicado: (2025)
por: Hayashi, Yudai, et al.
Publicado: (2025)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Generative and Nonparametric Approaches for Conditional Distribution Estimation: Methods, Perspectives, and Comparative Evaluations
por: Chin, Yen-Shiu, et al.
Publicado: (2026)
por: Chin, Yen-Shiu, et al.
Publicado: (2026)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
por: Sakhi, Otmane, et al.
Publicado: (2024)
por: Sakhi, Otmane, et al.
Publicado: (2024)
CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation
por: Mandyam, Aishwarya, et al.
Publicado: (2024)
por: Mandyam, Aishwarya, et al.
Publicado: (2024)
On the Reuse Bias in Off-Policy Reinforcement Learning
por: Ying, Chengyang, et al.
Publicado: (2022)
por: Ying, Chengyang, et al.
Publicado: (2022)
In-Context Learning as Nonparametric Conditional Probability Estimation: Risk Bounds and Optimality
por: Liu, Chenrui, et al.
Publicado: (2025)
por: Liu, Chenrui, et al.
Publicado: (2025)
A Unifying View of Coverage in Linear Off-Policy Evaluation
por: Amortila, Philip, et al.
Publicado: (2026)
por: Amortila, Philip, et al.
Publicado: (2026)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
por: Mambelli, Davide, et al.
Publicado: (2024)
por: Mambelli, Davide, et al.
Publicado: (2024)
Automated Off-Policy Estimator Selection via Supervised Learning
por: Felicioni, Nicolò, et al.
Publicado: (2024)
por: Felicioni, Nicolò, et al.
Publicado: (2024)
When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective
por: Sun, Hao, et al.
Publicado: (2023)
por: Sun, Hao, et al.
Publicado: (2023)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
por: Chandak, Kushagra, et al.
Publicado: (2025)
por: Chandak, Kushagra, et al.
Publicado: (2025)
DOLCE: Decomposing Off-Policy Evaluation/Learning into Lagged and Current Effects
por: Tamano, Shu
Publicado: (2025)
por: Tamano, Shu
Publicado: (2025)
Off-Policy Evaluation Using Information Borrowing and Context-Based Switching
por: Dasgupta, Sutanoy, et al.
Publicado: (2021)
por: Dasgupta, Sutanoy, et al.
Publicado: (2021)
Distributional Off-Policy Evaluation with Deep Quantile Process Regression
por: Kuang, Qi, et al.
Publicado: (2026)
por: Kuang, Qi, et al.
Publicado: (2026)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
por: Lobo, Elita, et al.
Publicado: (2024)
por: Lobo, Elita, et al.
Publicado: (2024)
Adaptive Off-Policy Inference for M-Estimators Under Model Misspecification
por: Leiner, James, et al.
Publicado: (2025)
por: Leiner, James, et al.
Publicado: (2025)
Ejemplares similares
-
Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks
por: Li, Zihao, et al.
Publicado: (2023) -
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
por: Lee, Kyungbok, et al.
Publicado: (2024) -
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
por: Behnamnia, Armin, et al.
Publicado: (2025) -
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
por: Zhou, Hongyi, et al.
Publicado: (2025) -
Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning
por: Gong, Shijin, et al.
Publicado: (2026)