Exploiting Similarities in A/B Testing with Off-Policy Estimation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sakhi, Otmane, Gilotte, Alexandre, Rohde, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
por: Aouali, Imad, et al.
Publicado: (2025)
por: Aouali, Imad, et al.
Publicado: (2025)
Offline Contextual Bandit with Counterfactual Sample Identification
por: Gilotte, Alexandre, et al.
Publicado: (2025)
por: Gilotte, Alexandre, et al.
Publicado: (2025)
Sequential Off-Policy Learning with Logarithmic Smoothing
por: Haddouche, Maxime, et al.
Publicado: (2025)
por: Haddouche, Maxime, et al.
Publicado: (2025)
Fast Slate Policy Optimization: Going Beyond Plackett-Luce
por: Sakhi, Otmane, et al.
Publicado: (2023)
por: Sakhi, Otmane, et al.
Publicado: (2023)
RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents
por: Aouali, Imad, et al.
Publicado: (2026)
por: Aouali, Imad, et al.
Publicado: (2026)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
por: Sakhi, Otmane, et al.
Publicado: (2024)
por: Sakhi, Otmane, et al.
Publicado: (2024)
Non-Linear Counterfactual Aggregate Optimization
por: Heymann, Benjamin, et al.
Publicado: (2025)
por: Heymann, Benjamin, et al.
Publicado: (2025)
Learning to Bid in Repeated Second-Price Auctions with Dynamic Values and Aggregated Feedback
por: Heymann, Benjamin, et al.
Publicado: (2026)
por: Heymann, Benjamin, et al.
Publicado: (2026)
RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning
por: Arzhantsev, Aleksei, et al.
Publicado: (2025)
por: Arzhantsev, Aleksei, et al.
Publicado: (2025)
Self-Consistency via Marginal Sharpening
por: Arzhantsev, Aleksei, et al.
Publicado: (2026)
por: Arzhantsev, Aleksei, et al.
Publicado: (2026)
Data Valuation for LLM Fine-Tuning: Efficient Shapley Value Approximation via Language Model Arithmetic
por: Tamine, Mélissa, et al.
Publicado: (2025)
por: Tamine, Mélissa, et al.
Publicado: (2025)
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
por: Aouali, Imad, et al.
Publicado: (2022)
por: Aouali, Imad, et al.
Publicado: (2022)
Confounding is a Pervasive Problem in Real World Recommender Systems
por: Merkov, Alexander, et al.
Publicado: (2025)
por: Merkov, Alexander, et al.
Publicado: (2025)
A pragmatic policy learning approach to account for users' fatigue in repeated auctions
por: Heymann, Benjamin, et al.
Publicado: (2024)
por: Heymann, Benjamin, et al.
Publicado: (2024)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
por: Aouali, Imad, et al.
Publicado: (2024)
por: Aouali, Imad, et al.
Publicado: (2024)
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
por: Lee, Kyungbok, et al.
Publicado: (2024)
por: Lee, Kyungbok, et al.
Publicado: (2024)
Meta Off-Policy Estimation
por: Jeunen, Olivier
Publicado: (2025)
por: Jeunen, Olivier
Publicado: (2025)
From Weighting to Modeling: A Nonparametric Estimator for Off-Policy Evaluation
por: Zhu, Rong J. B.
Publicado: (2026)
por: Zhu, Rong J. B.
Publicado: (2026)
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-Critic
por: Ji, Tianying, et al.
Publicado: (2023)
por: Ji, Tianying, et al.
Publicado: (2023)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
por: Behnamnia, Armin, et al.
Publicado: (2025)
por: Behnamnia, Armin, et al.
Publicado: (2025)
$Δ\text{-}{\rm OPE}$: Off-Policy Estimation with Pairs of Policies
por: Jeunen, Olivier, et al.
Publicado: (2024)
por: Jeunen, Olivier, et al.
Publicado: (2024)
Conformal Off-Policy Evaluation in Markov Decision Processes
por: Foffano, Daniele, et al.
Publicado: (2023)
por: Foffano, Daniele, et al.
Publicado: (2023)
Automated Off-Policy Estimator Selection via Supervised Learning
por: Felicioni, Nicolò, et al.
Publicado: (2024)
por: Felicioni, Nicolò, et al.
Publicado: (2024)
Exploiting Similarity for Computation and Communication-Efficient Decentralized Optimization
por: Takezawa, Yuki, et al.
Publicado: (2025)
por: Takezawa, Yuki, et al.
Publicado: (2025)
Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning
por: Goodall, Alexander W., et al.
Publicado: (2025)
por: Goodall, Alexander W., et al.
Publicado: (2025)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
por: Zhou, Hongyi, et al.
Publicado: (2025)
por: Zhou, Hongyi, et al.
Publicado: (2025)
Dual Latent State Learning: Exploiting Regional Network Similarities for QoS Prediction
por: Wang, Ziliang, et al.
Publicado: (2023)
por: Wang, Ziliang, et al.
Publicado: (2023)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
por: Mambelli, Davide, et al.
Publicado: (2024)
por: Mambelli, Davide, et al.
Publicado: (2024)
Cross-Validated Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2024)
por: Cief, Matej, et al.
Publicado: (2024)
Off-Policy Learning with Limited Supply
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Exploiting Adjacent Similarity in Multi-Armed Bandit Tasks via Transfer of Reward Samples
por: Rahul, NR, et al.
Publicado: (2024)
por: Rahul, NR, et al.
Publicado: (2024)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
por: Mroueh, Youssef, et al.
Publicado: (2025)
por: Mroueh, Youssef, et al.
Publicado: (2025)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
por: Meng, Wenjia, et al.
Publicado: (2024)
por: Meng, Wenjia, et al.
Publicado: (2024)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
por: Cohen, Taco, et al.
Publicado: (2025)
por: Cohen, Taco, et al.
Publicado: (2025)
Policy Testing in Markov Decision Processes
por: Ariu, Kaito, et al.
Publicado: (2025)
por: Ariu, Kaito, et al.
Publicado: (2025)
On Universally Optimal Algorithms for A/B Testing
por: Wang, Po-An, et al.
Publicado: (2023)
por: Wang, Po-An, et al.
Publicado: (2023)
PAC Off-Policy Prediction of Contextual Bandits
por: Wan, Yilong, et al.
Publicado: (2025)
por: Wan, Yilong, et al.
Publicado: (2025)
Transductive Off-policy Proximal Policy Optimization
por: Gan, Yaozhong, et al.
Publicado: (2024)
por: Gan, Yaozhong, et al.
Publicado: (2024)
On the Reuse Bias in Off-Policy Reinforcement Learning
por: Ying, Chengyang, et al.
Publicado: (2022)
por: Ying, Chengyang, et al.
Publicado: (2022)
Ejemplares similares
-
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
por: Aouali, Imad, et al.
Publicado: (2025) -
Offline Contextual Bandit with Counterfactual Sample Identification
por: Gilotte, Alexandre, et al.
Publicado: (2025) -
Sequential Off-Policy Learning with Logarithmic Smoothing
por: Haddouche, Maxime, et al.
Publicado: (2025) -
Fast Slate Policy Optimization: Going Beyond Plackett-Luce
por: Sakhi, Otmane, et al.
Publicado: (2023) -
RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents
por: Aouali, Imad, et al.
Publicado: (2026)