Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Takahashi, Tatsuki, Maru, Chihiro, Shoji, Hiroko |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards
par: Takahashi, Tatsuki, et autres
Publié: (2025)
par: Takahashi, Tatsuki, et autres
Publié: (2025)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
par: Tanaka, Koichi, et autres
Publié: (2026)
par: Tanaka, Koichi, et autres
Publié: (2026)
RATFM: Retrieval-augmented Time Series Foundation Model for Anomaly Detection
par: Maru, Chihiro, et autres
Publié: (2025)
par: Maru, Chihiro, et autres
Publié: (2025)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
par: Kiyohara, Haruka, et autres
Publié: (2024)
par: Kiyohara, Haruka, et autres
Publié: (2024)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
par: Chandak, Kushagra, et autres
Publié: (2025)
par: Chandak, Kushagra, et autres
Publié: (2025)
Residual Off-Policy RL for Finetuning Behavior Cloning Policies
par: Ankile, Lars, et autres
Publié: (2025)
par: Ankile, Lars, et autres
Publié: (2025)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
par: Kubota, Kohsuke, et autres
Publié: (2026)
par: Kubota, Kohsuke, et autres
Publié: (2026)
POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy Decomposition
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Demystifying the Paradox of Importance Sampling with an Estimated History-Dependent Behavior Policy in Off-Policy Evaluation
par: Zhou, Hongyi, et autres
Publié: (2025)
par: Zhou, Hongyi, et autres
Publié: (2025)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
par: Aouali, Imad, et autres
Publié: (2024)
par: Aouali, Imad, et autres
Publié: (2024)
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
par: Lee, Kyungbok, et autres
Publié: (2024)
par: Lee, Kyungbok, et autres
Publié: (2024)
Cross-Validated Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2024)
par: Cief, Matej, et autres
Publié: (2024)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
par: Scherer, Christian, et autres
Publié: (2026)
par: Scherer, Christian, et autres
Publié: (2026)
Pessimistic Off-Policy Optimization for Learning to Rank
par: Cief, Matej, et autres
Publié: (2022)
par: Cief, Matej, et autres
Publié: (2022)
Long-term Off-Policy Evaluation and Learning
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Clustering Context in Off-Policy Evaluation
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
par: Guzman-Olivares, Daniel, et autres
Publié: (2025)
Concept-driven Off Policy Evaluation
par: Majumdar, Ritam, et autres
Publié: (2024)
par: Majumdar, Ritam, et autres
Publié: (2024)
Efficient Off-Policy Learning for High-Dimensional Action Spaces
par: Otto, Fabian, et autres
Publié: (2024)
par: Otto, Fabian, et autres
Publié: (2024)
From Weighting to Modeling: A Nonparametric Estimator for Off-Policy Evaluation
par: Zhu, Rong J. B.
Publié: (2026)
par: Zhu, Rong J. B.
Publié: (2026)
Off-Policy Evaluation Under Nonignorable Missing Data
par: Wang, Han, et autres
Publié: (2025)
par: Wang, Han, et autres
Publié: (2025)
Off-Policy Evaluation from Logged Human Feedback
par: Bhargava, Aniruddha, et autres
Publié: (2024)
par: Bhargava, Aniruddha, et autres
Publié: (2024)
Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning
par: Zhuang, Yuan, et autres
Publié: (2026)
par: Zhuang, Yuan, et autres
Publié: (2026)
Data Poisoning Attacks on Off-Policy Policy Evaluation Methods
par: Lobo, Elita, et autres
Publié: (2024)
par: Lobo, Elita, et autres
Publié: (2024)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
par: Mambelli, Davide, et autres
Publié: (2024)
par: Mambelli, Davide, et autres
Publié: (2024)
Off-Policy Evaluation and Learning for Matching Markets
par: Hayashi, Yudai, et autres
Publié: (2025)
par: Hayashi, Yudai, et autres
Publié: (2025)
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
par: Lee, Haanvid, et autres
Publié: (2024)
par: Lee, Haanvid, et autres
Publié: (2024)
Breaking Determinism: Stochastic Modeling for Reliable Off-Policy Evaluation in Ad Auctions
par: Yeom, Hongseon, et autres
Publié: (2025)
par: Yeom, Hongseon, et autres
Publié: (2025)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
par: Mroueh, Youssef, et autres
Publié: (2025)
par: Mroueh, Youssef, et autres
Publié: (2025)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
par: Behnamnia, Armin, et autres
Publié: (2025)
par: Behnamnia, Armin, et autres
Publié: (2025)
Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning
par: Sakhi, Otmane, et autres
Publié: (2024)
par: Sakhi, Otmane, et autres
Publié: (2024)
CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation
par: Mandyam, Aishwarya, et autres
Publié: (2024)
par: Mandyam, Aishwarya, et autres
Publié: (2024)
Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design
par: Liu, Shuze, et autres
Publié: (2023)
par: Liu, Shuze, et autres
Publié: (2023)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
IntOPE: Off-Policy Evaluation in the Presence of Interference
par: Bai, Yuqi, et autres
Publié: (2024)
par: Bai, Yuqi, et autres
Publié: (2024)
Off-Policy Evaluation via Adaptive Weighting with Data from Contextual Bandits
par: Zhan, Ruohan, et autres
Publié: (2021)
par: Zhan, Ruohan, et autres
Publié: (2021)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Distributional Off-Policy Evaluation with Deep Quantile Process Regression
par: Kuang, Qi, et autres
Publié: (2026)
par: Kuang, Qi, et autres
Publié: (2026)
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
par: Nakanishi, Kosuke, et autres
Publié: (2025)
par: Nakanishi, Kosuke, et autres
Publié: (2025)
Documents similaires
-
Off-Policy Evaluation for Recommendations with Missing-Not-At-Random Rewards
par: Takahashi, Tatsuki, et autres
Publié: (2025) -
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
par: Tanaka, Koichi, et autres
Publié: (2026) -
RATFM: Retrieval-augmented Time Series Foundation Model for Anomaly Detection
par: Maru, Chihiro, et autres
Publié: (2025) -
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023) -
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
par: Kiyohara, Haruka, et autres
Publié: (2024)