Enregistré dans:
| Auteurs principaux: | Saito, Yuta, Yao, Jihan, Joachims, Thorsten |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.06151 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MultiScale Contextual Bandits for Long Term Objectives
par: Rastogi, Richa, et autres
Publié: (2025)
par: Rastogi, Richa, et autres
Publié: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
par: Kiyohara, Haruka, et autres
Publié: (2024)
par: Kiyohara, Haruka, et autres
Publié: (2024)
Off-Policy Evaluation and Learning for Matching Markets
par: Hayashi, Yudai, et autres
Publié: (2025)
par: Hayashi, Yudai, et autres
Publié: (2025)
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Prompt Optimization with Logged Bandit Data
par: Kiyohara, Haruka, et autres
Publié: (2025)
par: Kiyohara, Haruka, et autres
Publié: (2025)
Long-term Off-Policy Evaluation and Learning
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
par: Kubota, Kohsuke, et autres
Publié: (2026)
par: Kubota, Kohsuke, et autres
Publié: (2026)
Off-Policy Learning with Limited Supply
par: Tanaka, Koichi, et autres
Publié: (2026)
par: Tanaka, Koichi, et autres
Publié: (2026)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
par: Aouali, Imad, et autres
Publié: (2024)
par: Aouali, Imad, et autres
Publié: (2024)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
par: Tanaka, Koichi, et autres
Publié: (2026)
par: Tanaka, Koichi, et autres
Publié: (2026)
Efficient Off-Policy Learning for High-Dimensional Action Spaces
par: Otto, Fabian, et autres
Publié: (2024)
par: Otto, Fabian, et autres
Publié: (2024)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
par: Shimizu, Tatsuhiro, et autres
Publié: (2024)
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
par: Aouali, Imad, et autres
Publié: (2025)
par: Aouali, Imad, et autres
Publié: (2025)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
par: Shimizu, Tatsuhiro, et autres
Publié: (2025)
A General Framework for Off-Policy Learning with Partially-Observed Reward
par: Takehi, Rikiya, et autres
Publié: (2025)
par: Takehi, Rikiya, et autres
Publié: (2025)
Fairness in Ranking under Disparate Uncertainty
par: Rastogi, Richa, et autres
Publié: (2023)
par: Rastogi, Richa, et autres
Publié: (2023)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
par: Kiyohara, Haruka, et autres
Publié: (2023)
par: Kiyohara, Haruka, et autres
Publié: (2023)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
par: Kiyohara, Haruka, et autres
Publié: (2023)
par: Kiyohara, Haruka, et autres
Publié: (2023)
Learning Action Embeddings for Off-Policy Evaluation
par: Cief, Matej, et autres
Publié: (2023)
par: Cief, Matej, et autres
Publié: (2023)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
par: Meng, Wenjia, et autres
Publié: (2024)
par: Meng, Wenjia, et autres
Publié: (2024)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
par: Takahashi, Tatsuki, et autres
Publié: (2025)
par: Takahashi, Tatsuki, et autres
Publié: (2025)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
par: Chandak, Kushagra, et autres
Publié: (2025)
par: Chandak, Kushagra, et autres
Publié: (2025)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
par: Wen, Muning, et autres
Publié: (2024)
par: Wen, Muning, et autres
Publié: (2024)
Language-Based User Profiles for Recommendation
par: Zhou, Joyce, et autres
Publié: (2024)
par: Zhou, Joyce, et autres
Publié: (2024)
End-to-end Training for Recommendation with Language-based User Profiles
par: Gao, Zhaolin, et autres
Publié: (2024)
par: Gao, Zhaolin, et autres
Publié: (2024)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
par: Scherer, Christian, et autres
Publié: (2026)
par: Scherer, Christian, et autres
Publié: (2026)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
par: Xia, Linxuan, et autres
Publié: (2026)
par: Xia, Linxuan, et autres
Publié: (2026)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
par: Mambelli, Davide, et autres
Publié: (2024)
par: Mambelli, Davide, et autres
Publié: (2024)
Zero-Shot Off-Policy Learning
par: Asadulaev, Arip, et autres
Publié: (2026)
par: Asadulaev, Arip, et autres
Publié: (2026)
Sequential Off-Policy Learning with Logarithmic Smoothing
par: Haddouche, Maxime, et autres
Publié: (2025)
par: Haddouche, Maxime, et autres
Publié: (2025)
On the Reuse Bias in Off-Policy Reinforcement Learning
par: Ying, Chengyang, et autres
Publié: (2022)
par: Ying, Chengyang, et autres
Publié: (2022)
Off-Policy Maximum Entropy RL with Future State and Action Visitation Measures
par: Bolland, Adrien, et autres
Publié: (2024)
par: Bolland, Adrien, et autres
Publié: (2024)
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
par: Hong, Joey, et autres
Publié: (2025)
par: Hong, Joey, et autres
Publié: (2025)
Automated Off-Policy Estimator Selection via Supervised Learning
par: Felicioni, Nicolò, et autres
Publié: (2024)
par: Felicioni, Nicolò, et autres
Publié: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
Explainable Reinforcement Learning via Temporal Policy Decomposition
par: Ruggeri, Franco, et autres
Publié: (2025)
par: Ruggeri, Franco, et autres
Publié: (2025)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
par: Zhao, Shiwan, et autres
Publié: (2026)
par: Zhao, Shiwan, et autres
Publié: (2026)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
par: Wang, Peng-Yuan, et autres
Publié: (2026)
par: Wang, Peng-Yuan, et autres
Publié: (2026)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
par: Mroueh, Youssef, et autres
Publié: (2025)
par: Mroueh, Youssef, et autres
Publié: (2025)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
par: Pan, Chaofan, et autres
Publié: (2025)
par: Pan, Chaofan, et autres
Publié: (2025)
Documents similaires
-
MultiScale Contextual Bandits for Long Term Objectives
par: Rastogi, Richa, et autres
Publié: (2025) -
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
par: Kiyohara, Haruka, et autres
Publié: (2024) -
Off-Policy Evaluation and Learning for Matching Markets
par: Hayashi, Yudai, et autres
Publié: (2025) -
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
par: Saito, Yuta, et autres
Publié: (2024) -
Prompt Optimization with Logged Bandit Data
par: Kiyohara, Haruka, et autres
Publié: (2025)