Guardado en:
| Autores principales: | Saito, Yuta, Yao, Jihan, Joachims, Thorsten |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.06151 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MultiScale Contextual Bandits for Long Term Objectives
por: Rastogi, Richa, et al.
Publicado: (2025)
por: Rastogi, Richa, et al.
Publicado: (2025)
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024)
por: Kiyohara, Haruka, et al.
Publicado: (2024)
Off-Policy Evaluation and Learning for Matching Markets
por: Hayashi, Yudai, et al.
Publicado: (2025)
por: Hayashi, Yudai, et al.
Publicado: (2025)
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
por: Saito, Yuta, et al.
Publicado: (2024)
por: Saito, Yuta, et al.
Publicado: (2024)
Prompt Optimization with Logged Bandit Data
por: Kiyohara, Haruka, et al.
Publicado: (2025)
por: Kiyohara, Haruka, et al.
Publicado: (2025)
Long-term Off-Policy Evaluation and Learning
por: Saito, Yuta, et al.
Publicado: (2024)
por: Saito, Yuta, et al.
Publicado: (2024)
Off-Policy Evaluation and Learning for Survival Outcomes under Censoring
por: Kubota, Kohsuke, et al.
Publicado: (2026)
por: Kubota, Kohsuke, et al.
Publicado: (2026)
Off-Policy Learning with Limited Supply
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Bayesian Off-Policy Evaluation and Learning for Large Action Spaces
por: Aouali, Imad, et al.
Publicado: (2024)
por: Aouali, Imad, et al.
Publicado: (2024)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
por: Tanaka, Koichi, et al.
Publicado: (2026)
por: Tanaka, Koichi, et al.
Publicado: (2026)
Efficient Off-Policy Learning for High-Dimensional Action Spaces
por: Otto, Fabian, et al.
Publicado: (2024)
por: Otto, Fabian, et al.
Publicado: (2024)
Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits
por: Shimizu, Tatsuhiro, et al.
Publicado: (2024)
por: Shimizu, Tatsuhiro, et al.
Publicado: (2024)
Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation
por: Aouali, Imad, et al.
Publicado: (2025)
por: Aouali, Imad, et al.
Publicado: (2025)
Off-Policy Evaluation and Learning for the Future under Non-Stationarity
por: Shimizu, Tatsuhiro, et al.
Publicado: (2025)
por: Shimizu, Tatsuhiro, et al.
Publicado: (2025)
A General Framework for Off-Policy Learning with Partially-Observed Reward
por: Takehi, Rikiya, et al.
Publicado: (2025)
por: Takehi, Rikiya, et al.
Publicado: (2025)
Fairness in Ranking under Disparate Uncertainty
por: Rastogi, Richa, et al.
Publicado: (2023)
por: Rastogi, Richa, et al.
Publicado: (2023)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023)
por: Kiyohara, Haruka, et al.
Publicado: (2023)
Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation
por: Kiyohara, Haruka, et al.
Publicado: (2023)
por: Kiyohara, Haruka, et al.
Publicado: (2023)
Learning Action Embeddings for Off-Policy Evaluation
por: Cief, Matej, et al.
Publicado: (2023)
por: Cief, Matej, et al.
Publicado: (2023)
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
por: Meng, Wenjia, et al.
Publicado: (2024)
por: Meng, Wenjia, et al.
Publicado: (2024)
Off-Policy Evaluation of Ranking Policies via Embedding-Space User Behavior Modeling
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
por: Takahashi, Tatsuki, et al.
Publicado: (2025)
Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits
por: Chandak, Kushagra, et al.
Publicado: (2025)
por: Chandak, Kushagra, et al.
Publicado: (2025)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Language-Based User Profiles for Recommendation
por: Zhou, Joyce, et al.
Publicado: (2024)
por: Zhou, Joyce, et al.
Publicado: (2024)
End-to-end Training for Recommendation with Language-based User Profiles
por: Gao, Zhaolin, et al.
Publicado: (2024)
por: Gao, Zhaolin, et al.
Publicado: (2024)
Coherent Off-Policy Improvement of Large Behavior Models with Learned Rewards
por: Scherer, Christian, et al.
Publicado: (2026)
por: Scherer, Christian, et al.
Publicado: (2026)
RePO: Bridging On-Policy Learning and Off-Policy Knowledge through Rephrasing Policy Optimization
por: Xia, Linxuan, et al.
Publicado: (2026)
por: Xia, Linxuan, et al.
Publicado: (2026)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
por: Mambelli, Davide, et al.
Publicado: (2024)
por: Mambelli, Davide, et al.
Publicado: (2024)
Zero-Shot Off-Policy Learning
por: Asadulaev, Arip, et al.
Publicado: (2026)
por: Asadulaev, Arip, et al.
Publicado: (2026)
Sequential Off-Policy Learning with Logarithmic Smoothing
por: Haddouche, Maxime, et al.
Publicado: (2025)
por: Haddouche, Maxime, et al.
Publicado: (2025)
On the Reuse Bias in Off-Policy Reinforcement Learning
por: Ying, Chengyang, et al.
Publicado: (2022)
por: Ying, Chengyang, et al.
Publicado: (2022)
Off-Policy Maximum Entropy RL with Future State and Action Visitation Measures
por: Bolland, Adrien, et al.
Publicado: (2024)
por: Bolland, Adrien, et al.
Publicado: (2024)
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
por: Hong, Joey, et al.
Publicado: (2025)
por: Hong, Joey, et al.
Publicado: (2025)
Automated Off-Policy Estimator Selection via Supervised Learning
por: Felicioni, Nicolò, et al.
Publicado: (2024)
por: Felicioni, Nicolò, et al.
Publicado: (2024)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
Explainable Reinforcement Learning via Temporal Policy Decomposition
por: Ruggeri, Franco, et al.
Publicado: (2025)
por: Ruggeri, Franco, et al.
Publicado: (2025)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
por: Zhao, Shiwan, et al.
Publicado: (2026)
por: Zhao, Shiwan, et al.
Publicado: (2026)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
por: Mroueh, Youssef, et al.
Publicado: (2025)
por: Mroueh, Youssef, et al.
Publicado: (2025)
Action-Adaptive Continual Learning: Enabling Policy Generalization under Dynamic Action Spaces
por: Pan, Chaofan, et al.
Publicado: (2025)
por: Pan, Chaofan, et al.
Publicado: (2025)
Ejemplares similares
-
MultiScale Contextual Bandits for Long Term Objectives
por: Rastogi, Richa, et al.
Publicado: (2025) -
Off-Policy Evaluation of Slate Bandit Policies via Optimizing Abstraction
por: Kiyohara, Haruka, et al.
Publicado: (2024) -
Off-Policy Evaluation and Learning for Matching Markets
por: Hayashi, Yudai, et al.
Publicado: (2025) -
Hyperparameter Optimization Can Even be Harmful in Off-Policy Learning and How to Deal with It
por: Saito, Yuta, et al.
Publicado: (2024) -
Prompt Optimization with Logged Bandit Data
por: Kiyohara, Haruka, et al.
Publicado: (2025)