Off-Policy Evaluation from Logged Human Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Bhargava, Aniruddha, Jain, Lalit, Kveton, Branislav, Liu, Ge, Mukherjee, Subhojyoti |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient and Interpretable Bandit Algorithms
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
di: Mathur, Puneet, et al.
Pubblicazione: (2026)
Cross-Validated Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2024)
di: Cief, Matej, et al.
Pubblicazione: (2024)
Optimal Design for Human Preference Elicitation
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
Experimental Design for Active Transductive Inference in Large Language Models
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
Multi-Objective Alignment of Large Language Models Through Hypervolume Maximization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
Agentic Planning with Reasoning for Image Styling via Offline RL
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2026)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2026)
Pessimistic Off-Policy Optimization for Learning to Rank
di: Cief, Matej, et al.
Pubblicazione: (2022)
di: Cief, Matej, et al.
Pubblicazione: (2022)
AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
Learning from a single labeled face and a stream of unlabeled data
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
Learning to Reason in LLMs by Expectation Maximization
di: Lee, Junghyun, et al.
Pubblicazione: (2025)
di: Lee, Junghyun, et al.
Pubblicazione: (2025)
SaVeR: Optimal Data Collection Strategy for Safe Policy Evaluation in Tabular MDP
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
SPEED: Experimental Design for Policy Evaluation in Linear Heteroscedastic Bandits
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
di: Savani, Yash, et al.
Pubblicazione: (2026)
di: Savani, Yash, et al.
Pubblicazione: (2026)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
LLM-as-Judge on a Budget
di: Saha, Aadirupa, et al.
Pubblicazione: (2026)
di: Saha, Aadirupa, et al.
Pubblicazione: (2026)
Doubly-Robust Off-Policy Evaluation with Estimated Logging Policy
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
di: Lee, Kyungbok, et al.
Pubblicazione: (2024)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
di: Tanaka, Koichi, et al.
Pubblicazione: (2026)
di: Tanaka, Koichi, et al.
Pubblicazione: (2026)
Nearly Minimax Optimal Submodular Maximization with Bandit Feedback
di: Tajdini, Artin, et al.
Pubblicazione: (2023)
di: Tajdini, Artin, et al.
Pubblicazione: (2023)
Log-Sum-Exponential Estimator for Off-Policy Evaluation and Learning
di: Behnamnia, Armin, et al.
Pubblicazione: (2025)
di: Behnamnia, Armin, et al.
Pubblicazione: (2025)
Semi-supervised learning with max-margin graph cuts
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
Spectral bandits for smooth graph functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Online semi-supervised perception: Real-time learning without explicit feedback
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
di: Kveton, Branislav, et al.
Pubblicazione: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Online Posterior Sampling with a Diffusion Prior
di: Kveton, Branislav, et al.
Pubblicazione: (2024)
di: Kveton, Branislav, et al.
Pubblicazione: (2024)
Spectral bandits for smooth graph functions with applications in recommender systems
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Evidence-based anomaly detection in clinical domains
di: Hauskrecht, Milos, et al.
Pubblicazione: (2026)
di: Hauskrecht, Milos, et al.
Pubblicazione: (2026)
Finite-Time Logarithmic Bayes Regret Upper Bounds
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
di: Atsidakou, Alexia, et al.
Pubblicazione: (2023)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
Comparing Few to Rank Many: Active Human Preference Learning using Randomized Frank-Wolfe
di: Thekumparampil, Kiran Koshy, et al.
Pubblicazione: (2024)
di: Thekumparampil, Kiran Koshy, et al.
Pubblicazione: (2024)
Conditional anomaly detection with soft harmonic functions
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Conditional anomaly detection using soft harmonic functions: An application to clinical alerting
di: Valko, Michal, et al.
Pubblicazione: (2026)
di: Valko, Michal, et al.
Pubblicazione: (2026)
Logging Policy Design for Off-Policy Evaluation
di: Douglas, Connor, et al.
Pubblicazione: (2026)
di: Douglas, Connor, et al.
Pubblicazione: (2026)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
di: Ackermann, Johannes, et al.
Pubblicazione: (2025)
ML-Tool-Bench: Tool-Augmented Planning for ML Tasks
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
Spectral bandits
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
di: Kocák, Tomáš, et al.
Pubblicazione: (2026)
Efficient Training of Boltzmann Generators Using Off-Policy Log-Dispersion Regularization
di: Schopmans, Henrik, et al.
Pubblicazione: (2026)
di: Schopmans, Henrik, et al.
Pubblicazione: (2026)
Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)
An Efficient Plugin Method for Metric Optimization of Black-Box Models
di: Devic, Siddartha, et al.
Pubblicazione: (2025)
di: Devic, Siddartha, et al.
Pubblicazione: (2025)
RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
di: Fernandez, Nigel, et al.
Pubblicazione: (2025)
di: Fernandez, Nigel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Efficient and Interpretable Bandit Algorithms
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2023) -
Partial Policy Gradients for RL in LLMs
di: Mathur, Puneet, et al.
Pubblicazione: (2026) -
Cross-Validated Off-Policy Evaluation
di: Cief, Matej, et al.
Pubblicazione: (2024) -
Optimal Design for Human Preference Elicitation
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024) -
Experimental Design for Active Transductive Inference in Large Language Models
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2024)