Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach
Fuente:
arXiv
Saved in:
| Main Authors: | Hao, Guang-Yuan, van der Laan, Lars, Bibaut, Aurélien, Kallus, Nathan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Inverse Reinforcement Learning with Just Classification and a Few Regressions
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Nonparametric Instrumental Variable Inference with Many Weak Instruments
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Automatic Debiased Machine Learning for Smooth Functionals of Nonparametric M-Estimands
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Bellman Calibration for $V$-Learning in Offline Reinforcement Learning
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Demistifying Inference after Adaptive Experiments
by: Bibaut, Aurélien, et al.
Published: (2024)
by: Bibaut, Aurélien, et al.
Published: (2024)
Stationary Reweighting Yields Local Convergence of Soft Fitted Q-Iteration
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Near-Optimal Non-Parametric Sequential Tests and Confidence Sequences with Possibly Dependent Observations
by: Bibaut, Aurelien, et al.
Published: (2022)
by: Bibaut, Aurelien, et al.
Published: (2022)
Simulation-Based Inference for Adaptive Experiments
by: Cho, Brian M, et al.
Published: (2025)
by: Cho, Brian M, et al.
Published: (2025)
Functional Natural Policy Gradients
by: Bibaut, Aurelien, et al.
Published: (2026)
by: Bibaut, Aurelien, et al.
Published: (2026)
Fast Best-in-Class Regret for Contextual Bandits
by: Girard, Samuel, et al.
Published: (2025)
by: Girard, Samuel, et al.
Published: (2025)
Nonparametric Instrumental Variable Analysis Without Structural Equations: Debiased Inference on Functionals of Inverse Problems with No Solutions
by: Shen, Zikai, et al.
Published: (2026)
by: Shen, Zikai, et al.
Published: (2026)
Semiparametric Efficient Bilevel Gradient Estimation
by: Khoury, Fares El, et al.
Published: (2026)
by: Khoury, Fares El, et al.
Published: (2026)
The Value of Personalized Recommendations: Evidence from Netflix
by: Zielnicki, Kevin, et al.
Published: (2025)
by: Zielnicki, Kevin, et al.
Published: (2025)
Efficient Inference after Directionally Stable Adaptive Experiments
by: Shen, Zikai, et al.
Published: (2026)
by: Shen, Zikai, et al.
Published: (2026)
Reward Maximization for Pure Exploration: Minimax Optimal Good Arm Identification for Nonparametric Multi-Armed Bandits
by: Cho, Brian, et al.
Published: (2024)
by: Cho, Brian, et al.
Published: (2024)
Inferring the Long-Term Causal Effects of Long-Term Treatments from Short-Term Experiments
by: Tran, Allen, et al.
Published: (2023)
by: Tran, Allen, et al.
Published: (2023)
A Researcher's Guide to Empirical Risk Minimization
by: van der Laan, Lars
Published: (2026)
by: van der Laan, Lars
Published: (2026)
A Reductions Approach to Risk-Sensitive Reinforcement Learning with Optimized Certainty Equivalents
by: Wang, Kaiwen, et al.
Published: (2024)
by: Wang, Kaiwen, et al.
Published: (2024)
Nonparametric Jackknife Instrumental Variable Estimation and Confounding Robust Surrogate Indices
by: Bibaut, Aurélien, et al.
Published: (2024)
by: Bibaut, Aurélien, et al.
Published: (2024)
Stabilized Inverse Probability Weighting via Isotonic Calibration
by: van der Laan, Lars, et al.
Published: (2024)
by: van der Laan, Lars, et al.
Published: (2024)
The Central Role of the Loss Function in Reinforcement Learning
by: Wang, Kaiwen, et al.
Published: (2024)
by: Wang, Kaiwen, et al.
Published: (2024)
Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning
by: Sun, Hao, et al.
Published: (2024)
by: Sun, Hao, et al.
Published: (2024)
Learning the Covariance of Treatment Effects Across Many Weak Experiments
by: Bibaut, Aurélien, et al.
Published: (2024)
by: Bibaut, Aurélien, et al.
Published: (2024)
Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction
by: van der Laan, Lars, et al.
Published: (2025)
by: van der Laan, Lars, et al.
Published: (2025)
Dense Reward for Free in Reinforcement Learning from Human Feedback
by: Chan, Alex J., et al.
Published: (2024)
by: Chan, Alex J., et al.
Published: (2024)
On Reward Transferability in Adversarial Inverse Reinforcement Learning: Insights from Random Matrix Theory
by: Zhang, Yangchun, et al.
Published: (2024)
by: Zhang, Yangchun, et al.
Published: (2024)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
by: Kallus, Nathan
Published: (2025)
by: Kallus, Nathan
Published: (2025)
Adaptive-TMLE for the Average Treatment Effect based on Randomized Controlled Trial Augmented with Real-World Data
by: van der Laan, Mark, et al.
Published: (2024)
by: van der Laan, Mark, et al.
Published: (2024)
Adaptive debiased machine learning using data-driven model selection techniques
by: van der Laan, Lars, et al.
Published: (2023)
by: van der Laan, Lars, et al.
Published: (2023)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
by: Schlaginhaufen, Andreas, et al.
Published: (2024)
by: Schlaginhaufen, Andreas, et al.
Published: (2024)
Robust and Agnostic Learning of Conditional Distributional Treatment Effects
by: Kallus, Nathan, et al.
Published: (2022)
by: Kallus, Nathan, et al.
Published: (2022)
Self-Calibrating Conformal Prediction
by: van der Laan, Lars, et al.
Published: (2024)
by: van der Laan, Lars, et al.
Published: (2024)
Variation Due to Regularization Tractably Recovers Bayesian Deep Learning
by: McInerney, James, et al.
Published: (2024)
by: McInerney, James, et al.
Published: (2024)
Calibeating Prediction-Powered Inference
by: van der Laan, Lars, et al.
Published: (2026)
by: van der Laan, Lars, et al.
Published: (2026)
More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning
by: Wang, Kaiwen, et al.
Published: (2024)
by: Wang, Kaiwen, et al.
Published: (2024)
Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning
by: Li, Gen, et al.
Published: (2023)
by: Li, Gen, et al.
Published: (2023)
Hybrid Meta-learners for Estimating Heterogeneous Treatment Effects
by: Liang, Zhongyuan, et al.
Published: (2025)
by: Liang, Zhongyuan, et al.
Published: (2025)
Similar Items
-
Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models
by: van der Laan, Lars, et al.
Published: (2025) -
Inverse Reinforcement Learning with Just Classification and a Few Regressions
by: van der Laan, Lars, et al.
Published: (2025) -
Nonparametric Instrumental Variable Inference with Many Weak Instruments
by: van der Laan, Lars, et al.
Published: (2025) -
Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference
by: van der Laan, Lars, et al.
Published: (2025) -
Automatic Debiased Machine Learning for Smooth Functionals of Nonparametric M-Estimands
by: van der Laan, Lars, et al.
Published: (2025)