Stationary Reweighting Yields Local Convergence of Soft Fitted Q-Iteration
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | van der Laan, Lars, Kallus, Nathan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Bellman Calibration for $V$-Learning in Offline Reinforcement Learning
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Nonparametric Instrumental Variable Inference with Many Weak Instruments
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Inverse Reinforcement Learning with Just Classification and a Few Regressions
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach
von: Hao, Guang-Yuan, et al.
Veröffentlicht: (2026)
von: Hao, Guang-Yuan, et al.
Veröffentlicht: (2026)
Automatic Debiased Machine Learning for Smooth Functionals of Nonparametric M-Estimands
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
A Researcher's Guide to Empirical Risk Minimization
von: van der Laan, Lars
Veröffentlicht: (2026)
von: van der Laan, Lars
Veröffentlicht: (2026)
Generalized Venn and Venn-Abers Calibration with Applications in Conformal Prediction
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)
Smooth Non-Stationary Bandits
von: Jia, Su, et al.
Veröffentlicht: (2023)
von: Jia, Su, et al.
Veröffentlicht: (2023)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
von: Kallus, Nathan
Veröffentlicht: (2025)
von: Kallus, Nathan
Veröffentlicht: (2025)
Adaptive-TMLE for the Average Treatment Effect based on Randomized Controlled Trial Augmented with Real-World Data
von: van der Laan, Mark, et al.
Veröffentlicht: (2024)
von: van der Laan, Mark, et al.
Veröffentlicht: (2024)
Global Convergence of Iteratively Reweighted Least Squares for Robust Subspace Recovery
von: Lerman, Gilad, et al.
Veröffentlicht: (2025)
von: Lerman, Gilad, et al.
Veröffentlicht: (2025)
Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning
von: Manda, Kausthubh, et al.
Veröffentlicht: (2025)
von: Manda, Kausthubh, et al.
Veröffentlicht: (2025)
Generalized Fitted Q-Iteration with Clustered Data
von: Hu, Liyuan, et al.
Veröffentlicht: (2025)
von: Hu, Liyuan, et al.
Veröffentlicht: (2025)
Adaptive debiased machine learning using data-driven model selection techniques
von: van der Laan, Lars, et al.
Veröffentlicht: (2023)
von: van der Laan, Lars, et al.
Veröffentlicht: (2023)
Self-Calibrating Conformal Prediction
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
Exponential Convergence Guarantees for Iterative Markovian Fitting
von: Silveri, Marta Gentiloni, et al.
Veröffentlicht: (2025)
von: Silveri, Marta Gentiloni, et al.
Veröffentlicht: (2025)
Calibeating Prediction-Powered Inference
von: van der Laan, Lars, et al.
Veröffentlicht: (2026)
von: van der Laan, Lars, et al.
Veröffentlicht: (2026)
Hybrid Meta-learners for Estimating Heterogeneous Treatment Effects
von: Liang, Zhongyuan, et al.
Veröffentlicht: (2025)
von: Liang, Zhongyuan, et al.
Veröffentlicht: (2025)
Combining T-learning and DR-learning: a framework for oracle-efficient estimation of causal contrasts
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
Finite-Time Bounds for Average-Reward Fitted Q-Iteration
von: Lee, Jongmin, et al.
Veröffentlicht: (2025)
von: Lee, Jongmin, et al.
Veröffentlicht: (2025)
Estimating Heterogeneous Treatment Effects by Combining Weak Instruments and Observational Data
von: Oprescu, Miruna, et al.
Veröffentlicht: (2024)
von: Oprescu, Miruna, et al.
Veröffentlicht: (2024)
On the role of surrogates in the efficient estimation of treatment effects with limited outcome data
von: Kallus, Nathan, et al.
Veröffentlicht: (2020)
von: Kallus, Nathan, et al.
Veröffentlicht: (2020)
Robust and Agnostic Learning of Conditional Distributional Treatment Effects
von: Kallus, Nathan, et al.
Veröffentlicht: (2022)
von: Kallus, Nathan, et al.
Veröffentlicht: (2022)
Variation Due to Regularization Tractably Recovers Bayesian Deep Learning
von: McInerney, James, et al.
Veröffentlicht: (2024)
von: McInerney, James, et al.
Veröffentlicht: (2024)
Doubly robust inference via calibration
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
Demistifying Inference after Adaptive Experiments
von: Bibaut, Aurélien, et al.
Veröffentlicht: (2024)
von: Bibaut, Aurélien, et al.
Veröffentlicht: (2024)
Stabilized Inverse Probability Weighting via Isotonic Calibration
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
von: van der Laan, Lars, et al.
Veröffentlicht: (2024)
Multi-Armed Bandits with Interference
von: Jia, Su, et al.
Veröffentlicht: (2024)
von: Jia, Su, et al.
Veröffentlicht: (2024)
LocalKMeans: Convergence of Lloyd's Algorithm with Distributed Local Iterations
von: Vardhan, Harsh, et al.
Veröffentlicht: (2025)
von: Vardhan, Harsh, et al.
Veröffentlicht: (2025)
A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration
von: Haussmann, Manuel, et al.
Veröffentlicht: (2026)
von: Haussmann, Manuel, et al.
Veröffentlicht: (2026)
Exploration in the Limit
von: Cho, Brian M., et al.
Veröffentlicht: (2025)
von: Cho, Brian M., et al.
Veröffentlicht: (2025)
Peeking with PEAK: Sequential, Nonparametric Composite Hypothesis Tests for Means of Multiple Data Streams
von: Cho, Brian, et al.
Veröffentlicht: (2024)
von: Cho, Brian, et al.
Veröffentlicht: (2024)
Robust Fitted-Q-Evaluation and Iteration under Sequentially Exogenous Unobserved Confounders
von: Bruns-Smith, David, et al.
Veröffentlicht: (2023)
von: Bruns-Smith, David, et al.
Veröffentlicht: (2023)
The Context Gathering Decision Process: A POMDP Framework for Agentic Search
von: Kausik, Chinmaya, et al.
Veröffentlicht: (2026)
von: Kausik, Chinmaya, et al.
Veröffentlicht: (2026)
Low-Rank MDPs with Continuous Action Spaces
von: Bennett, Andrew, et al.
Veröffentlicht: (2023)
von: Bennett, Andrew, et al.
Veröffentlicht: (2023)
The Central Role of the Loss Function in Reinforcement Learning
von: Wang, Kaiwen, et al.
Veröffentlicht: (2024)
von: Wang, Kaiwen, et al.
Veröffentlicht: (2024)
Is Cosine-Similarity of Embeddings Really About Similarity?
von: Steck, Harald, et al.
Veröffentlicht: (2024)
von: Steck, Harald, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting
von: van der Laan, Lars, et al.
Veröffentlicht: (2025) -
Bellman Calibration for $V$-Learning in Offline Reinforcement Learning
von: van der Laan, Lars, et al.
Veröffentlicht: (2025) -
Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models
von: van der Laan, Lars, et al.
Veröffentlicht: (2025) -
Nonparametric Instrumental Variable Inference with Many Weak Instruments
von: van der Laan, Lars, et al.
Veröffentlicht: (2025) -
Inverse Reinforcement Learning with Just Classification and a Few Regressions
von: van der Laan, Lars, et al.
Veröffentlicht: (2025)