More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Kaiwen, Oertell, Owen, Agarwal, Alekh, Kallus, Nathan, Sun, Wen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Central Role of the Loss Function in Reinforcement Learning
par: Wang, Kaiwen, et autres
Publié: (2024)
par: Wang, Kaiwen, et autres
Publié: (2024)
A Reductions Approach to Risk-Sensitive Reinforcement Learning with Optimized Certainty Equivalents
par: Wang, Kaiwen, et autres
Publié: (2024)
par: Wang, Kaiwen, et autres
Publié: (2024)
Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling
par: Agarwal, Alekh, et autres
Publié: (2022)
par: Agarwal, Alekh, et autres
Publié: (2022)
Convergence Of Consistency Model With Multistep Sampling Under General Data Assumptions
par: Chen, Yiding, et autres
Publié: (2025)
par: Chen, Yiding, et autres
Publié: (2025)
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
par: Bennett, Andrew, et autres
Publié: (2024)
par: Bennett, Andrew, et autres
Publié: (2024)
Robust and Agnostic Learning of Conditional Distributional Treatment Effects
par: Kallus, Nathan, et autres
Publié: (2022)
par: Kallus, Nathan, et autres
Publié: (2022)
Bellman Calibration for $V$-Learning in Offline Reinforcement Learning
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
LLMs Can Learn to Reason Via Off-Policy RL
par: Ritter, Daniel, et autres
Publié: (2026)
par: Ritter, Daniel, et autres
Publié: (2026)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2024)
par: Ayoub, Alex, et autres
Publié: (2024)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
par: Swamy, Gokul, et autres
Publié: (2024)
par: Swamy, Gokul, et autres
Publié: (2024)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
par: Kallus, Nathan
Publié: (2025)
par: Kallus, Nathan
Publié: (2025)
Efficient Controllable Diffusion via Optimal Classifier Guidance
par: Oertell, Owen, et autres
Publié: (2025)
par: Oertell, Owen, et autres
Publié: (2025)
Variation Due to Regularization Tractably Recovers Bayesian Deep Learning
par: McInerney, James, et autres
Publié: (2024)
par: McInerney, James, et autres
Publié: (2024)
Efficient Inference for Inverse Reinforcement Learning and Dynamic Discrete Choice Models
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
Model-based RL as a Minimalist Approach to Horizon-Free and Second-Order Bounds
par: Wang, Zhiyong, et autres
Publié: (2024)
par: Wang, Zhiyong, et autres
Publié: (2024)
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
par: Zhou, Jin Peng, et autres
Publié: (2025)
par: Zhou, Jin Peng, et autres
Publié: (2025)
Inverse Reinforcement Learning with Just Classification and a Few Regressions
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
Offline Imitation Learning from Multiple Baselines with Applications to Compiler Optimization
par: Marinov, Teodor V., et autres
Publié: (2024)
par: Marinov, Teodor V., et autres
Publié: (2024)
Estimating Heterogeneous Treatment Effects by Combining Weak Instruments and Observational Data
par: Oprescu, Miruna, et autres
Publié: (2024)
par: Oprescu, Miruna, et autres
Publié: (2024)
On the role of surrogates in the efficient estimation of treatment effects with limited outcome data
par: Kallus, Nathan, et autres
Publié: (2020)
par: Kallus, Nathan, et autres
Publié: (2020)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
par: Oertell, Owen, et autres
Publié: (2024)
par: Oertell, Owen, et autres
Publié: (2024)
Reward Transfer from Inverse Reinforcement Learning: A Coupled Minimax Approach
par: Hao, Guang-Yuan, et autres
Publié: (2026)
par: Hao, Guang-Yuan, et autres
Publié: (2026)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
par: Wang, Kaiwen, et autres
Publié: (2025)
par: Wang, Kaiwen, et autres
Publié: (2025)
Preserving Expert-Level Privacy in Offline Reinforcement Learning
par: Sharma, Navodita, et autres
Publié: (2024)
par: Sharma, Navodita, et autres
Publié: (2024)
DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning
par: Zhao, Hanyang, et autres
Publié: (2025)
par: Zhao, Hanyang, et autres
Publié: (2025)
Semiparametric Double Reinforcement Learning with Applications to Long-Term Causal Inference
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
par: Ye, Chenlu, et autres
Publié: (2025)
par: Ye, Chenlu, et autres
Publié: (2025)
Design Considerations in Offline Preference-based RL
par: Agarwal, Alekh, et autres
Publié: (2025)
par: Agarwal, Alekh, et autres
Publié: (2025)
Demistifying Inference after Adaptive Experiments
par: Bibaut, Aurélien, et autres
Publié: (2024)
par: Bibaut, Aurélien, et autres
Publié: (2024)
REBEL: Reinforcement Learning via Regressing Relative Rewards
par: Gao, Zhaolin, et autres
Publié: (2024)
par: Gao, Zhaolin, et autres
Publié: (2024)
Intrinsic Benefits of Categorical Distributional Loss: Uncertainty-aware Regularized Exploration in Reinforcement Learning
par: Sun, Ke, et autres
Publié: (2021)
par: Sun, Ke, et autres
Publié: (2021)
Multi-Armed Bandits with Interference
par: Jia, Su, et autres
Publié: (2024)
par: Jia, Su, et autres
Publié: (2024)
Stationary Reweighting Yields Local Convergence of Soft Fitted Q-Iteration
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
Fitted $Q$ Evaluation Without Bellman Completeness via Stationary Weighting
par: van der Laan, Lars, et autres
Publié: (2025)
par: van der Laan, Lars, et autres
Publié: (2025)
TurboHopp: Accelerated Molecule Scaffold Hopping with Consistency Models
par: Yoo, Kiwoong, et autres
Publié: (2024)
par: Yoo, Kiwoong, et autres
Publié: (2024)
Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models
par: Belenki, Lior, et autres
Publié: (2025)
par: Belenki, Lior, et autres
Publié: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
par: Gupta, Dhawal, et autres
Publié: (2025)
par: Gupta, Dhawal, et autres
Publié: (2025)
Exploration in the Limit
par: Cho, Brian M., et autres
Publié: (2025)
par: Cho, Brian M., et autres
Publié: (2025)
Peeking with PEAK: Sequential, Nonparametric Composite Hypothesis Tests for Means of Multiple Data Streams
par: Cho, Brian, et autres
Publié: (2024)
par: Cho, Brian, et autres
Publié: (2024)
Entropy After </Think> for reasoning model early exiting
par: Wang, Xi, et autres
Publié: (2025)
par: Wang, Xi, et autres
Publié: (2025)
Documents similaires
-
The Central Role of the Loss Function in Reinforcement Learning
par: Wang, Kaiwen, et autres
Publié: (2024) -
A Reductions Approach to Risk-Sensitive Reinforcement Learning with Optimized Certainty Equivalents
par: Wang, Kaiwen, et autres
Publié: (2024) -
Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling
par: Agarwal, Alekh, et autres
Publié: (2022) -
Convergence Of Consistency Model With Multistep Sampling Under General Data Assumptions
par: Chen, Yiding, et autres
Publié: (2025) -
Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes
par: Bennett, Andrew, et autres
Publié: (2024)