Learning to Reason Efficiently with Discounted Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ayoub, Alex, Asadi, Kavosh, Schuurmans, Dale, Szepesvári, Csaba, Bouyarmane, Karim |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rectifying Regression in Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025)
par: Ayoub, Alex, et autres
Publié: (2025)
Adjoint sharding for very long context training of state space models
par: Xu, Xingzi, et autres
Publié: (2025)
par: Xu, Xingzi, et autres
Publié: (2025)
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
par: Liu, Shuai, et autres
Publié: (2026)
par: Liu, Shuai, et autres
Publié: (2026)
Exploration via linearly perturbed loss minimisation
par: Janz, David, et autres
Publié: (2023)
par: Janz, David, et autres
Publié: (2023)
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
par: Mei, Jincheng, et autres
Publié: (2025)
par: Mei, Jincheng, et autres
Publié: (2025)
Stochastic Gradient Succeeds for Bandits
par: Mei, Jincheng, et autres
Publié: (2024)
par: Mei, Jincheng, et autres
Publié: (2024)
Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2024)
par: Ayoub, Alex, et autres
Publié: (2024)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
par: Tkachuk, Volodymyr, et autres
Publié: (2024)
par: Tkachuk, Volodymyr, et autres
Publié: (2024)
Eluder dimension: localise it!
par: Bakhtiari, Alireza, et autres
Publié: (2026)
par: Bakhtiari, Alireza, et autres
Publié: (2026)
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
par: Liu, Shuai, et autres
Publié: (2024)
par: Liu, Shuai, et autres
Publié: (2024)
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
par: Mei, Jincheng, et autres
Publié: (2025)
par: Mei, Jincheng, et autres
Publié: (2025)
C2-DPO: Constrained Controlled Direct Preference Optimization
par: Asadi, Kavosh, et autres
Publié: (2025)
par: Asadi, Kavosh, et autres
Publié: (2025)
Plastic Learning with Deep Fourier Features
par: Lewandowski, Alex, et autres
Publié: (2024)
par: Lewandowski, Alex, et autres
Publié: (2024)
Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning
par: Zhang, Hongming, et autres
Publié: (2023)
par: Zhang, Hongming, et autres
Publié: (2023)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
par: Maran, Davide, et autres
Publié: (2026)
par: Maran, Davide, et autres
Publié: (2026)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025)
par: György, András, et autres
Publié: (2025)
LACONIC: Length-Aware Constrained Reinforcement Learning for LLM
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Learning the Target Network in Function Space
par: Asadi, Kavosh, et autres
Publié: (2024)
par: Asadi, Kavosh, et autres
Publié: (2024)
Spectral Ghost in Representation Learning: from Component Analysis to Self-Supervised Learning
par: Dai, Bo, et autres
Publié: (2026)
par: Dai, Bo, et autres
Publié: (2026)
Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation
par: Lin, Max Qiushi, et autres
Publié: (2025)
par: Lin, Max Qiushi, et autres
Publié: (2025)
Spectral Representation-based Reinforcement Learning
par: Gao, Chenxiao, et autres
Publié: (2025)
par: Gao, Chenxiao, et autres
Publié: (2025)
Sharp analysis of linear ensemble sampling
par: Akhavan, Arya, et autres
Publié: (2026)
par: Akhavan, Arya, et autres
Publié: (2026)
Reinforcement Teaching
par: Muslimani, Calarina, et autres
Publié: (2022)
par: Muslimani, Calarina, et autres
Publié: (2022)
Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences
par: Pipano, Idan, et autres
Publié: (2026)
par: Pipano, Idan, et autres
Publié: (2026)
Balancing optimism and pessimism in offline-to-online learning
par: Sentenac, Flore, et autres
Publié: (2025)
par: Sentenac, Flore, et autres
Publié: (2025)
Ensemble sampling for linear bandits: small ensembles suffice
par: Janz, David, et autres
Publié: (2023)
par: Janz, David, et autres
Publié: (2023)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
par: Tian, Tian, et autres
Publié: (2024)
par: Tian, Tian, et autres
Publié: (2024)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
par: Zhong, Han, et autres
Publié: (2021)
par: Zhong, Han, et autres
Publié: (2021)
Toward Understanding In-context vs. In-weight Learning
par: Chan, Bryan, et autres
Publié: (2024)
par: Chan, Bryan, et autres
Publié: (2024)
Rethinking the Foundations for Continual Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2025)
par: Elelimy, Esraa, et autres
Publié: (2025)
Managing Temporal Resolution in Continuous Value Estimation: A Fundamental Trade-off
par: Zhang, Zichen, et autres
Publié: (2022)
par: Zhang, Zichen, et autres
Publié: (2022)
Reinforcement Learning with Quasi-Hyperbolic Discounting
par: Eshwar, S. R., et autres
Publié: (2024)
par: Eshwar, S. R., et autres
Publié: (2024)
Learning Continually by Spectral Regularization
par: Lewandowski, Alex, et autres
Publié: (2024)
par: Lewandowski, Alex, et autres
Publié: (2024)
TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models
par: Liu, Zuxin, et autres
Publié: (2023)
par: Liu, Zuxin, et autres
Publié: (2023)
Directions of Curvature as an Explanation for Loss of Plasticity
par: Lewandowski, Alex, et autres
Publié: (2023)
par: Lewandowski, Alex, et autres
Publié: (2023)
Frontier LLMs Still Struggle with Simple Reasoning Tasks
par: Malek, Alan, et autres
Publié: (2025)
par: Malek, Alan, et autres
Publié: (2025)
Bridging the Gap Between Average and Discounted TD Learning
par: Tian, Haoxing, et autres
Publié: (2026)
par: Tian, Haoxing, et autres
Publié: (2026)
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
par: Thoppe, Gugan, et autres
Publié: (2026)
par: Thoppe, Gugan, et autres
Publié: (2026)
Decoupling Time and Risk: Risk-Sensitive Reinforcement Learning with General Discounting
par: Moghimi, Mehrdad, et autres
Publié: (2026)
par: Moghimi, Mehrdad, et autres
Publié: (2026)
Regret Minimization via Saddle Point Optimization
par: Kirschner, Johannes, et autres
Publié: (2024)
par: Kirschner, Johannes, et autres
Publié: (2024)
Documents similaires
-
Rectifying Regression in Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025) -
Adjoint sharding for very long context training of state space models
par: Xu, Xingzi, et autres
Publié: (2025) -
Learning What to Recommend: Minimax Optimal Simple Regret in Logistic Bandits
par: Liu, Shuai, et autres
Publié: (2026) -
Exploration via linearly perturbed loss minimisation
par: Janz, David, et autres
Publié: (2023) -
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
par: Mei, Jincheng, et autres
Publié: (2025)