The Power of Resets in Online Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mhammedi, Zakaria, Foster, Dylan J., Rakhlin, Alexander |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration
di: Foster, Dylan J., et al.
Pubblicazione: (2025)
di: Foster, Dylan J., et al.
Pubblicazione: (2025)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
di: Mhammedi, Zakaria
Pubblicazione: (2024)
di: Mhammedi, Zakaria
Pubblicazione: (2024)
Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity
di: Amortila, Philip, et al.
Pubblicazione: (2024)
di: Amortila, Philip, et al.
Pubblicazione: (2024)
Efficient Model-Free Exploration in Low-Rank MDPs
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
End-to-End Efficient RL for Linear Bellman Complete MDPs with Deterministic Transitions
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2026)
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2026)
Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits
di: Chen, Fan, et al.
Pubblicazione: (2025)
di: Chen, Fan, et al.
Pubblicazione: (2025)
Online Convex Optimization with a Separation Oracle
di: Mhammedi, Zakaria
Pubblicazione: (2024)
di: Mhammedi, Zakaria
Pubblicazione: (2024)
Fully Unconstrained Online Learning
di: Cutkosky, Ashok, et al.
Pubblicazione: (2024)
di: Cutkosky, Ashok, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
di: Jia, Zeyu, et al.
Pubblicazione: (2024)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
Decision Making in Changing Environments: Robustness, Query-Based Learning, and Differential Privacy
di: Chen, Fan, et al.
Pubblicazione: (2025)
di: Chen, Fan, et al.
Pubblicazione: (2025)
Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective
di: Jia, Zeyu, et al.
Pubblicazione: (2025)
di: Jia, Zeyu, et al.
Pubblicazione: (2025)
Reset & Distill: A Recipe for Overcoming Negative Transfer in Continual Reinforcement Learning
di: Ahn, Hongjoon, et al.
Pubblicazione: (2024)
di: Ahn, Hongjoon, et al.
Pubblicazione: (2024)
Online Estimation via Offline Estimation: An Information-Theoretic Framework
di: Foster, Dylan J., et al.
Pubblicazione: (2024)
di: Foster, Dylan J., et al.
Pubblicazione: (2024)
Self-Normalized Resets for Plasticity in Continual Learning
di: Farias, Vivek F., et al.
Pubblicazione: (2024)
di: Farias, Vivek F., et al.
Pubblicazione: (2024)
Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning
di: Foster, Dylan J., et al.
Pubblicazione: (2024)
di: Foster, Dylan J., et al.
Pubblicazione: (2024)
Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2026)
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2026)
A Reinforcement Learning based Reset Policy for CDCL SAT Solvers
di: Li, Chunxiao, et al.
Pubblicazione: (2024)
di: Li, Chunxiao, et al.
Pubblicazione: (2024)
Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers
di: Yan, Kai, et al.
Pubblicazione: (2024)
di: Yan, Kai, et al.
Pubblicazione: (2024)
Near-Optimal Learning and Planning in Separated Latent MDPs
di: Chen, Fan, et al.
Pubblicazione: (2024)
di: Chen, Fan, et al.
Pubblicazione: (2024)
On the Role of DAG topology in Energy-Aware Cloud Scheduling : A GNN-Based Deep Reinforcement Learning Approach
di: Hattay, Anas, et al.
Pubblicazione: (2026)
di: Hattay, Anas, et al.
Pubblicazione: (2026)
GaussMark: A Practical Approach for Structural Watermarking of Language Models
di: Block, Adam, et al.
Pubblicazione: (2025)
di: Block, Adam, et al.
Pubblicazione: (2025)
Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset
di: Galashov, Alexandre, et al.
Pubblicazione: (2024)
di: Galashov, Alexandre, et al.
Pubblicazione: (2024)
Representation-Based Exploration for Language Models: From Test-Time to Post-Training
di: Tuyls, Jens, et al.
Pubblicazione: (2025)
di: Tuyls, Jens, et al.
Pubblicazione: (2025)
Amortized Active Causal Induction with Deep Reinforcement Learning
di: Annadani, Yashas, et al.
Pubblicazione: (2024)
di: Annadani, Yashas, et al.
Pubblicazione: (2024)
Intelligent Switching for Reset-Free RL
di: Patil, Darshan, et al.
Pubblicazione: (2024)
di: Patil, Darshan, et al.
Pubblicazione: (2024)
Adaptive Matrix Online Learning through Smoothing with Guarantees for Nonsmooth Nonconvex Optimization
di: Jiang, Ruichen, et al.
Pubblicazione: (2026)
di: Jiang, Ruichen, et al.
Pubblicazione: (2026)
Online Reinforcement Learning with Passive Memory
di: Pattanaik, Anay, et al.
Pubblicazione: (2024)
di: Pattanaik, Anay, et al.
Pubblicazione: (2024)
Stackelberg Coupling of Online Representation Learning and Reinforcement Learning
di: Martinez, Fernando, et al.
Pubblicazione: (2025)
di: Martinez, Fernando, et al.
Pubblicazione: (2025)
Kolmogorov-Arnold Network for Online Reinforcement Learning
di: Kich, Victor Augusto, et al.
Pubblicazione: (2024)
di: Kich, Victor Augusto, et al.
Pubblicazione: (2024)
Online Optimization for Offline Safe Reinforcement Learning
di: Chemingui, Yassine, et al.
Pubblicazione: (2025)
di: Chemingui, Yassine, et al.
Pubblicazione: (2025)
Flow-Based Policy for Online Reinforcement Learning
di: Lv, Lei, et al.
Pubblicazione: (2025)
di: Lv, Lei, et al.
Pubblicazione: (2025)
Controllable Flow Matching for Online Reinforcement Learning
di: Wang, Bin, et al.
Pubblicazione: (2025)
di: Wang, Bin, et al.
Pubblicazione: (2025)
The Three Regimes of Offline-to-Online Reinforcement Learning
di: Li, Lu, et al.
Pubblicazione: (2025)
di: Li, Lu, et al.
Pubblicazione: (2025)
Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
di: Yuan, Yurun, et al.
Pubblicazione: (2025)
A New View on Planning in Online Reinforcement Learning
di: Roice, Kevin, et al.
Pubblicazione: (2024)
di: Roice, Kevin, et al.
Pubblicazione: (2024)
Continual Reinforcement Learning by Planning with Online World Models
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner
di: Ma, Hao, et al.
Pubblicazione: (2026)
di: Ma, Hao, et al.
Pubblicazione: (2026)
Adaptive Replay Buffer for Offline-to-Online Reinforcement Learning
di: Song, Chihyeon, et al.
Pubblicazione: (2025)
di: Song, Chihyeon, et al.
Pubblicazione: (2025)
Discrete Flow Matching for Offline-to-Online Reinforcement Learning
di: Khan, Fairoz Nower, et al.
Pubblicazione: (2026)
di: Khan, Fairoz Nower, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration
di: Foster, Dylan J., et al.
Pubblicazione: (2025) -
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
di: Mhammedi, Zakaria
Pubblicazione: (2024) -
Reinforcement Learning under Latent Dynamics: Toward Statistical and Algorithmic Modularity
di: Amortila, Philip, et al.
Pubblicazione: (2024) -
Efficient Model-Free Exploration in Low-Rank MDPs
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023) -
End-to-End Efficient RL for Linear Bellman Complete MDPs with Deterministic Transitions
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2026)