Sample-efficient Learning of Infinite-horizon Average-reward MDPs with General Function Approximation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Jianliang, Zhong, Han, Yang, Zhuoran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
von: Hong, Kihyuk, et al.
Veröffentlicht: (2024)
von: Hong, Kihyuk, et al.
Veröffentlicht: (2024)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
von: Panda, Prashansa, et al.
Veröffentlicht: (2024)
von: Panda, Prashansa, et al.
Veröffentlicht: (2024)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
von: Zhong, Han, et al.
Veröffentlicht: (2021)
von: Zhong, Han, et al.
Veröffentlicht: (2021)
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
von: Chae, Woojin, et al.
Veröffentlicht: (2024)
von: Chae, Woojin, et al.
Veröffentlicht: (2024)
Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs
von: Wei, Yukuan, et al.
Veröffentlicht: (2025)
von: Wei, Yukuan, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Partial Observation: Linear Function Approximation with Provable Sample Efficiency
von: Cai, Qi, et al.
Veröffentlicht: (2022)
von: Cai, Qi, et al.
Veröffentlicht: (2022)
A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs
von: Hong, Kihyuk, et al.
Veröffentlicht: (2025)
von: Hong, Kihyuk, et al.
Veröffentlicht: (2025)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
von: Ganesh, Swetha, et al.
Veröffentlicht: (2024)
von: Ganesh, Swetha, et al.
Veröffentlicht: (2024)
In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention
von: He, Jianliang, et al.
Veröffentlicht: (2025)
von: He, Jianliang, et al.
Veröffentlicht: (2025)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
von: Bai, Qinbo, et al.
Veröffentlicht: (2024)
von: Bai, Qinbo, et al.
Veröffentlicht: (2024)
Planning and Learning in Average Risk-aware MDPs
von: Wang, Weikai, et al.
Veröffentlicht: (2025)
von: Wang, Weikai, et al.
Veröffentlicht: (2025)
Risk-averse Total-reward MDPs with ERM and EVaR
von: Su, Xihong, et al.
Veröffentlicht: (2024)
von: Su, Xihong, et al.
Veröffentlicht: (2024)
On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking
von: He, Jianliang, et al.
Veröffentlicht: (2026)
von: He, Jianliang, et al.
Veröffentlicht: (2026)
Provably Efficient Infinite-Horizon Average-Reward Reinforcement Learning with Linear Function Approximation
von: Chae, Woojin, et al.
Veröffentlicht: (2024)
von: Chae, Woojin, et al.
Veröffentlicht: (2024)
Span-Based Optimal Sample Complexity for Average Reward MDPs
von: Zurek, Matthew, et al.
Veröffentlicht: (2023)
von: Zurek, Matthew, et al.
Veröffentlicht: (2023)
EVAL: EigenVector-based Average-reward Learning
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2025)
von: Adamczyk, Jacob, et al.
Veröffentlicht: (2025)
Span-Based Optimal Sample Complexity for Weakly Communicating and General Average Reward MDPs
von: Zurek, Matthew, et al.
Veröffentlicht: (2024)
von: Zurek, Matthew, et al.
Veröffentlicht: (2024)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
von: Qi, Han, et al.
Veröffentlicht: (2025)
von: Qi, Han, et al.
Veröffentlicht: (2025)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
von: Levy, Orin, et al.
Veröffentlicht: (2026)
von: Levy, Orin, et al.
Veröffentlicht: (2026)
Is Pure Exploitation Sufficient in Exogenous MDPs with Linear Function Approximation?
von: Liang, Hao, et al.
Veröffentlicht: (2026)
von: Liang, Hao, et al.
Veröffentlicht: (2026)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
von: Satheesh, Anirudh, et al.
Veröffentlicht: (2026)
von: Satheesh, Anirudh, et al.
Veröffentlicht: (2026)
From Words to Actions: Unveiling the Theoretical Underpinnings of LLM-Driven Autonomous Systems
von: He, Jianliang, et al.
Veröffentlicht: (2024)
von: He, Jianliang, et al.
Veröffentlicht: (2024)
Sample Complexity Bounds for Linear Constrained MDPs with a Generative Model
von: Liu, Xingtu, et al.
Veröffentlicht: (2025)
von: Liu, Xingtu, et al.
Veröffentlicht: (2025)
The Plug-in Approach for Average-Reward and Discounted MDPs: Optimal Sample Complexity Analysis
von: Zurek, Matthew, et al.
Veröffentlicht: (2024)
von: Zurek, Matthew, et al.
Veröffentlicht: (2024)
Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
von: Satheesh, Anirudh, et al.
Veröffentlicht: (2026)
von: Satheesh, Anirudh, et al.
Veröffentlicht: (2026)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
von: Mhammedi, Zakaria
Veröffentlicht: (2024)
von: Mhammedi, Zakaria
Veröffentlicht: (2024)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
von: Zhang, Runyu, et al.
Veröffentlicht: (2023)
von: Zhang, Runyu, et al.
Veröffentlicht: (2023)
VISA: Variational Inference with Sequential Sample-Average Approximations
von: Zimmermann, Heiko, et al.
Veröffentlicht: (2024)
von: Zimmermann, Heiko, et al.
Veröffentlicht: (2024)
Near-Optimal Sample Complexity for Online Constrained MDPs
von: Liu, Chang, et al.
Veröffentlicht: (2026)
von: Liu, Chang, et al.
Veröffentlicht: (2026)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
Infinite-Horizon Reinforcement Learning with Multinomial Logistic Function Approximation
von: Park, Jaehyun, et al.
Veröffentlicht: (2024)
von: Park, Jaehyun, et al.
Veröffentlicht: (2024)
Communication-efficient Federated Graph Classification via Generative Diffusion Modeling
von: Wang, Xiuling, et al.
Veröffentlicht: (2026)
von: Wang, Xiuling, et al.
Veröffentlicht: (2026)
Truly No-Regret Learning in Constrained MDPs
von: Müller, Adrian, et al.
Veröffentlicht: (2024)
von: Müller, Adrian, et al.
Veröffentlicht: (2024)
Convergence of Natural Policy Gradient for a Family of Infinite-State Queueing MDPs
von: Grosof, Isaac, et al.
Veröffentlicht: (2024)
von: Grosof, Isaac, et al.
Veröffentlicht: (2024)
Sample Weight Averaging for Stable Prediction
von: Yu, Han, et al.
Veröffentlicht: (2025)
von: Yu, Han, et al.
Veröffentlicht: (2025)
Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation
von: Kitamura, Toshinori, et al.
Veröffentlicht: (2025)
von: Kitamura, Toshinori, et al.
Veröffentlicht: (2025)
ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints
von: Agnihotri, Akhil, et al.
Veröffentlicht: (2023)
von: Agnihotri, Akhil, et al.
Veröffentlicht: (2023)
Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs
von: Tan, Kevin, et al.
Veröffentlicht: (2024)
von: Tan, Kevin, et al.
Veröffentlicht: (2024)
Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
von: Ganesh, Swetha, et al.
Veröffentlicht: (2025)
von: Ganesh, Swetha, et al.
Veröffentlicht: (2025)
Reducing Blackwell and Average Optimality to Discounted MDPs via the Blackwell Discount Factor
von: Grand-Clément, Julien, et al.
Veröffentlicht: (2023)
von: Grand-Clément, Julien, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
von: Hong, Kihyuk, et al.
Veröffentlicht: (2024) -
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
von: Panda, Prashansa, et al.
Veröffentlicht: (2024) -
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
von: Zhong, Han, et al.
Veröffentlicht: (2021) -
Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span
von: Chae, Woojin, et al.
Veröffentlicht: (2024) -
Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs
von: Wei, Yukuan, et al.
Veröffentlicht: (2025)