Natural Policy Gradient for Average Reward Non-Stationary RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jali, Neharika, Pathak, Eshika, Sharma, Pranay, Qu, Guannan, Joshi, Gauri |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems
par: Jali, Neharika, et autres
Publié: (2024)
par: Jali, Neharika, et autres
Publié: (2024)
Erasure Coded Neural Network Inference via Fisher Averaging
par: Jhunjhunwala, Divyansh, et autres
Publié: (2024)
par: Jhunjhunwala, Divyansh, et autres
Publié: (2024)
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning
par: Jali, Neharika, et autres
Publié: (2026)
par: Jali, Neharika, et autres
Publié: (2026)
ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
par: Patel, Shivam, et autres
Publié: (2025)
par: Patel, Shivam, et autres
Publié: (2025)
Improving the Convergence of Private Shuffled Gradient Methods with Public Data
par: Jiang, Shuli, et autres
Publié: (2025)
par: Jiang, Shuli, et autres
Publié: (2025)
Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients
par: DeWeese, Alex, et autres
Publié: (2026)
par: DeWeese, Alex, et autres
Publié: (2026)
Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning
par: Khodadadian, Sajad, et autres
Publié: (2022)
par: Khodadadian, Sajad, et autres
Publié: (2022)
Predictive Control and Regret Analysis of Non-Stationary MDP with Look-ahead Information
par: Zhang, Ziyi, et autres
Publié: (2024)
par: Zhang, Ziyi, et autres
Publié: (2024)
Initialization Matters: Unraveling the Impact of Pre-Training on Federated Learning
par: Jhunjhunwala, Divyansh, et autres
Publié: (2025)
par: Jhunjhunwala, Divyansh, et autres
Publié: (2025)
High-probability Convergence Bounds for Nonlinear Stochastic Gradient Descent Under Heavy-tailed Noise
par: Armacki, Aleksandar, et autres
Publié: (2023)
par: Armacki, Aleksandar, et autres
Publié: (2023)
Sample Complexity of Average-Reward Q-Learning: From Single-agent to Federated Reinforcement Learning
par: Jiao, Yuchen, et autres
Publié: (2026)
par: Jiao, Yuchen, et autres
Publié: (2026)
Federated Communication-Efficient Multi-Objective Optimization
par: Askin, Baris, et autres
Publié: (2024)
par: Askin, Baris, et autres
Publié: (2024)
FedAST: Federated Asynchronous Simultaneous Training
par: Askin, Baris, et autres
Publié: (2024)
par: Askin, Baris, et autres
Publié: (2024)
Nonlinear Stochastic Gradient Descent and Heavy-tailed Noise: A Unified Framework and High-probability Guarantees
par: Armacki, Aleksandar, et autres
Publié: (2024)
par: Armacki, Aleksandar, et autres
Publié: (2024)
Internal Planning in Language Models: Characterizing Horizon and Branch Awareness
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
par: Kumar, Navdeep, et autres
Publié: (2024)
par: Kumar, Navdeep, et autres
Publié: (2024)
Debiasing Federated Learning with Correlated Client Participation
par: Sun, Zhenyu, et autres
Publié: (2024)
par: Sun, Zhenyu, et autres
Publié: (2024)
Provable Policy Gradient Methods for Average-Reward Markov Potential Games
par: Cheng, Min, et autres
Publié: (2024)
par: Cheng, Min, et autres
Publié: (2024)
Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer
par: Askin, Baris, et autres
Publié: (2026)
par: Askin, Baris, et autres
Publié: (2026)
Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
A Robust Task-Level Control Architecture for Learned Dynamical Systems
par: Pathak, Eshika, et autres
Publié: (2025)
par: Pathak, Eshika, et autres
Publié: (2025)
On-Policy RL with Optimal Reward Baseline
par: Hao, Yaru, et autres
Publié: (2025)
par: Hao, Yaru, et autres
Publié: (2025)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
par: Wang, Shengbo, et autres
Publié: (2026)
par: Wang, Shengbo, et autres
Publié: (2026)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
par: Bai, Qinbo, et autres
Publié: (2023)
par: Bai, Qinbo, et autres
Publié: (2023)
WARP: On the Benefits of Weight Averaged Rewarded Policies
par: Ramé, Alexandre, et autres
Publié: (2024)
par: Ramé, Alexandre, et autres
Publié: (2024)
Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices
par: Woo, Jiin, et autres
Publié: (2024)
par: Woo, Jiin, et autres
Publié: (2024)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
par: Bai, Qinbo, et autres
Publié: (2024)
par: Bai, Qinbo, et autres
Publié: (2024)
Partial Policy Gradients for RL in LLMs
par: Mathur, Puneet, et autres
Publié: (2026)
par: Mathur, Puneet, et autres
Publié: (2026)
Average-DICE: Stationary Distribution Correction by Regression
par: Che, Fengdi, et autres
Publié: (2025)
par: Che, Fengdi, et autres
Publié: (2025)
PubSwap: Public-Data Off-Policy Coordination for Federated RLVR
par: Nayak, Anupam, et autres
Publié: (2026)
par: Nayak, Anupam, et autres
Publié: (2026)
Functional Natural Policy Gradients
par: Bibaut, Aurelien, et autres
Publié: (2026)
par: Bibaut, Aurelien, et autres
Publié: (2026)
Span-Agnostic Optimal Sample Complexity and Oracle Inequalities for Average-Reward RL
par: Zurek, Matthew, et autres
Publié: (2025)
par: Zurek, Matthew, et autres
Publié: (2025)
Model Selection for Average Reward RL with Application to Utility Maximization in Repeated Games
par: Masoumian, Alireza, et autres
Publié: (2024)
par: Masoumian, Alireza, et autres
Publié: (2024)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
par: Wen, Xuexiang, et autres
Publié: (2026)
par: Wen, Xuexiang, et autres
Publié: (2026)
Thinking Beyond Visibility: A Near-Optimal Policy Framework for Locally Interdependent Multi-Agent MDPs
par: DeWeese, Alex, et autres
Publié: (2025)
par: DeWeese, Alex, et autres
Publié: (2025)
Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Lagrangian Index Policy for Restless Bandits with Average Reward
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
par: Avrachenkov, Konstantin, et autres
Publié: (2024)
Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
par: Xu, Peiran, et autres
Publié: (2025)
par: Xu, Peiran, et autres
Publié: (2025)
Contextual Bandits with Non-Stationary Correlated Rewards for User Association in MmWave Vehicular Networks
par: He, Xiaoyang, et autres
Publié: (2024)
par: He, Xiaoyang, et autres
Publié: (2024)
Documents similaires
-
Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems
par: Jali, Neharika, et autres
Publié: (2024) -
Erasure Coded Neural Network Inference via Fisher Averaging
par: Jhunjhunwala, Divyansh, et autres
Publié: (2024) -
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning
par: Jali, Neharika, et autres
Publié: (2026) -
ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
par: Patel, Shivam, et autres
Publié: (2025) -
Improving the Convergence of Private Shuffled Gradient Methods with Public Data
par: Jiang, Shuli, et autres
Publié: (2025)