Breaking the Bias Barrier in Concave Multi-Objective Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ganesh, Swetha, Aggarwal, Vaneet |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
par: Ganesh, Swetha, et autres
Publié: (2025)
par: Ganesh, Swetha, et autres
Publié: (2025)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic Approach
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm
par: Bai, Qinbo, et autres
Publié: (2021)
par: Bai, Qinbo, et autres
Publié: (2021)
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
par: Aggarwal, Vaneet, et autres
Publié: (2024)
par: Aggarwal, Vaneet, et autres
Publié: (2024)
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
par: Saxena, Naman, et autres
Publié: (2026)
par: Saxena, Naman, et autres
Publié: (2026)
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
Distributionally Robust Self Paced Curriculum Reinforcement Learning
par: Satheesh, Anirudh, et autres
Publié: (2025)
par: Satheesh, Anirudh, et autres
Publié: (2025)
Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Mean-Field Approximation of Cooperative Constrained Multi-Agent Reinforcement Learning (CMARL)
par: Mondal, Washim Uddin, et autres
Publié: (2022)
par: Mondal, Washim Uddin, et autres
Publié: (2022)
Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
par: Satheesh, Anirudh, et autres
Publié: (2026)
par: Satheesh, Anirudh, et autres
Publié: (2026)
Lipschitz Dueling Bandits over Continuous Action Spaces
par: Sharma, Mudit, et autres
Publié: (2026)
par: Sharma, Mudit, et autres
Publié: (2026)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
par: Moradipari, Ahmadreza, et autres
Publié: (2023)
par: Moradipari, Ahmadreza, et autres
Publié: (2023)
Contrastive Cross-Modal Learning for Infusing Chest X-ray Knowledge into ECGs
par: Punyamoorty, Vineet, et autres
Publié: (2025)
par: Punyamoorty, Vineet, et autres
Publié: (2025)
Variational Offline Multi-agent Skill Discovery
par: Chen, Jiayu, et autres
Publié: (2024)
par: Chen, Jiayu, et autres
Publié: (2024)
Persistent-Transient Policy Evaluation for Markov Chains via Minimal Peripheral Quotients
par: Xu, Yang, et autres
Publié: (2026)
par: Xu, Yang, et autres
Publié: (2026)
A Unified Framework for Analyzing Meta-algorithms in Online Convex Optimization
par: Pedramfar, Mohammad, et autres
Publié: (2024)
par: Pedramfar, Mohammad, et autres
Publié: (2024)
Improving Molecule Generation and Drug Discovery with a Knowledge-enhanced Generative Model
par: Malusare, Aditya, et autres
Publié: (2024)
par: Malusare, Aditya, et autres
Publié: (2024)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
par: Bai, Qinbo, et autres
Publié: (2022)
par: Bai, Qinbo, et autres
Publié: (2022)
Multi-Agent Combinatorial-Multi-Armed-Bandit framework for the Submodular Welfare Problem under Bandit Feedback
par: Pokhriyal, Subham, et autres
Publié: (2026)
par: Pokhriyal, Subham, et autres
Publié: (2026)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
par: Gaur, Mudit, et autres
Publié: (2025)
par: Gaur, Mudit, et autres
Publié: (2025)
$γ$-weakly $θ$-up-concavity: A Unified Framework for Non-Convex Optimization Beyond DR-Submodular and OSS Functions
par: Pedramfar, Mohammad, et autres
Publié: (2026)
par: Pedramfar, Mohammad, et autres
Publié: (2026)
From Linear to Linearizable Optimization: A Novel Framework with Applications to Stationary and Non-stationary DR-submodular Optimization
par: Pedramfar, Mohammad, et autres
Publié: (2024)
par: Pedramfar, Mohammad, et autres
Publié: (2024)
AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers
par: Grigsby, Jake, et autres
Publié: (2024)
par: Grigsby, Jake, et autres
Publié: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
par: Mondal, Washim Uddin, et autres
Publié: (2023)
par: Mondal, Washim Uddin, et autres
Publié: (2023)
Stochastic Submodular Bandits with Delayed Composite Anonymous Bandit Feedback
par: Pedramfar, Mohammad, et autres
Publié: (2023)
par: Pedramfar, Mohammad, et autres
Publié: (2023)
Oracle-Robust Online Alignment for Large Language Models
par: Li, Zimeng, et autres
Publié: (2026)
par: Li, Zimeng, et autres
Publié: (2026)
Hierarchical Deep Counterfactual Regret Minimization
par: Chen, Jiayu, et autres
Publié: (2023)
par: Chen, Jiayu, et autres
Publié: (2023)
Federated Combinatorial Multi-Agent Multi-Armed Bandits
par: Fourati, Fares, et autres
Publié: (2024)
par: Fourati, Fares, et autres
Publié: (2024)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
par: Bai, Qinbo, et autres
Publié: (2024)
par: Bai, Qinbo, et autres
Publié: (2024)
Discrete State Diffusion Models: A Sample Complexity Perspective
par: Srikanth, Aadithya, et autres
Publié: (2025)
par: Srikanth, Aadithya, et autres
Publié: (2025)
Cross Layer Optimization and Distributed Reinforcement Learning for Wireless 360° Video Streaming
par: Elgabli, Anis, et autres
Publié: (2020)
par: Elgabli, Anis, et autres
Publié: (2020)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
par: Zhang, Jiefu, et autres
Publié: (2026)
par: Zhang, Jiefu, et autres
Publié: (2026)
Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs
par: Tan, Kevin, et autres
Publié: (2024)
par: Tan, Kevin, et autres
Publié: (2024)
Documents similaires
-
Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
par: Ganesh, Swetha, et autres
Publié: (2025) -
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
par: Xu, Yang, et autres
Publié: (2025) -
A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic Approach
par: Ganesh, Swetha, et autres
Publié: (2024) -
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
par: Ganesh, Swetha, et autres
Publié: (2024) -
Joint Optimization of Multi-Objective Reinforcement Learning with Policy Gradient Based Algorithm
par: Bai, Qinbo, et autres
Publié: (2021)