Provably Efficient Algorithms for S- and Non-Rectangular Robust MDPs with General Parameterization
Fuente:
arXiv
Salvato in:
| Autori principali: | Satheesh, Anirudh, Chen, Ziyi, Huang, Furong, Huang, Heng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Policy Gradient Algorithms for Robust MDPs with Non-Rectangular Uncertainty Sets
di: Li, Mengmeng, et al.
Pubblicazione: (2023)
di: Li, Mengmeng, et al.
Pubblicazione: (2023)
Solving Non-Rectangular Reward-Robust MDPs via Frequency Regularization
di: Gadot, Uri, et al.
Pubblicazione: (2023)
di: Gadot, Uri, et al.
Pubblicazione: (2023)
Compositional Adversarial Training for Robust Visual Watermarking
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
SAFLEX: Self-Adaptive Augmentation via Feature Label Extrapolation
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs
di: Huang, Ruiquan, et al.
Pubblicazione: (2026)
di: Huang, Ruiquan, et al.
Pubblicazione: (2026)
Distributionally Robust Self Paced Curriculum Reinforcement Learning
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
di: Agrawal, Aakriti, et al.
Pubblicazione: (2024)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2024)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
Provably Faster Algorithms for Bilevel Optimization via Without-Replacement Sampling
di: Li, Junyi, et al.
Pubblicazione: (2024)
di: Li, Junyi, et al.
Pubblicazione: (2024)
Rethinking Adversarial Policies: A Generalized Attack Formulation and Provable Defense in RL
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
di: Liu, Xiangyu, et al.
Pubblicazione: (2023)
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
di: Roknilamouki, Amirhossein, et al.
Pubblicazione: (2025)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
A Constrained Multi-Agent Reinforcement Learning Approach to Autonomous Traffic Signal Control
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
PICore: Physics-Informed Unsupervised Coreset Selection for Data Efficient Neural Operator Training
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Bring Your Own (Non-Robust) Algorithm to Solve Robust MDPs by Estimating The Worst Kernel
di: Wang, Kaixin, et al.
Pubblicazione: (2023)
di: Wang, Kaixin, et al.
Pubblicazione: (2023)
Efficient Algorithms for Robust Markov Decision Processes with $s$-Rectangular Ambiguity Sets
di: Ho, Chin Pang, et al.
Pubblicazione: (2026)
di: Ho, Chin Pang, et al.
Pubblicazione: (2026)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Provably Efficient UCB-type Algorithms For Learning Predictive State Representations
di: Huang, Ruiquan, et al.
Pubblicazione: (2023)
di: Huang, Ruiquan, et al.
Pubblicazione: (2023)
Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation
di: Kitamura, Toshinori, et al.
Pubblicazione: (2025)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2025)
Rectified Robust Policy Optimization for Model-Uncertain Constrained Reinforcement Learning without Strong Duality
di: Ma, Shaocong, et al.
Pubblicazione: (2025)
di: Ma, Shaocong, et al.
Pubblicazione: (2025)
Achieve Performatively Optimal Policy for Performative Reinforcement Learning
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
di: Chen, Ziyi, et al.
Pubblicazione: (2025)
cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
Efficient Solution and Learning of Robust Factored MDPs
di: Schnitzer, Yannik, et al.
Pubblicazione: (2025)
di: Schnitzer, Yannik, et al.
Pubblicazione: (2025)
ElliCE: Efficient and Provably Robust Algorithmic Recourse via the Rashomon Sets
di: Turbal, Bohdan, et al.
Pubblicazione: (2026)
di: Turbal, Bohdan, et al.
Pubblicazione: (2026)
Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs
di: Kash, Ian A., et al.
Pubblicazione: (2022)
di: Kash, Ian A., et al.
Pubblicazione: (2022)
Beyond Worst-case Attacks: Robust RL with Adaptive Defense via Non-dominated Policies
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
di: Liu, Xiangyu, et al.
Pubblicazione: (2024)
Distributionally Robust Multi-Objective Optimization
di: Yang, Yufeng, et al.
Pubblicazione: (2026)
di: Yang, Yufeng, et al.
Pubblicazione: (2026)
HomeAdam: Adam and AdamW Algorithms Sometimes Go Home to Obtain Better Provable Generalization
di: Huang, Feihu, et al.
Pubblicazione: (2026)
di: Huang, Feihu, et al.
Pubblicazione: (2026)
Time-Constrained Robust MDPs
di: Zouitine, Adil, et al.
Pubblicazione: (2024)
di: Zouitine, Adil, et al.
Pubblicazione: (2024)
Efficient Duple Perturbation Robustness in Low-rank MDPs
di: Hu, Yang, et al.
Pubblicazione: (2024)
di: Hu, Yang, et al.
Pubblicazione: (2024)
Provable Offline Reinforcement Learning for Structured Cyclic MDPs
di: Lee, Kyungbok, et al.
Pubblicazione: (2026)
di: Lee, Kyungbok, et al.
Pubblicazione: (2026)
Provably Efficient Partially Observable Risk-Sensitive Reinforcement Learning with Hindsight Observation
di: Zhang, Tonghe, et al.
Pubblicazione: (2024)
di: Zhang, Tonghe, et al.
Pubblicazione: (2024)
Dual Formulation for Non-Rectangular Lp Robust Markov Decision Processes
di: Kumar, Navdeep, et al.
Pubblicazione: (2025)
di: Kumar, Navdeep, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026) -
Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026) -
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025) -
Policy Gradient Algorithms for Robust MDPs with Non-Rectangular Uncertainty Sets
di: Li, Mengmeng, et al.
Pubblicazione: (2023) -
Solving Non-Rectangular Reward-Robust MDPs via Frequency Regularization
di: Gadot, Uri, et al.
Pubblicazione: (2023)