Narrowing the Gap between Adversarial and Stochastic MDPs via Policy Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Tiapkin, Daniil, Chzhen, Evgenii, Stoltz, Gilles |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Policy Optimization via Adv2: Adversarial Learning on Advantage Functions
di: Jonckheere, Matthieu, et al.
Pubblicazione: (2023)
di: Jonckheere, Matthieu, et al.
Pubblicazione: (2023)
Optimizing Backward Policies in GFlowNets via Trajectory Likelihood Maximization
di: Gritsaev, Timofei, et al.
Pubblicazione: (2024)
di: Gritsaev, Timofei, et al.
Pubblicazione: (2024)
Regression under demographic parity constraints via unlabeled post-processing
di: Chzhen, Evgenii, et al.
Pubblicazione: (2024)
di: Chzhen, Evgenii, et al.
Pubblicazione: (2024)
Randomized multi-class classification under system constraints: a unified approach via post-processing
di: Chzhen, Evgenii, et al.
Pubblicazione: (2025)
di: Chzhen, Evgenii, et al.
Pubblicazione: (2025)
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
di: Mignacco, Chiara, et al.
Pubblicazione: (2025)
di: Mignacco, Chiara, et al.
Pubblicazione: (2025)
On Global Convergence Rates for Federated Softmax Policy Gradient under Heterogeneous Environments
di: Labbi, Safwan, et al.
Pubblicazione: (2025)
di: Labbi, Safwan, et al.
Pubblicazione: (2025)
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games
di: Ocello, Antonio, et al.
Pubblicazione: (2025)
di: Ocello, Antonio, et al.
Pubblicazione: (2025)
Learning Adversarial MDPs with Stochastic Hard Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Revisiting Non-Acyclic GFlowNets in Discrete Environments
di: Morozov, Nikita, et al.
Pubblicazione: (2025)
di: Morozov, Nikita, et al.
Pubblicazione: (2025)
Refined Analysis of Entropy-Regularized Actor-Critic
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
Generative Flow Networks as Entropy-Regularized RL
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
Improving Feasibility via Fast Autoencoder-Based Projections
di: Chzhen, Maria, et al.
Pubblicazione: (2026)
di: Chzhen, Maria, et al.
Pubblicazione: (2026)
Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback
di: Ito, Shinji, et al.
Pubblicazione: (2025)
di: Ito, Shinji, et al.
Pubblicazione: (2025)
Learning Shortest Paths with Generative Flow Networks
di: Morozov, Nikita, et al.
Pubblicazione: (2026)
di: Morozov, Nikita, et al.
Pubblicazione: (2026)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Improved High-Probability Bounds for the Temporal Difference Learning Algorithm via Exponential Stability
di: Samsonov, Sergey, et al.
Pubblicazione: (2023)
di: Samsonov, Sergey, et al.
Pubblicazione: (2023)
Federated UCBVI: Communication-Efficient Federated Regret Minimization with Heterogeneous Agents
di: Labbi, Safwan, et al.
Pubblicazione: (2024)
di: Labbi, Safwan, et al.
Pubblicazione: (2024)
Blackwell's Approachability for Sequential Conformal Inference
di: Principato, Guillaume, et al.
Pubblicazione: (2025)
di: Principato, Guillaume, et al.
Pubblicazione: (2025)
Narrowing Class-Wise Robustness Gaps in Adversarial Training
di: Amerehi, Fatemeh, et al.
Pubblicazione: (2025)
di: Amerehi, Fatemeh, et al.
Pubblicazione: (2025)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
Improving GFlowNets with Monte Carlo Tree Search
di: Morozov, Nikita, et al.
Pubblicazione: (2024)
di: Morozov, Nikita, et al.
Pubblicazione: (2024)
Bayesian Risk-Sensitive Policy Optimization For MDPs With General Loss Functions
di: Wang, Xiaoshuang, et al.
Pubblicazione: (2025)
di: Wang, Xiaoshuang, et al.
Pubblicazione: (2025)
Eluder-based Regret for Stochastic Contextual MDPs
di: Levy, Orin, et al.
Pubblicazione: (2022)
di: Levy, Orin, et al.
Pubblicazione: (2022)
ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints
di: Agnihotri, Akhil, et al.
Pubblicazione: (2023)
di: Agnihotri, Akhil, et al.
Pubblicazione: (2023)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
di: Tsuchiya, Taira, et al.
Pubblicazione: (2025)
di: Tsuchiya, Taira, et al.
Pubblicazione: (2025)
Online Learning in MDPs with Partially Adversarial Transitions and Losses
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
di: Schlisselberg, Ofir, et al.
Pubblicazione: (2026)
Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action
di: Chen, Xin, et al.
Pubblicazione: (2024)
di: Chen, Xin, et al.
Pubblicazione: (2024)
Diversity-Preserving K-Armed Bandits, Revisited
di: Hadiji, Hédi, et al.
Pubblicazione: (2020)
di: Hadiji, Hédi, et al.
Pubblicazione: (2020)
Near-Optimal Regret for Policy Optimization in Contextual MDPs with General Offline Function Approximation
di: Levy, Orin, et al.
Pubblicazione: (2026)
di: Levy, Orin, et al.
Pubblicazione: (2026)
Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
di: Lancewicki, Tal, et al.
Pubblicazione: (2025)
Ensuring Safety in an Uncertain Environment: Constrained MDPs via Stochastic Thresholds
di: Zuo, Qian, et al.
Pubblicazione: (2025)
di: Zuo, Qian, et al.
Pubblicazione: (2025)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
di: Li, Long-Fei, et al.
Pubblicazione: (2024)
Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs
di: Kash, Ian A., et al.
Pubblicazione: (2022)
di: Kash, Ian A., et al.
Pubblicazione: (2022)
Model-free Posterior Sampling via Learning Rate Randomization
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2023)
gfnx: Fast and Scalable Library for Generative Flow Networks in JAX
di: Tiapkin, Daniil, et al.
Pubblicazione: (2025)
di: Tiapkin, Daniil, et al.
Pubblicazione: (2025)
Accelerated Rates between Stochastic and Adversarial Online Convex Optimization
di: Sachs, Sarah, et al.
Pubblicazione: (2023)
di: Sachs, Sarah, et al.
Pubblicazione: (2023)
Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
di: Chen, Shulun, et al.
Pubblicazione: (2025)
di: Chen, Shulun, et al.
Pubblicazione: (2025)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Policy Optimization via Adv2: Adversarial Learning on Advantage Functions
di: Jonckheere, Matthieu, et al.
Pubblicazione: (2023) -
Optimizing Backward Policies in GFlowNets via Trajectory Likelihood Maximization
di: Gritsaev, Timofei, et al.
Pubblicazione: (2024) -
Regression under demographic parity constraints via unlabeled post-processing
di: Chzhen, Evgenii, et al.
Pubblicazione: (2024) -
Randomized multi-class classification under system constraints: a unified approach via post-processing
di: Chzhen, Evgenii, et al.
Pubblicazione: (2025) -
Online Matching via Reinforcement Learning: An Expert Policy Orchestration Strategy
di: Mignacco, Chiara, et al.
Pubblicazione: (2025)