Salvato in:
| Autori principali: | Zorba, Denis, Šiška, David, Szpruch, Lukasz |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.14898 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mirror descent actor-critic methods for entropy regularised MDPs in general spaces: stability and convergence
di: Zorba, Denis, et al.
Pubblicazione: (2026)
di: Zorba, Denis, et al.
Pubblicazione: (2026)
A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces
di: Kerimkulov, Bekzhan, et al.
Pubblicazione: (2023)
di: Kerimkulov, Bekzhan, et al.
Pubblicazione: (2023)
Gradient Flows for Regularized Stochastic Control Problems
di: Šiška, David, et al.
Pubblicazione: (2020)
di: Šiška, David, et al.
Pubblicazione: (2020)
PPO in the Fisher-Rao geometry
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2025)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2025)
Linear convergence of proximal descent schemes on the Wasserstein space
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
Mirror Descent for Stochastic Control Problems with Measure-valued Controls
di: Kerimkulov, Bekzhan, et al.
Pubblicazione: (2024)
di: Kerimkulov, Bekzhan, et al.
Pubblicazione: (2024)
Logarithmic regret in the ergodic Avellaneda-Stoikov market making model
di: Cao, Jialun, et al.
Pubblicazione: (2024)
di: Cao, Jialun, et al.
Pubblicazione: (2024)
Entropic mean-field min-max problems via Best Response flow
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2023)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2023)
Mirror descent for constrained stochastic control problems
di: Sethi, Deven, et al.
Pubblicazione: (2025)
di: Sethi, Deven, et al.
Pubblicazione: (2025)
Mirror Descent-Ascent for mean-field min-max problems
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
A Fisher-Rao gradient flow for entropic mean-field min-max games
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)
A note on convergence of Wasserstein policy optimization
di: Šiška, David, et al.
Pubblicazione: (2026)
di: Šiška, David, et al.
Pubblicazione: (2026)
$ε$-Policy Gradient for Online Pricing
di: Szpruch, Lukasz, et al.
Pubblicazione: (2024)
di: Szpruch, Lukasz, et al.
Pubblicazione: (2024)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Off-the-grid regularisation for Poisson inverse problems
di: Lazzaretti, Marta, et al.
Pubblicazione: (2024)
di: Lazzaretti, Marta, et al.
Pubblicazione: (2024)
Dynamic inverse problems: Online regularisation theory
di: Jauhiainen, Jyrki, et al.
Pubblicazione: (2026)
di: Jauhiainen, Jyrki, et al.
Pubblicazione: (2026)
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
di: Ding, Dongsheng, et al.
Pubblicazione: (2022)
A factorisation-based regularised interior point method using the augmented system
di: Zanetti, Filippo, et al.
Pubblicazione: (2025)
di: Zanetti, Filippo, et al.
Pubblicazione: (2025)
Finite-time analysis of single-timescale actor-critic
di: Chen, Xuyang, et al.
Pubblicazione: (2022)
di: Chen, Xuyang, et al.
Pubblicazione: (2022)
Constrained Average-Reward Intermittently Observable MDPs
di: Avrachenkov, Konstantin, et al.
Pubblicazione: (2025)
di: Avrachenkov, Konstantin, et al.
Pubblicazione: (2025)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
Ergodic optimal liquidations in DeFi
di: Cao, Jialun, et al.
Pubblicazione: (2024)
di: Cao, Jialun, et al.
Pubblicazione: (2024)
An adaptive cubic regularisation algorithm based on interior point methods for solving nonlinear inequality constrained optimization
di: Pei, Yonggang, et al.
Pubblicazione: (2024)
di: Pei, Yonggang, et al.
Pubblicazione: (2024)
Epsilon-Optimal Policies for Average-Cost Separable MDPs with Perturbations
di: Kantawala, Dhairya
Pubblicazione: (2025)
di: Kantawala, Dhairya
Pubblicazione: (2025)
Data-Driven Non-Parametric Model Learning and Adaptive Control of MDPs with Borel spaces: Identifiability and Near Optimal Design
di: Mrani-Zentar, Omar, et al.
Pubblicazione: (2025)
di: Mrani-Zentar, Omar, et al.
Pubblicazione: (2025)
Extended-variable relaxations for the constrained generalized maximum-entropy sampling problem
di: Ponte, Gabriel, et al.
Pubblicazione: (2026)
di: Ponte, Gabriel, et al.
Pubblicazione: (2026)
Model approximation in MDPs with unbounded per-step cost
di: Bozkurt, Berk, et al.
Pubblicazione: (2024)
di: Bozkurt, Berk, et al.
Pubblicazione: (2024)
Sequential Decision-Making under Uncertainty: A Robust MDPs review
di: Ou, Wenfan, et al.
Pubblicazione: (2024)
di: Ou, Wenfan, et al.
Pubblicazione: (2024)
Revisiting Subgradient Dominance in Robust MDPs: Counterexamples, Hardness, and Sufficient Conditions
di: Kitamura, Toshinori, et al.
Pubblicazione: (2026)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2026)
Faster Fixed-Point Methods for Multichain MDPs
di: Zurek, Matthew, et al.
Pubblicazione: (2025)
di: Zurek, Matthew, et al.
Pubblicazione: (2025)
Planning and Learning in Average Risk-aware MDPs
di: Wang, Weikai, et al.
Pubblicazione: (2025)
di: Wang, Weikai, et al.
Pubblicazione: (2025)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024)
di: Boone, Victor, et al.
Pubblicazione: (2024)
Linear Dynamics meets Linear MDPs: Closed-Form Optimal Policies via Reinforcement Learning
di: Makdah, Abed AlRahman Al, et al.
Pubblicazione: (2025)
di: Makdah, Abed AlRahman Al, et al.
Pubblicazione: (2025)
Robustness to Model Approximation, Model Learning From Data, and Sample Complexity in Wasserstein Regular MDPs
di: Zhou, Yichen, et al.
Pubblicazione: (2024)
di: Zhou, Yichen, et al.
Pubblicazione: (2024)
Convex relaxation for the generalized maximum-entropy sampling problem
di: Ponte, Gabriel, et al.
Pubblicazione: (2024)
di: Ponte, Gabriel, et al.
Pubblicazione: (2024)
Second-order methods for quartically-regularised cubic polynomials, with applications to high-order tensor methods
di: Cartis, Coralia, et al.
Pubblicazione: (2023)
di: Cartis, Coralia, et al.
Pubblicazione: (2023)
Convergence of linesearch-based generalized conditional gradient methods without smoothness assumptions
di: Yagishita, Shotaro
Pubblicazione: (2025)
di: Yagishita, Shotaro
Pubblicazione: (2025)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
di: Zhang, Zhongjun, et al.
Pubblicazione: (2026)
di: Zhang, Zhongjun, et al.
Pubblicazione: (2026)
Efficient Model-Free Exploration in Low-Rank MDPs
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
di: Mhammedi, Zakaria, et al.
Pubblicazione: (2023)
Policy Gradient Algorithms in Average-Reward Multichain MDPs
di: Lee, Jongmin, et al.
Pubblicazione: (2026)
di: Lee, Jongmin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Mirror descent actor-critic methods for entropy regularised MDPs in general spaces: stability and convergence
di: Zorba, Denis, et al.
Pubblicazione: (2026) -
A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces
di: Kerimkulov, Bekzhan, et al.
Pubblicazione: (2023) -
Gradient Flows for Regularized Stochastic Control Problems
di: Šiška, David, et al.
Pubblicazione: (2020) -
PPO in the Fisher-Rao geometry
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2025) -
Linear convergence of proximal descent schemes on the Wasserstein space
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2024)