Model-Based Learning of Near-Optimal Finite-Window Policies in POMDPs
Fuente:
arXiv
Salvato in:
| Autori principali: | Jordan, Philip, Kamgarpour, Maryam |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics
di: Jordan, Philip, et al.
Pubblicazione: (2026)
di: Jordan, Philip, et al.
Pubblicazione: (2026)
Nash Equilibria in Games with Playerwise Concave Coupling Constraints: Existence and Computation
di: Jordan, Philip, et al.
Pubblicazione: (2025)
di: Jordan, Philip, et al.
Pubblicazione: (2025)
Constrained Meta Reinforcement Learning with Provable Test-Time Safety
di: Ni, Tingting, et al.
Pubblicazione: (2026)
di: Ni, Tingting, et al.
Pubblicazione: (2026)
Fast Rates for Inverse Reinforcement Learning
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2026)
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2026)
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2024)
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2024)
Robust Finite-Memory Policy Gradients for Hidden-Model POMDPs
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2025)
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2025)
Refined Bounds on Near Optimality Finite Window Policies in POMDPs and Their Reinforcement Learning
di: Demirci, Yunus Emre, et al.
Pubblicazione: (2024)
di: Demirci, Yunus Emre, et al.
Pubblicazione: (2024)
Learning in Zero-Sum Markov Games: Relaxing Strong Reachability and Mixing Time Assumptions
di: Ouhamma, Reda, et al.
Pubblicazione: (2023)
di: Ouhamma, Reda, et al.
Pubblicazione: (2023)
Efficient Preference-Based Reinforcement Learning: Randomized Exploration Meets Experimental Design
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2025)
A learning-based approach to stochastic optimal control under reach-avoid constraint
di: Ni, Tingting, et al.
Pubblicazione: (2024)
di: Ni, Tingting, et al.
Pubblicazione: (2024)
A safe exploration approach to constrained Markov decision processes
di: Ni, Tingting, et al.
Pubblicazione: (2023)
di: Ni, Tingting, et al.
Pubblicazione: (2023)
Scalable Policy-Based RL Algorithms for POMDPs
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
Memoryless Policy Iteration for Episodic POMDPs
di: van Zuijlen, Roy, et al.
Pubblicazione: (2025)
di: van Zuijlen, Roy, et al.
Pubblicazione: (2025)
Generalizing Multi-Step Inverse Models for Representation Learning to Finite-Memory POMDPs
di: Wu, Lili, et al.
Pubblicazione: (2024)
di: Wu, Lili, et al.
Pubblicazione: (2024)
Explainable Representation of Finite-Memory Policies for POMDPs using Decision Trees
di: Azeem, Muqsit, et al.
Pubblicazione: (2024)
di: Azeem, Muqsit, et al.
Pubblicazione: (2024)
Recurrent Natural Policy Gradient for POMDPs
di: Cayci, Semih, et al.
Pubblicazione: (2024)
di: Cayci, Semih, et al.
Pubblicazione: (2024)
Scaling Internal-State Policy-Gradient Methods for POMDPs
di: Aberdeen, Douglas, et al.
Pubblicazione: (2025)
di: Aberdeen, Douglas, et al.
Pubblicazione: (2025)
Sequential Monte Carlo for Policy Optimization in Continuous POMDPs
di: Abdulsamad, Hany, et al.
Pubblicazione: (2025)
di: Abdulsamad, Hany, et al.
Pubblicazione: (2025)
Learning Interpretable Policies in Hindsight-Observable POMDPs through Partially Supervised Reinforcement Learning
di: Lanier, Michael, et al.
Pubblicazione: (2024)
di: Lanier, Michael, et al.
Pubblicazione: (2024)
Convergence of a model-free entropy-regularized inverse reinforcement learning algorithm
di: Renard, Titouan, et al.
Pubblicazione: (2024)
di: Renard, Titouan, et al.
Pubblicazione: (2024)
Perception-Based Beliefs for POMDPs with Visual Observations
di: Schäfers, Miriam, et al.
Pubblicazione: (2026)
di: Schäfers, Miriam, et al.
Pubblicazione: (2026)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
di: Russo, Alessio, et al.
Pubblicazione: (2024)
di: Russo, Alessio, et al.
Pubblicazione: (2024)
A Finite-State Controller Based Offline Solver for Deterministic POMDPs
di: Schutz, Alex, et al.
Pubblicazione: (2025)
di: Schutz, Alex, et al.
Pubblicazione: (2025)
Near-Optimal Private Tests for Simple and MLR Hypotheses
di: Chen, Yu-Wei, et al.
Pubblicazione: (2026)
di: Chen, Yu-Wei, et al.
Pubblicazione: (2026)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Learning Logic Specifications for Policy Guidance in POMDPs: an Inductive Logic Programming Approach
di: Meli, Daniele, et al.
Pubblicazione: (2024)
di: Meli, Daniele, et al.
Pubblicazione: (2024)
Near-Optimal Second-Order Guarantees for Model-Based Adversarial Imitation Learning
di: Li, Shangzhe, et al.
Pubblicazione: (2025)
di: Li, Shangzhe, et al.
Pubblicazione: (2025)
Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping
di: Snyder, David, et al.
Pubblicazione: (2025)
di: Snyder, David, et al.
Pubblicazione: (2025)
Dynamical-VAE-based Hindsight to Learn the Causal Dynamics of Factored-POMDPs
di: Han, Chao, et al.
Pubblicazione: (2024)
di: Han, Chao, et al.
Pubblicazione: (2024)
Distributionally Robust Model-Based Offline Reinforcement Learning with Near-Optimal Sample Complexity
di: Shi, Laixi, et al.
Pubblicazione: (2022)
di: Shi, Laixi, et al.
Pubblicazione: (2022)
Rethinking Transformers in Solving POMDPs
di: Lu, Chenhao, et al.
Pubblicazione: (2024)
di: Lu, Chenhao, et al.
Pubblicazione: (2024)
Online Planning in POMDPs with State-Requests
di: Avalos, Raphael, et al.
Pubblicazione: (2024)
di: Avalos, Raphael, et al.
Pubblicazione: (2024)
Periodic agent-state based Q-learning for POMDPs
di: Sinha, Amit, et al.
Pubblicazione: (2024)
di: Sinha, Amit, et al.
Pubblicazione: (2024)
Policy Gradient Converges to the Globally Optimal Policy for Nearly Linear-Quadratic Regulators
di: Han, Yinbin, et al.
Pubblicazione: (2023)
di: Han, Yinbin, et al.
Pubblicazione: (2023)
Near-Optimal Sample Complexity in Reward-Free Kernel-Based Reinforcement Learning
di: Kayal, Aya, et al.
Pubblicazione: (2025)
di: Kayal, Aya, et al.
Pubblicazione: (2025)
Near-Minimax-Optimal Distributional Reinforcement Learning with a Generative Model
di: Rowland, Mark, et al.
Pubblicazione: (2024)
di: Rowland, Mark, et al.
Pubblicazione: (2024)
Meta-Reinforcement Learning with Universal Policy Adaptation: Provable Near-Optimality under All-task Optimum Comparator
di: Xu, Siyuan, et al.
Pubblicazione: (2024)
di: Xu, Siyuan, et al.
Pubblicazione: (2024)
Convergence of regularized agent-state-based Q-learning in POMDPs
di: Sinha, Amit, et al.
Pubblicazione: (2025)
di: Sinha, Amit, et al.
Pubblicazione: (2025)
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
di: Zamboni, Riccardo, et al.
Pubblicazione: (2024)
Pessimistic Iterative Planning with RNNs for Robust POMDPs
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2024)
di: Galesloot, Maris F. L., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics
di: Jordan, Philip, et al.
Pubblicazione: (2026) -
Nash Equilibria in Games with Playerwise Concave Coupling Constraints: Existence and Computation
di: Jordan, Philip, et al.
Pubblicazione: (2025) -
Constrained Meta Reinforcement Learning with Provable Test-Time Safety
di: Ni, Tingting, et al.
Pubblicazione: (2026) -
Fast Rates for Inverse Reinforcement Learning
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2026) -
Towards the Transferability of Rewards Recovered via Regularized Inverse Reinforcement Learning
di: Schlaginhaufen, Andreas, et al.
Pubblicazione: (2024)