RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kwon, Jeongyeol, Mannor, Shie, Caramanis, Constantine, Efroni, Yonathan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
par: Ganguly, Sourav, et autres
Publié: (2025)
par: Ganguly, Sourav, et autres
Publié: (2025)
Conservative DDPG -- Pessimistic RL without Ensemble
par: Soffair, Nitsan, et autres
Publié: (2024)
par: Soffair, Nitsan, et autres
Publié: (2024)
Learning Multiple Initial Solutions to Optimization Problems
par: Sharony, Elad, et autres
Publié: (2024)
par: Sharony, Elad, et autres
Publié: (2024)
Representative Action Selection for Large Action Space: From Bandits to MDPs
par: Zhou, Quan, et autres
Publié: (2025)
par: Zhou, Quan, et autres
Publié: (2025)
Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
par: Wu, Runzhe, et autres
Publié: (2025)
par: Wu, Runzhe, et autres
Publié: (2025)
Conformal Off-Policy Evaluation in Markov Decision Processes
par: Foffano, Daniele, et autres
Publié: (2023)
par: Foffano, Daniele, et autres
Publié: (2023)
Model-Free Learning and Optimal Policy Design in Multi-Agent MDPs Under Probabilistic Agent Dropout
par: Fiscko, Carmel, et autres
Publié: (2023)
par: Fiscko, Carmel, et autres
Publié: (2023)
MinMaxMin $Q$-learning
par: Soffair, Nitsan, et autres
Publié: (2024)
par: Soffair, Nitsan, et autres
Publié: (2024)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
par: Kumar, Navdeep, et autres
Publié: (2024)
par: Kumar, Navdeep, et autres
Publié: (2024)
Controlling False Discovery in Arbitrarily Structured Hypothesis Spaces via Reproducing Kernels
par: Perets, Binyamin, et autres
Publié: (2026)
par: Perets, Binyamin, et autres
Publié: (2026)
Multi-CALF: A Policy Combination Approach with Statistical Guarantees
par: Malaniya, Georgiy, et autres
Publié: (2025)
par: Malaniya, Georgiy, et autres
Publié: (2025)
Align and Filter: Improving Performance in Asynchronous On-Policy RL
par: Honari, Homayoun, et autres
Publié: (2026)
par: Honari, Homayoun, et autres
Publié: (2026)
EcoFair-CH-MARL: Scalable Constrained Hierarchical Multi-Agent RL with Real-Time Emission Budgets and Fairness Guarantees
par: Alqithami, Saad
Publié: (2026)
par: Alqithami, Saad
Publié: (2026)
STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order
par: Gu, Chengyang, et autres
Publié: (2026)
par: Gu, Chengyang, et autres
Publié: (2026)
A Classification View on Meta Learning Bandits
par: Mutti, Mirco, et autres
Publié: (2025)
par: Mutti, Mirco, et autres
Publié: (2025)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
par: Boone, Victor, et autres
Publié: (2024)
par: Boone, Victor, et autres
Publié: (2024)
Thinking Beyond Visibility: A Near-Optimal Policy Framework for Locally Interdependent Multi-Agent MDPs
par: DeWeese, Alex, et autres
Publié: (2025)
par: DeWeese, Alex, et autres
Publié: (2025)
Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
par: Ding, Dongsheng, et autres
Publié: (2022)
par: Ding, Dongsheng, et autres
Publié: (2022)
Efficient Online Learning with Offline Datasets for Infinite Horizon MDPs: A Bayesian Approach
par: Tang, Dengwang, et autres
Publié: (2023)
par: Tang, Dengwang, et autres
Publié: (2023)
Gradient Free Deep Reinforcement Learning With TabPFN
par: Schiff, David, et autres
Publié: (2025)
par: Schiff, David, et autres
Publié: (2025)
Tree Search-Based Policy Optimization under Stochastic Execution Delay
par: Valensi, David, et autres
Publié: (2024)
par: Valensi, David, et autres
Publié: (2024)
RL for Mitigating Cascading Failures: Targeted Exploration via Sensitivity Factors
par: Dwivedi, Anmol, et autres
Publié: (2024)
par: Dwivedi, Anmol, et autres
Publié: (2024)
Hereditary Geometric Meta-RL: Nonlocal Generalization via Task Symmetries
par: Nitschke, Paul, et autres
Publié: (2026)
par: Nitschke, Paul, et autres
Publié: (2026)
Unifying Goal-Conditioned RL and Unsupervised Skill Learning via Control-Maximization
par: Modirshanechi, Alireza, et autres
Publié: (2026)
par: Modirshanechi, Alireza, et autres
Publié: (2026)
Two-Timescale Linear Stochastic Approximation: Constant Stepsizes Go a Long Way
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Frugal Actor-Critic: Sample Efficient Off-Policy Deep Reinforcement Learning Using Unique Experiences
par: Singh, Nikhil Kumar, et autres
Publié: (2024)
par: Singh, Nikhil Kumar, et autres
Publié: (2024)
Policy Gradient with Tree Expansion
par: Dalal, Gal, et autres
Publié: (2023)
par: Dalal, Gal, et autres
Publié: (2023)
Representation-Driven Reinforcement Learning
par: Nabati, Ofir, et autres
Publié: (2023)
par: Nabati, Ofir, et autres
Publié: (2023)
Sobolev Space Regularised Pre Density Models
par: Kozdoba, Mark, et autres
Publié: (2023)
par: Kozdoba, Mark, et autres
Publié: (2023)
CLAIRE: Compressed Latent Autoencoder for Industrial Representation and Evaluation -- A Deep Learning Framework for Smart Manufacturing
par: Ghahramani, Mohammadhossein, et autres
Publié: (2026)
par: Ghahramani, Mohammadhossein, et autres
Publié: (2026)
Verification-Aided Learning of Neural Network Barrier Functions with Termination Guarantees
par: Chen, Shaoru, et autres
Publié: (2024)
par: Chen, Shaoru, et autres
Publié: (2024)
ControlSynth Neural ODEs: Modeling Dynamical Systems with Guaranteed Convergence
par: Mei, Wenjie, et autres
Publié: (2024)
par: Mei, Wenjie, et autres
Publié: (2024)
Stabilizing Policy Gradient Methods via Reward Profiling
par: Ahmed, Shihab, et autres
Publié: (2025)
par: Ahmed, Shihab, et autres
Publié: (2025)
RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies
par: Behzadan, Vahid, et autres
Publié: (2019)
par: Behzadan, Vahid, et autres
Publié: (2019)
Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale
par: Roth, Amit, et autres
Publié: (2026)
par: Roth, Amit, et autres
Publié: (2026)
Scalable Data-Driven Reachability Analysis and Control via Koopman Operators with Conformal Coverage Guarantees
par: Nath, Devesh, et autres
Publié: (2026)
par: Nath, Devesh, et autres
Publié: (2026)
AutoRL Hyperparameter Landscapes
par: Mohan, Aditya, et autres
Publié: (2023)
par: Mohan, Aditya, et autres
Publié: (2023)
Mining--Gym: A Configurable RL Benchmarking Environment for Truck Dispatch Scheduling
par: Banerjee, Chayan, et autres
Publié: (2025)
par: Banerjee, Chayan, et autres
Publié: (2025)
CORL: Reinforcement Learning of MILP Policies Solved via Branch and Bound
par: Anand, Akhil S, et autres
Publié: (2025)
par: Anand, Akhil S, et autres
Publié: (2025)
Physics-Informed State Space Models for Reliable Solar Irradiance Forecasting in Off-Grid Systems
par: Abdullah, Mohammed Ezzaldin Babiker
Publié: (2026)
par: Abdullah, Mohammed Ezzaldin Babiker
Publié: (2026)
Documents similaires
-
Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
par: Ganguly, Sourav, et autres
Publié: (2025) -
Conservative DDPG -- Pessimistic RL without Ensemble
par: Soffair, Nitsan, et autres
Publié: (2024) -
Learning Multiple Initial Solutions to Optimization Problems
par: Sharony, Elad, et autres
Publié: (2024) -
Representative Action Selection for Large Action Space: From Bandits to MDPs
par: Zhou, Quan, et autres
Publié: (2025) -
Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
par: Wu, Runzhe, et autres
Publié: (2025)