Learning Markov Decision Processes under Fully Bandit Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhuo, Zhengjia, Gupta, Anupam, Nagarajan, Viswanath |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Simple Approximation Algorithm for Optimal Decision Tree
par: Zhuo, Zhengjia, et autres
Publié: (2025)
par: Zhuo, Zhengjia, et autres
Publié: (2025)
Semi-Bandit Learning for Monotone Stochastic Optimization
par: Agarwal, Arpit, et autres
Publié: (2023)
par: Agarwal, Arpit, et autres
Publié: (2023)
Optimal Decision Tree and Adaptive Submodular Ranking with Noisy Outcomes
par: Jia, Su, et autres
Publié: (2023)
par: Jia, Su, et autres
Publié: (2023)
Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
par: Zhang, Mengxiao, et autres
Publié: (2026)
par: Zhang, Mengxiao, et autres
Publié: (2026)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
par: Ye, Chenlu, et autres
Publié: (2022)
par: Ye, Chenlu, et autres
Publié: (2022)
Lower Bound on the Greedy Approximation Ratio for Adaptive Submodular Cover
par: Harris, Blake, et autres
Publié: (2024)
par: Harris, Blake, et autres
Publié: (2024)
Markov Decision Processes under External Temporal Processes
par: Ayyagari, Ranga Shaarad, et autres
Publié: (2023)
par: Ayyagari, Ranga Shaarad, et autres
Publié: (2023)
Learning in Markov Decision Processes with Exogenous Dynamics
par: Maran, Davide, et autres
Publié: (2026)
par: Maran, Davide, et autres
Publié: (2026)
Multiclass Online Learnability under Bandit Feedback
par: Raman, Ananth, et autres
Publié: (2023)
par: Raman, Ananth, et autres
Publié: (2023)
Monitored Markov Decision Processes
par: Parisi, Simone, et autres
Publié: (2024)
par: Parisi, Simone, et autres
Publié: (2024)
Risk-sensitive Markov Decision Process and Learning under General Utility Functions
par: Wu, Zhengqi, et autres
Publié: (2023)
par: Wu, Zhengqi, et autres
Publié: (2023)
Learning Utilities from Demonstrations in Markov Decision Processes
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
Off-Policy Evaluation in Markov Decision Processes under Weak Distributional Overlap
par: Mehrabi, Mohammad, et autres
Publié: (2024)
par: Mehrabi, Mohammad, et autres
Publié: (2024)
Generalized Linear Markov Decision Process
par: Zhang, Sinian, et autres
Publié: (2025)
par: Zhang, Sinian, et autres
Publié: (2025)
Federated Control in Markov Decision Processes
par: Jin, Hao, et autres
Publié: (2024)
par: Jin, Hao, et autres
Publié: (2024)
Transition Transfer $Q$-Learning for Composite Markov Decision Processes
par: Chai, Jinhang, et autres
Publié: (2025)
par: Chai, Jinhang, et autres
Publié: (2025)
Minimum Cost Adaptive Submodular Cover
par: Al-Thani, Hessa, et autres
Publié: (2022)
par: Al-Thani, Hessa, et autres
Publié: (2022)
Learning Equilibria in Matching Games with Bandit Feedback
par: Athanasopoulos, Andreas, et autres
Publié: (2025)
par: Athanasopoulos, Andreas, et autres
Publié: (2025)
Impact of Markov Decision Process Design on Sim-to-Real Reinforcement Learning
par: Krau, Tatjana, et autres
Publié: (2026)
par: Krau, Tatjana, et autres
Publié: (2026)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
par: Montenegro, Alessandro, et autres
Publié: (2025)
par: Montenegro, Alessandro, et autres
Publié: (2025)
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
par: Stradi, Francesco Emanuele, et autres
Publié: (2024)
Dual Formulation for Non-Rectangular Lp Robust Markov Decision Processes
par: Kumar, Navdeep, et autres
Publié: (2025)
par: Kumar, Navdeep, et autres
Publié: (2025)
Optimal Decision Tree Policies for Markov Decision Processes
par: Vos, Daniël, et autres
Publié: (2023)
par: Vos, Daniël, et autres
Publié: (2023)
Fixed-Confidence Multiple Change Point Identification under Bandit Feedback
par: Lazzaro, Joseph, et autres
Publié: (2025)
par: Lazzaro, Joseph, et autres
Publié: (2025)
Policy Testing in Markov Decision Processes
par: Ariu, Kaito, et autres
Publié: (2025)
par: Ariu, Kaito, et autres
Publié: (2025)
Learn A Flexible Exploration Model for Parameterized Action Markov Decision Processes
par: Wang, Zijian, et autres
Publié: (2025)
par: Wang, Zijian, et autres
Publié: (2025)
Dynamic Deep-Reinforcement-Learning Algorithm in Partially Observable Markov Decision Processes
par: Omi, Saki, et autres
Publié: (2023)
par: Omi, Saki, et autres
Publié: (2023)
Performative Prediction with Bandit Feedback: Learning through Reparameterization
par: Chen, Yatong, et autres
Publié: (2023)
par: Chen, Yatong, et autres
Publié: (2023)
Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes
par: Luo, Baiting, et autres
Publié: (2024)
par: Luo, Baiting, et autres
Publié: (2024)
Performative Reinforcement Learning with Linear Markov Decision Process
par: Mandal, Debmalya, et autres
Publié: (2024)
par: Mandal, Debmalya, et autres
Publié: (2024)
The regret lower bound for communicating Markov Decision Processes
par: Boone, Victor, et autres
Publié: (2025)
par: Boone, Victor, et autres
Publié: (2025)
An Orthogonal Learner for Individualized Outcomes in Markov Decision Processes
par: Javurek, Emil, et autres
Publié: (2025)
par: Javurek, Emil, et autres
Publié: (2025)
Horizon-Free Regret for Linear Markov Decision Processes
par: Zhang, Zihan, et autres
Publié: (2024)
par: Zhang, Zihan, et autres
Publié: (2024)
Initial Distribution Sensitivity of Constrained Markov Decision Processes
par: Tercan, Alperen, et autres
Publié: (2025)
par: Tercan, Alperen, et autres
Publié: (2025)
Improving Controller Generalization with Dimensionless Markov Decision Processes
par: Charvet, Valentin, et autres
Publié: (2025)
par: Charvet, Valentin, et autres
Publié: (2025)
Achieving Constant Regret in Linear Markov Decision Processes
par: Zhang, Weitong, et autres
Publié: (2024)
par: Zhang, Weitong, et autres
Publié: (2024)
Model-Based Exploration in Monitored Markov Decision Processes
par: Kazemipour, Alireza, et autres
Publié: (2025)
par: Kazemipour, Alireza, et autres
Publié: (2025)
Nearest Neighbour with Bandit Feedback
par: Pasteris, Stephen, et autres
Publié: (2023)
par: Pasteris, Stephen, et autres
Publié: (2023)
Slicing Input Features to Accelerate Deep Learning: A Case Study with Graph Neural Networks
par: Xu, Zhengjia, et autres
Publié: (2024)
par: Xu, Zhengjia, et autres
Publié: (2024)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
par: Goyal, Tanmay, et autres
Publié: (2025)
par: Goyal, Tanmay, et autres
Publié: (2025)
Documents similaires
-
A Simple Approximation Algorithm for Optimal Decision Tree
par: Zhuo, Zhengjia, et autres
Publié: (2025) -
Semi-Bandit Learning for Monotone Stochastic Optimization
par: Agarwal, Arpit, et autres
Publié: (2023) -
Optimal Decision Tree and Adaptive Submodular Ranking with Noisy Outcomes
par: Jia, Su, et autres
Publié: (2023) -
Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
par: Zhang, Mengxiao, et autres
Publié: (2026) -
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
par: Ye, Chenlu, et autres
Publié: (2022)