Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Mengxiao, Zhang, Yuheng, Luo, Haipeng, Mineiro, Paul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Provably Efficient Interactive-Grounded Learning with Personalized Reward
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Efficient Contextual Bandits with Uninformed Feedback Graphs
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Contextual Multinomial Logit Bandits with General Value Functions
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Contextual Linear Bandits with Delay as Payoff
di: Zhang, Mengxiao, et al.
Pubblicazione: (2025)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2025)
Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
di: Hait, Soumita, et al.
Pubblicazione: (2026)
di: Hait, Soumita, et al.
Pubblicazione: (2026)
Alternating Regret for Online Convex Optimization
di: Hait, Soumita, et al.
Pubblicazione: (2025)
di: Hait, Soumita, et al.
Pubblicazione: (2025)
Comparator-Adaptive $Φ$-Regret: Improved Bounds, Simpler Algorithms, and Applications to Games
di: Hait, Soumita, et al.
Pubblicazione: (2025)
di: Hait, Soumita, et al.
Pubblicazione: (2025)
Learning Markov Decision Processes under Fully Bandit Feedback
di: Zhuo, Zhengjia, et al.
Pubblicazione: (2026)
di: Zhuo, Zhengjia, et al.
Pubblicazione: (2026)
No-Regret Learning for Fair Multi-Agent Social Welfare Optimization
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
di: Ye, Chenlu, et al.
Pubblicazione: (2022)
di: Ye, Chenlu, et al.
Pubblicazione: (2022)
Online Joint Fine-tuning of Multi-Agent Flows
di: Mineiro, Paul
Pubblicazione: (2024)
di: Mineiro, Paul
Pubblicazione: (2024)
Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback
di: Benslimane, Wyame, et al.
Pubblicazione: (2026)
di: Benslimane, Wyame, et al.
Pubblicazione: (2026)
Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes
di: Luo, Baiting, et al.
Pubblicazione: (2024)
di: Luo, Baiting, et al.
Pubblicazione: (2024)
Federated Control in Markov Decision Processes
di: Jin, Hao, et al.
Pubblicazione: (2024)
di: Jin, Hao, et al.
Pubblicazione: (2024)
Generalized Linear Markov Decision Process
di: Zhang, Sinian, et al.
Pubblicazione: (2025)
di: Zhang, Sinian, et al.
Pubblicazione: (2025)
Exploiting Curvature in Online Convex Optimization with Delayed Feedback
di: Qiu, Hao, et al.
Pubblicazione: (2025)
di: Qiu, Hao, et al.
Pubblicazione: (2025)
Optimizing Load Scheduling in Power Grids Using Reinforcement Learning and Markov Decision Processes
di: Luo, Dongwen
Pubblicazione: (2024)
di: Luo, Dongwen
Pubblicazione: (2024)
Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings
di: Hwang, Himchan, et al.
Pubblicazione: (2026)
di: Hwang, Himchan, et al.
Pubblicazione: (2026)
Decentralized Online Convex Optimization with Unknown Feedback Delays
di: Qiu, Hao, et al.
Pubblicazione: (2026)
di: Qiu, Hao, et al.
Pubblicazione: (2026)
Learning in Markov Decision Processes with Exogenous Dynamics
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Achieving Constant Regret in Linear Markov Decision Processes
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
Horizon-Free Regret for Linear Markov Decision Processes
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
di: Zhang, Zihan, et al.
Pubblicazione: (2024)
Monitored Markov Decision Processes
di: Parisi, Simone, et al.
Pubblicazione: (2024)
di: Parisi, Simone, et al.
Pubblicazione: (2024)
Learning Utilities from Demonstrations in Markov Decision Processes
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
Provably Efficient Reward Transfer in Reinforcement Learning with Discrete Markov Decision Processes
di: Vora, Kevin, et al.
Pubblicazione: (2025)
di: Vora, Kevin, et al.
Pubblicazione: (2025)
Parameter-free Dynamic Regret: Time-varying Movement Costs, Delayed Feedback, and Memory
di: Qiu, Hao, et al.
Pubblicazione: (2026)
di: Qiu, Hao, et al.
Pubblicazione: (2026)
Transition Transfer $Q$-Learning for Composite Markov Decision Processes
di: Chai, Jinhang, et al.
Pubblicazione: (2025)
di: Chai, Jinhang, et al.
Pubblicazione: (2025)
Online Learning for Uninformed Markov Games: Empirical Nash-Value Regret and Non-Stationarity Adaptation
di: Liu, Junyan, et al.
Pubblicazione: (2026)
di: Liu, Junyan, et al.
Pubblicazione: (2026)
A Markov Decision Process for Variable Selection in Branch & Bound
di: Strang, Paul, et al.
Pubblicazione: (2025)
di: Strang, Paul, et al.
Pubblicazione: (2025)
Observation Adaptation via Annealed Importance Resampling for Partially Observable Markov Decision Processes
di: Zhang, Yunuo, et al.
Pubblicazione: (2025)
di: Zhang, Yunuo, et al.
Pubblicazione: (2025)
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
di: Morimura, Tetsuro, et al.
Pubblicazione: (2022)
di: Morimura, Tetsuro, et al.
Pubblicazione: (2022)
Impact of Markov Decision Process Design on Sim-to-Real Reinforcement Learning
di: Krau, Tatjana, et al.
Pubblicazione: (2026)
di: Krau, Tatjana, et al.
Pubblicazione: (2026)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
di: Stradi, Francesco Emanuele, et al.
Pubblicazione: (2024)
Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
di: Blaser, Ethan, et al.
Pubblicazione: (2026)
Active, anytime-valid risk controlling prediction sets
di: Xu, Ziyu, et al.
Pubblicazione: (2024)
di: Xu, Ziyu, et al.
Pubblicazione: (2024)
A Unified Theory of Compositionality, Modularity, and Interpretability in Markov Decision Processes
di: Ringstrom, Thomas J., et al.
Pubblicazione: (2025)
di: Ringstrom, Thomas J., et al.
Pubblicazione: (2025)
Optimal Decision Tree Policies for Markov Decision Processes
di: Vos, Daniël, et al.
Pubblicazione: (2023)
di: Vos, Daniël, et al.
Pubblicazione: (2023)
Policy Testing in Markov Decision Processes
di: Ariu, Kaito, et al.
Pubblicazione: (2025)
di: Ariu, Kaito, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Provably Efficient Interactive-Grounded Learning with Personalized Reward
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024) -
Efficient Contextual Bandits with Uninformed Feedback Graphs
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024) -
Contextual Multinomial Logit Bandits with General Value Functions
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024) -
Contextual Linear Bandits with Delay as Payoff
di: Zhang, Mengxiao, et al.
Pubblicazione: (2025) -
Near-Optimal Last-Iterate Convergence for Zero-Sum Games with Bandit Feedback and Opponent Actions
di: Hait, Soumita, et al.
Pubblicazione: (2026)