Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Chenlu, Xiong, Wei, Gu, Quanquan, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024)
par: Zhao, Heyang, et autres
Publié: (2024)
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023)
par: Ye, Chenlu, et autres
Publié: (2023)
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
par: Ye, Chenlu, et autres
Publié: (2024)
par: Ye, Chenlu, et autres
Publié: (2024)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
par: Ye, Chenlu, et autres
Publié: (2025)
par: Ye, Chenlu, et autres
Publié: (2025)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
par: He, Jiafan, et autres
Publié: (2025)
par: He, Jiafan, et autres
Publié: (2025)
Achieving Constant Regret in Linear Markov Decision Processes
par: Zhang, Weitong, et autres
Publié: (2024)
par: Zhang, Weitong, et autres
Publié: (2024)
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
par: Li, Xuheng, et autres
Publié: (2025)
par: Li, Xuheng, et autres
Publié: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
par: Li, Xuheng, et autres
Publié: (2024)
par: Li, Xuheng, et autres
Publié: (2024)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
par: Zhao, Qingyue, et autres
Publié: (2025)
par: Zhao, Qingyue, et autres
Publié: (2025)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
par: Zhang, Weitong, et autres
Publié: (2021)
par: Zhang, Weitong, et autres
Publié: (2021)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Robust $Q$-learning Algorithm for Markov Decision Processes under Wasserstein Uncertainty
par: Neufeld, Ariel, et autres
Publié: (2022)
par: Neufeld, Ariel, et autres
Publié: (2022)
Robust and Computationally Efficient Linear Contextual Bandits under Adversarial Corruption and Heavy-Tailed Noise
par: Tani, Naoto, et autres
Publié: (2026)
par: Tani, Naoto, et autres
Publié: (2026)
Cascading Bandits Robust to Adversarial Corruptions
par: Xie, Jize, et autres
Publié: (2025)
par: Xie, Jize, et autres
Publié: (2025)
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
Learning Markov Decision Processes under Fully Bandit Feedback
par: Zhuo, Zhengjia, et autres
Publié: (2026)
par: Zhuo, Zhengjia, et autres
Publié: (2026)
Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
par: Zhang, Mengxiao, et autres
Publié: (2026)
par: Zhang, Mengxiao, et autres
Publié: (2026)
Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability
par: Zhao, Qingyue, et autres
Publié: (2026)
par: Zhao, Qingyue, et autres
Publié: (2026)
Provable Anytime Ensemble Sampling Algorithms in Nonlinear Contextual Bandits
par: Sun, Jiazheng, et autres
Publié: (2025)
par: Sun, Jiazheng, et autres
Publié: (2025)
Corruption-Robust Lipschitz Contextual Search
par: Zuo, Shiliang
Publié: (2023)
par: Zuo, Shiliang
Publié: (2023)
Energy-Weighted Flow Matching for Offline Reinforcement Learning
par: Zhang, Shiyuan, et autres
Publié: (2025)
par: Zhang, Shiyuan, et autres
Publié: (2025)
Uncertainty of Joint Neural Contextual Bandit
par: Guo, Hongbo, et autres
Publié: (2024)
par: Guo, Hongbo, et autres
Publié: (2024)
Corruption-Robust Linear Bandits: Minimax Optimality and Gap-Dependent Misspecification
par: Liu, Haolin, et autres
Publié: (2024)
par: Liu, Haolin, et autres
Publié: (2024)
Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions
par: Ghaffari, Fatemeh, et autres
Publié: (2024)
par: Ghaffari, Fatemeh, et autres
Publié: (2024)
Daunce: Data Attribution through Uncertainty Estimation
par: Pan, Xingyuan, et autres
Publié: (2025)
par: Pan, Xingyuan, et autres
Publié: (2025)
Efficient Algorithms for Robust Markov Decision Processes with $s$-Rectangular Ambiguity Sets
par: Ho, Chin Pang, et autres
Publié: (2026)
par: Ho, Chin Pang, et autres
Publié: (2026)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
par: Goyal, Tanmay, et autres
Publié: (2025)
par: Goyal, Tanmay, et autres
Publié: (2025)
Density-Based Algorithms for Corruption-Robust Contextual Search and Convex Optimization
par: Leme, Renato Paes, et autres
Publié: (2022)
par: Leme, Renato Paes, et autres
Publié: (2022)
An Improved Algorithm for Adversarial Linear Contextual Bandits via Reduction
par: van Erven, Tim, et autres
Publié: (2025)
par: van Erven, Tim, et autres
Publié: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
par: Ye, Chenlu, et autres
Publié: (2024)
par: Ye, Chenlu, et autres
Publié: (2024)
Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits
par: Liu, Jiayuan, et autres
Publié: (2025)
par: Liu, Jiayuan, et autres
Publié: (2025)
Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation
par: Gu, Jingwen, et autres
Publié: (2025)
par: Gu, Jingwen, et autres
Publié: (2025)
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
par: Fan, Zhiyuan, et autres
Publié: (2025)
par: Fan, Zhiyuan, et autres
Publié: (2025)
Pure Exploration in Asynchronous Federated Bandits
par: Wang, Zichen, et autres
Publié: (2023)
par: Wang, Zichen, et autres
Publié: (2023)
Policy Gradient for Robust Markov Decision Processes
par: Wang, Qiuhao, et autres
Publié: (2024)
par: Wang, Qiuhao, et autres
Publié: (2024)
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits
par: Kuroki, Yuko, et autres
Publié: (2023)
par: Kuroki, Yuko, et autres
Publié: (2023)
A Reduction Algorithm for Markovian Contextual Linear Bandits
par: Buyukkalayci, Kaan, et autres
Publié: (2026)
par: Buyukkalayci, Kaan, et autres
Publié: (2026)
MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings
par: Hwang, Himchan, et autres
Publié: (2026)
par: Hwang, Himchan, et autres
Publié: (2026)
Documents similaires
-
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024) -
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023) -
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
par: Ye, Chenlu, et autres
Publié: (2024) -
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
par: Ye, Chenlu, et autres
Publié: (2025) -
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025)