Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Chenlu, He, Jiafan, Gu, Quanquan, Zhang, Tong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
di: Ye, Chenlu, et al.
Pubblicazione: (2023)
di: Ye, Chenlu, et al.
Pubblicazione: (2023)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
di: Ye, Chenlu, et al.
Pubblicazione: (2022)
di: Ye, Chenlu, et al.
Pubblicazione: (2022)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
di: Zhao, Heyang, et al.
Pubblicazione: (2023)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
di: Zhao, Heyang, et al.
Pubblicazione: (2025)
Reinforcement Learning from Human Feedback with Active Queries
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
di: Ji, Kaixuan, et al.
Pubblicazione: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
di: He, Jiafan, et al.
Pubblicazione: (2025)
di: He, Jiafan, et al.
Pubblicazione: (2025)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
di: Zhao, Heyang, et al.
Pubblicazione: (2024)
di: Zhao, Heyang, et al.
Pubblicazione: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Achieving Constant Regret in Linear Markov Decision Processes
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
di: Zhang, Weitong, et al.
Pubblicazione: (2024)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
di: Zhang, Weitong, et al.
Pubblicazione: (2021)
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
di: Yang, Rui, et al.
Pubblicazione: (2023)
di: Yang, Rui, et al.
Pubblicazione: (2023)
Energy-Weighted Flow Matching for Offline Reinforcement Learning
di: Zhang, Shiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Shiyuan, et al.
Pubblicazione: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
di: Ye, Chenlu, et al.
Pubblicazione: (2024)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
di: Ye, Chenlu, et al.
Pubblicazione: (2025)
On Corruption-Robustness in Performative Reinforcement Learning
di: Pollatos, Vasilis, et al.
Pubblicazione: (2025)
di: Pollatos, Vasilis, et al.
Pubblicazione: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
di: Bukharin, Alexander, et al.
Pubblicazione: (2024)
Robust Distribution Learning with Local and Global Adversarial Corruptions
di: Nietert, Sloan, et al.
Pubblicazione: (2024)
di: Nietert, Sloan, et al.
Pubblicazione: (2024)
Cascading Bandits Robust to Adversarial Corruptions
di: Xie, Jize, et al.
Pubblicazione: (2025)
di: Xie, Jize, et al.
Pubblicazione: (2025)
A Model Selection Approach for Corruption Robust Reinforcement Learning
di: Wei, Chen-Yu, et al.
Pubblicazione: (2021)
di: Wei, Chen-Yu, et al.
Pubblicazione: (2021)
Sparse Offline Reinforcement Learning with Corruption Robustness
di: Tran, Nam Phuong, et al.
Pubblicazione: (2025)
di: Tran, Nam Phuong, et al.
Pubblicazione: (2025)
Robustness Against Adversarial Attacks via Learning Confined Adversarial Polytopes
di: Hamidi, Shayan Mohajer, et al.
Pubblicazione: (2024)
di: Hamidi, Shayan Mohajer, et al.
Pubblicazione: (2024)
Convergence of Score-Based Discrete Diffusion Models: A Discrete-Time Analysis
di: Zhang, Zikun, et al.
Pubblicazione: (2024)
di: Zhang, Zikun, et al.
Pubblicazione: (2024)
Toward Evaluating Robustness of Reinforcement Learning with Adversarial Policy
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
di: Zheng, Xiang, et al.
Pubblicazione: (2023)
Group-Adaptive Adversarial Learning for Robust Fake News Detection Against Malicious Comments
di: Tong, Zhao, et al.
Pubblicazione: (2025)
di: Tong, Zhao, et al.
Pubblicazione: (2025)
Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits
di: Zhao, Qingyue, et al.
Pubblicazione: (2025)
di: Zhao, Qingyue, et al.
Pubblicazione: (2025)
Towards Optimal Adversarial Robust Reinforcement Learning with Infinity Measurement Error
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
Robust Model-Based Reinforcement Learning with an Adversarial Auxiliary Model
di: Herremans, Siemen, et al.
Pubblicazione: (2024)
di: Herremans, Siemen, et al.
Pubblicazione: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
di: Mandal, Debmalya, et al.
Pubblicazione: (2024)
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
di: Hao, Yifan, et al.
Pubblicazione: (2025)
di: Hao, Yifan, et al.
Pubblicazione: (2025)
Position: Towards Resilience Against Adversarial Examples
di: Dai, Sihui, et al.
Pubblicazione: (2024)
di: Dai, Sihui, et al.
Pubblicazione: (2024)
Learning with Monotone Adversarial Corruptions
di: Larsen, Kasper Green, et al.
Pubblicazione: (2026)
di: Larsen, Kasper Green, et al.
Pubblicazione: (2026)
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
di: Zhang, Chenyang, et al.
Pubblicazione: (2026)
di: Zhang, Chenyang, et al.
Pubblicazione: (2026)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
di: Li, Runjia, et al.
Pubblicazione: (2024)
di: Li, Runjia, et al.
Pubblicazione: (2024)
Distributionally Robust Set Representation Learning Under Inference-Time Element Corruption
di: Chen, Yankai, et al.
Pubblicazione: (2026)
di: Chen, Yankai, et al.
Pubblicazione: (2026)
Adversarial Diffusion for Robust Reinforcement Learning
di: Foffano, Daniele, et al.
Pubblicazione: (2025)
di: Foffano, Daniele, et al.
Pubblicazione: (2025)
Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
di: Bao, Yicheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
di: Ye, Chenlu, et al.
Pubblicazione: (2023) -
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
di: Ye, Chenlu, et al.
Pubblicazione: (2022) -
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024) -
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
di: Zhao, Heyang, et al.
Pubblicazione: (2023) -
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
di: Zhao, Heyang, et al.
Pubblicazione: (2025)