Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Shulun, Zhou, Runlong, Zhang, Zihan, Fazel, Maryam, Du, Simon S. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback
por: Chen, Shulun, et al.
Publicado: (2025)
por: Chen, Shulun, et al.
Publicado: (2025)
Data- and Variance-dependent Regret Bounds for Online Tabular MDPs
por: Li, Mingyi, et al.
Publicado: (2026)
por: Li, Mingyi, et al.
Publicado: (2026)
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback
por: Zhou, Runlong, et al.
Publicado: (2025)
por: Zhou, Runlong, et al.
Publicado: (2025)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
por: Shi, Ruizhe, et al.
Publicado: (2025)
por: Shi, Ruizhe, et al.
Publicado: (2025)
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
por: Zamir, Guy, et al.
Publicado: (2026)
por: Zamir, Guy, et al.
Publicado: (2026)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
por: Boudart, Pierre, et al.
Publicado: (2026)
por: Boudart, Pierre, et al.
Publicado: (2026)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
Variance-Dependent Regret Lower Bounds for Contextual Bandits
por: He, Jiafan, et al.
Publicado: (2025)
por: He, Jiafan, et al.
Publicado: (2025)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
por: Boone, Victor, et al.
Publicado: (2024)
por: Boone, Victor, et al.
Publicado: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
por: Di, Qiwei, et al.
Publicado: (2023)
por: Di, Qiwei, et al.
Publicado: (2023)
Tighter Regret Bounds for Contextual Action-Set Reinforcement Learning
por: Chen, Zijun, et al.
Publicado: (2026)
por: Chen, Zijun, et al.
Publicado: (2026)
Global Convergence of Gradient EM for Over-Parameterized Gaussian Mixtures
por: Zhou, Mo, et al.
Publicado: (2025)
por: Zhou, Mo, et al.
Publicado: (2025)
Horizon-Free Regret for Linear Markov Decision Processes
por: Zhang, Zihan, et al.
Publicado: (2024)
por: Zhang, Zihan, et al.
Publicado: (2024)
Toward Global Convergence of Gradient EM for Over-Parameterized Gaussian Mixture Models
por: Xu, Weihang, et al.
Publicado: (2024)
por: Xu, Weihang, et al.
Publicado: (2024)
Towards Optimal Differentially Private Regret Bounds in Linear MDPs
por: Sahu, Sharan
Publicado: (2025)
por: Sahu, Sharan
Publicado: (2025)
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits
por: Cassel, Asaf, et al.
Publicado: (2024)
por: Cassel, Asaf, et al.
Publicado: (2024)
VASSO: Variance Suppression for Sharpness-Aware Minimization
por: Li, Bingcong, et al.
Publicado: (2025)
por: Li, Bingcong, et al.
Publicado: (2025)
Precise Asymptotics and Refined Regret of Variance-Aware UCB
por: Fan, Yingying, et al.
Publicado: (2024)
por: Fan, Yingying, et al.
Publicado: (2024)
Truly No-Regret Learning in Constrained MDPs
por: Müller, Adrian, et al.
Publicado: (2024)
por: Müller, Adrian, et al.
Publicado: (2024)
Q-Learning with Fine-Grained Gap-Dependent Regret
por: Zhang, Haochen, et al.
Publicado: (2025)
por: Zhang, Haochen, et al.
Publicado: (2025)
Offline Multi-task Transfer RL with Representational Penalization
por: Bose, Avinandan, et al.
Publicado: (2024)
por: Bose, Avinandan, et al.
Publicado: (2024)
Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs
por: Li, Long-Fei, et al.
Publicado: (2024)
por: Li, Long-Fei, et al.
Publicado: (2024)
Convergence Dynamics of Over-Parameterized Score Matching for a Single Gaussian
por: Zhang, Yiran, et al.
Publicado: (2025)
por: Zhang, Yiran, et al.
Publicado: (2025)
Solving Robust MDPs through No-Regret Dynamics
por: Guha, Etash Kumar
Publicado: (2023)
por: Guha, Etash Kumar
Publicado: (2023)
Eluder-based Regret for Stochastic Contextual MDPs
por: Levy, Orin, et al.
Publicado: (2022)
por: Levy, Orin, et al.
Publicado: (2022)
No-Regret Reinforcement Learning in Smooth MDPs
por: Maran, Davide, et al.
Publicado: (2024)
por: Maran, Davide, et al.
Publicado: (2024)
Data-Dependent Regret Bounds for Constrained MABs
por: Genalti, Gianmarco, et al.
Publicado: (2025)
por: Genalti, Gianmarco, et al.
Publicado: (2025)
Regret Bounds for Noise-Free Cascaded Kernelized Bandits
por: Li, Zihan, et al.
Publicado: (2022)
por: Li, Zihan, et al.
Publicado: (2022)
Learning Optimal Tax Design in Nonatomic Congestion Games
por: Cui, Qiwen, et al.
Publicado: (2024)
por: Cui, Qiwen, et al.
Publicado: (2024)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
por: Zhou, Runlong, et al.
Publicado: (2024)
por: Zhou, Runlong, et al.
Publicado: (2024)
The Crucial Role of Samplers in Online Direct Preference Optimization
por: Shi, Ruizhe, et al.
Publicado: (2024)
por: Shi, Ruizhe, et al.
Publicado: (2024)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
por: Tsuchiya, Taira, et al.
Publicado: (2025)
por: Tsuchiya, Taira, et al.
Publicado: (2025)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
por: Cassel, Asaf, et al.
Publicado: (2024)
por: Cassel, Asaf, et al.
Publicado: (2024)
Graph-Dependent Regret Bounds in Multi-Armed Bandits with Interference
por: Jamshidi, Fateme, et al.
Publicado: (2025)
por: Jamshidi, Fateme, et al.
Publicado: (2025)
Instance-Dependent Regret Bounds for Nonstochastic Linear Partial Monitoring
por: Di Gennaro, Federico, et al.
Publicado: (2025)
por: Di Gennaro, Federico, et al.
Publicado: (2025)
Gap-Dependent Bounds for Federated $Q$-learning
por: Zhang, Haochen, et al.
Publicado: (2025)
por: Zhang, Haochen, et al.
Publicado: (2025)
How Does Variance Shape the Regret in Contextual Bandits?
por: Jia, Zeyu, et al.
Publicado: (2024)
por: Jia, Zeyu, et al.
Publicado: (2024)
Order Optimal Regret Bounds for Sharpe Ratio Optimization under Thompson Sampling
por: Shah, Mohammad Taha, et al.
Publicado: (2025)
por: Shah, Mohammad Taha, et al.
Publicado: (2025)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
por: Lu, Michael, et al.
Publicado: (2024)
por: Lu, Michael, et al.
Publicado: (2024)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
por: Satheesh, Anirudh, et al.
Publicado: (2026)
por: Satheesh, Anirudh, et al.
Publicado: (2026)
Ejemplares similares
-
Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback
por: Chen, Shulun, et al.
Publicado: (2025) -
Data- and Variance-dependent Regret Bounds for Online Tabular MDPs
por: Li, Mingyi, et al.
Publicado: (2026) -
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback
por: Zhou, Runlong, et al.
Publicado: (2025) -
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
por: Shi, Ruizhe, et al.
Publicado: (2025) -
Optimal Variance-Dependent Regret Bounds for Infinite-Horizon MDPs
por: Zamir, Guy, et al.
Publicado: (2026)