Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Di, Qiwei, He, Jiafan, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Variance-Dependent Regret Lower Bounds for Contextual Bandits
von: He, Jiafan, et al.
Veröffentlicht: (2025)
von: He, Jiafan, et al.
Veröffentlicht: (2025)
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
von: Zhao, Heyang, et al.
Veröffentlicht: (2023)
von: Zhao, Heyang, et al.
Veröffentlicht: (2023)
Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
von: Ji, Kaixuan, et al.
Veröffentlicht: (2026)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2026)
Reinforcement Learning from Human Feedback with Active Queries
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
von: Ji, Kaixuan, et al.
Veröffentlicht: (2026)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2026)
Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits
von: Li, Xuheng, et al.
Veröffentlicht: (2025)
von: Li, Xuheng, et al.
Veröffentlicht: (2025)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
von: Ye, Chenlu, et al.
Veröffentlicht: (2022)
von: Ye, Chenlu, et al.
Veröffentlicht: (2022)
Nearly-Optimal Algorithm for Adversarial Kernelized Bandits
von: Iwazaki, Shogo
Veröffentlicht: (2026)
von: Iwazaki, Shogo
Veröffentlicht: (2026)
Biased Dueling Bandits with Stochastic Delayed Feedback
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
von: Zhao, Heyang, et al.
Veröffentlicht: (2024)
von: Zhao, Heyang, et al.
Veröffentlicht: (2024)
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
Achieving Constant Regret in Linear Markov Decision Processes
von: Zhang, Weitong, et al.
Veröffentlicht: (2024)
von: Zhang, Weitong, et al.
Veröffentlicht: (2024)
Efficient Algorithms for Logistic Contextual Slate Bandits with Bandit Feedback
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
von: Goyal, Tanmay, et al.
Veröffentlicht: (2025)
Unified Convergence Analysis for Score-Based Diffusion Models with Deterministic Samplers
von: Li, Runjia, et al.
Veröffentlicht: (2024)
von: Li, Runjia, et al.
Veröffentlicht: (2024)
Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling
von: Di, Qiwei, et al.
Veröffentlicht: (2025)
von: Di, Qiwei, et al.
Veröffentlicht: (2025)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
Federated Linear Dueling Bandits
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
Near-Optimal Regret in Adversarial Kernel Bandits
von: Zhang, Yu-Jie, et al.
Veröffentlicht: (2026)
von: Zhang, Yu-Jie, et al.
Veröffentlicht: (2026)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
von: Yu, Yue, et al.
Veröffentlicht: (2025)
von: Yu, Yue, et al.
Veröffentlicht: (2025)
Nearly Tight Bounds for Cross-Learning Contextual Bandits with Graphical Feedback
von: Huang, Ruiyuan, et al.
Veröffentlicht: (2025)
von: Huang, Ruiyuan, et al.
Veröffentlicht: (2025)
Online Clustering of Dueling Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
Multi-Player Approaches for Dueling Bandits
von: Raveh, Or, et al.
Veröffentlicht: (2024)
von: Raveh, Or, et al.
Veröffentlicht: (2024)
Nearly Minimax Optimal Submodular Maximization with Bandit Feedback
von: Tajdini, Artin, et al.
Veröffentlicht: (2023)
von: Tajdini, Artin, et al.
Veröffentlicht: (2023)
An Improved Algorithm for Adversarial Linear Contextual Bandits via Reduction
von: van Erven, Tim, et al.
Veröffentlicht: (2025)
von: van Erven, Tim, et al.
Veröffentlicht: (2025)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
von: Akash, S, et al.
Veröffentlicht: (2026)
von: Akash, S, et al.
Veröffentlicht: (2026)
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
von: Zhang, Shiyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Shiyuan, et al.
Veröffentlicht: (2026)
Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
von: Zhang, Weitong, et al.
Veröffentlicht: (2021)
von: Zhang, Weitong, et al.
Veröffentlicht: (2021)
Regret Bounds for Adversarial Contextual Bandits with General Function Approximation and Delayed Feedback
von: Levy, Orin, et al.
Veröffentlicht: (2025)
von: Levy, Orin, et al.
Veröffentlicht: (2025)
Efficient Near-Optimal Algorithm for Online Shortest Paths in Directed Acyclic Graphs with Bandit Feedback Against Adaptive Adversaries
von: Maiti, Arnab, et al.
Veröffentlicht: (2025)
von: Maiti, Arnab, et al.
Veröffentlicht: (2025)
Near-Optimal Regret in Linear MDPs with Aggregate Bandit Feedback
von: Cassel, Asaf, et al.
Veröffentlicht: (2024)
von: Cassel, Asaf, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Variance-Dependent Regret Lower Bounds for Contextual Bandits
von: He, Jiafan, et al.
Veröffentlicht: (2025) -
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
von: Di, Qiwei, et al.
Veröffentlicht: (2024) -
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
von: Di, Qiwei, et al.
Veröffentlicht: (2023) -
Feel-Good Thompson Sampling for Contextual Dueling Bandits
von: Li, Xuheng, et al.
Veröffentlicht: (2024) -
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
von: Zhao, Heyang, et al.
Veröffentlicht: (2023)