Biased Dueling Bandits with Stochastic Delayed Feedback
Fuente:
arXiv
Saved in:
| Main Authors: | Yi, Bongsoo, Kang, Yue, Li, Yao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quantum Lipschitz Bandits
by: Yi, Bongsoo, et al.
Published: (2025)
by: Yi, Bongsoo, et al.
Published: (2025)
Linear and Neural Dueling Bandits with Delayed Feedback
by: Wang, Xiangyi, et al.
Published: (2026)
by: Wang, Xiangyi, et al.
Published: (2026)
Lipschitz Bandits with Stochastic Delayed Feedback
by: Liu, Zhongxuan, et al.
Published: (2025)
by: Liu, Zhongxuan, et al.
Published: (2025)
Fusing Reward and Dueling Feedback in Stochastic Bandits
by: Wang, Xuchuang, et al.
Published: (2025)
by: Wang, Xuchuang, et al.
Published: (2025)
Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions
by: Kang, Yue, et al.
Published: (2025)
by: Kang, Yue, et al.
Published: (2025)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
by: Di, Qiwei, et al.
Published: (2023)
by: Di, Qiwei, et al.
Published: (2023)
Federated Linear Dueling Bandits
by: Huang, Xuhan, et al.
Published: (2025)
by: Huang, Xuhan, et al.
Published: (2025)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
by: Wang, Shengbo, et al.
Published: (2025)
by: Wang, Shengbo, et al.
Published: (2025)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
by: Di, Qiwei, et al.
Published: (2024)
by: Di, Qiwei, et al.
Published: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
by: Verma, Arun, et al.
Published: (2025)
by: Verma, Arun, et al.
Published: (2025)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
by: Verma, Arun, et al.
Published: (2024)
by: Verma, Arun, et al.
Published: (2024)
Stochastic Submodular Bandits with Delayed Composite Anonymous Bandit Feedback
by: Pedramfar, Mohammad, et al.
Published: (2023)
by: Pedramfar, Mohammad, et al.
Published: (2023)
Online Clustering of Dueling Bandits
by: Wang, Zhiyong, et al.
Published: (2025)
by: Wang, Zhiyong, et al.
Published: (2025)
Multi-Player Approaches for Dueling Bandits
by: Raveh, Or, et al.
Published: (2024)
by: Raveh, Or, et al.
Published: (2024)
Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions
by: Oh, Youngmin
Published: (2026)
by: Oh, Youngmin
Published: (2026)
Improved Regret for Bandit Convex Optimization with Delayed Feedback
by: Wan, Yuanyu, et al.
Published: (2024)
by: Wan, Yuanyu, et al.
Published: (2024)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
by: Xia, Fanzeng, et al.
Published: (2024)
by: Xia, Fanzeng, et al.
Published: (2024)
LLM Routing with Dueling Feedback
by: Chiang, Chao-Kai, et al.
Published: (2025)
by: Chiang, Chao-Kai, et al.
Published: (2025)
Improving Clean Accuracy via a Tangent-Space Perspective on Adversarial Training
by: Yi, Bongsoo, et al.
Published: (2024)
by: Yi, Bongsoo, et al.
Published: (2024)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
by: Li, Xuheng, et al.
Published: (2024)
by: Li, Xuheng, et al.
Published: (2024)
The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits
by: Saad, El Mehdi, et al.
Published: (2026)
by: Saad, El Mehdi, et al.
Published: (2026)
Conversational Dueling Bandits in Generalized Linear Models
by: Yang, Shuhua, et al.
Published: (2024)
by: Yang, Shuhua, et al.
Published: (2024)
Bandit and Delayed Feedback in Online Structured Prediction
by: Shibukawa, Yuki, et al.
Published: (2025)
by: Shibukawa, Yuki, et al.
Published: (2025)
Adversarial Bandits with Multi-User Delayed Feedback: Theory and Application
by: Li, Yandi, et al.
Published: (2023)
by: Li, Yandi, et al.
Published: (2023)
Utility-based Dueling Bandits as a Partial Monitoring Game
by: Gajane, Pratik, et al.
Published: (2015)
by: Gajane, Pratik, et al.
Published: (2015)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
by: Sankagiri, Suryanarayana, et al.
Published: (2025)
by: Sankagiri, Suryanarayana, et al.
Published: (2025)
On Mitigating Affinity Bias through Bandits with Evolving Biased Feedback
by: Faw, Matthew, et al.
Published: (2025)
by: Faw, Matthew, et al.
Published: (2025)
Online Nonsubmodular Optimization with Delayed Feedback in the Bandit Setting
by: Yang, Sifan, et al.
Published: (2025)
by: Yang, Sifan, et al.
Published: (2025)
Neural Contextual Bandits Under Delayed Feedback Constraints
by: Moghimi, Mohammadali, et al.
Published: (2025)
by: Moghimi, Mohammadali, et al.
Published: (2025)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
by: Akash, S, et al.
Published: (2026)
by: Akash, S, et al.
Published: (2026)
Non-Stationary Dueling Bandits Under a Weighted Borda Criterion
by: Suk, Joe, et al.
Published: (2024)
by: Suk, Joe, et al.
Published: (2024)
When Can We Track Significant Preference Shifts in Dueling Bandits?
by: Suk, Joe, et al.
Published: (2023)
by: Suk, Joe, et al.
Published: (2023)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
by: Oh, Youngmin, et al.
Published: (2025)
by: Oh, Youngmin, et al.
Published: (2025)
Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling
by: Cheng, Yuwei, et al.
Published: (2024)
by: Cheng, Yuwei, et al.
Published: (2024)
Lipschitz Dueling Bandits over Continuous Action Spaces
by: Sharma, Mudit, et al.
Published: (2026)
by: Sharma, Mudit, et al.
Published: (2026)
Stochastic $k$-Submodular Bandits with Full Bandit Feedback
by: Nie, Guanyu, et al.
Published: (2024)
by: Nie, Guanyu, et al.
Published: (2024)
Improved Best-of-Both-Worlds Regret for Bandits with Delayed Feedback
by: Schlisselberg, Ofir, et al.
Published: (2025)
by: Schlisselberg, Ofir, et al.
Published: (2025)
A Best-of-both-worlds Algorithm for Bandits with Delayed Feedback with Robustness to Excessive Delays
by: Masoudian, Saeed, et al.
Published: (2023)
by: Masoudian, Saeed, et al.
Published: (2023)
Stochastic Online Conformal Prediction with Semi-Bandit Feedback
by: Ge, Haosen, et al.
Published: (2024)
by: Ge, Haosen, et al.
Published: (2024)
Merit-based Fair Combinatorial Semi-Bandit with Unrestricted Feedback Delays
by: Chen, Ziqun, et al.
Published: (2024)
by: Chen, Ziqun, et al.
Published: (2024)
Similar Items
-
Quantum Lipschitz Bandits
by: Yi, Bongsoo, et al.
Published: (2025) -
Linear and Neural Dueling Bandits with Delayed Feedback
by: Wang, Xiangyi, et al.
Published: (2026) -
Lipschitz Bandits with Stochastic Delayed Feedback
by: Liu, Zhongxuan, et al.
Published: (2025) -
Fusing Reward and Dueling Feedback in Stochastic Bandits
by: Wang, Xuchuang, et al.
Published: (2025) -
Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions
by: Kang, Yue, et al.
Published: (2025)