Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Shengbo, Sun, Hong, Li, Ke |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
Biased Dueling Bandits with Stochastic Delayed Feedback
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
Federated Linear Dueling Bandits
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
Direct Preference-Based Evolutionary Multi-Objective Optimization with Dueling Bandit
von: Huang, Tian, et al.
Veröffentlicht: (2023)
von: Huang, Tian, et al.
Veröffentlicht: (2023)
Online Clustering of Dueling Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
When Can We Track Significant Preference Shifts in Dueling Bandits?
von: Suk, Joe, et al.
Veröffentlicht: (2023)
von: Suk, Joe, et al.
Veröffentlicht: (2023)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
Conversational Dueling Bandits in Generalized Linear Models
von: Yang, Shuhua, et al.
Veröffentlicht: (2024)
von: Yang, Shuhua, et al.
Veröffentlicht: (2024)
Multi-Player Approaches for Dueling Bandits
von: Raveh, Or, et al.
Veröffentlicht: (2024)
von: Raveh, Or, et al.
Veröffentlicht: (2024)
LLM Routing with Dueling Feedback
von: Chiang, Chao-Kai, et al.
Veröffentlicht: (2025)
von: Chiang, Chao-Kai, et al.
Veröffentlicht: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits
von: Saad, El Mehdi, et al.
Veröffentlicht: (2026)
von: Saad, El Mehdi, et al.
Veröffentlicht: (2026)
DP-Dueling: Learning from Preference Feedback without Compromising User Privacy
von: Saha, Aadirupa, et al.
Veröffentlicht: (2024)
von: Saha, Aadirupa, et al.
Veröffentlicht: (2024)
Queueing Matching Bandits with Preference Feedback
von: Kim, Jung-hun, et al.
Veröffentlicht: (2024)
von: Kim, Jung-hun, et al.
Veröffentlicht: (2024)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
Utility-based Dueling Bandits as a Partial Monitoring Game
von: Gajane, Pratik, et al.
Veröffentlicht: (2015)
von: Gajane, Pratik, et al.
Veröffentlicht: (2015)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
von: Akash, S, et al.
Veröffentlicht: (2026)
von: Akash, S, et al.
Veröffentlicht: (2026)
Learning from Imperfect Human Feedback: a Tale from Corruption-Robust Dueling
von: Cheng, Yuwei, et al.
Veröffentlicht: (2024)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2024)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
von: Oh, Youngmin, et al.
Veröffentlicht: (2025)
von: Oh, Youngmin, et al.
Veröffentlicht: (2025)
Non-Stationary Dueling Bandits Under a Weighted Borda Criterion
von: Suk, Joe, et al.
Veröffentlicht: (2024)
von: Suk, Joe, et al.
Veröffentlicht: (2024)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
Lipschitz Dueling Bandits over Continuous Action Spaces
von: Sharma, Mudit, et al.
Veröffentlicht: (2026)
von: Sharma, Mudit, et al.
Veröffentlicht: (2026)
Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare
von: Ahmed, Maheed H., et al.
Veröffentlicht: (2026)
von: Ahmed, Maheed H., et al.
Veröffentlicht: (2026)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions
von: Oh, Youngmin
Veröffentlicht: (2026)
von: Oh, Youngmin
Veröffentlicht: (2026)
Latent Preference Bandits
von: Mwai, Newton, et al.
Veröffentlicht: (2025)
von: Mwai, Newton, et al.
Veröffentlicht: (2025)
Bandits with Preference Feedback: A Stackelberg Game Perspective
von: Pásztor, Barna, et al.
Veröffentlicht: (2024)
von: Pásztor, Barna, et al.
Veröffentlicht: (2024)
Graph Feedback Bandits with Similar Arms
von: Qi, Han, et al.
Veröffentlicht: (2024)
von: Qi, Han, et al.
Veröffentlicht: (2024)
Labels Matter More Than Models: Rethinking the Unsupervised Paradigm in Time Series Anomaly Detection
von: Zhong, Zhijie, et al.
Veröffentlicht: (2025)
von: Zhong, Zhijie, et al.
Veröffentlicht: (2025)
"More Than Words": Linking Music Preferences and Moral Values Through Lyrics
von: Preniqi, Vjosa, et al.
Veröffentlicht: (2022)
von: Preniqi, Vjosa, et al.
Veröffentlicht: (2022)
When Less Is More: Binary Feedback Can Outperform Ordinal Comparisons in Ranking Recovery
von: Xu, Shirong, et al.
Veröffentlicht: (2025)
von: Xu, Shirong, et al.
Veröffentlicht: (2025)
Learning to Play 7 Wonders Duel Without Human Supervision
von: Paolini, Giovanni, et al.
Veröffentlicht: (2024)
von: Paolini, Giovanni, et al.
Veröffentlicht: (2024)
Nearest Neighbour with Bandit Feedback
von: Pasteris, Stephen, et al.
Veröffentlicht: (2023)
von: Pasteris, Stephen, et al.
Veröffentlicht: (2023)
Adversarial Bandits with Multi-User Delayed Feedback: Theory and Application
von: Li, Yandi, et al.
Veröffentlicht: (2023)
von: Li, Yandi, et al.
Veröffentlicht: (2023)
Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning
von: Kim, Minkyu, et al.
Veröffentlicht: (2026)
von: Kim, Minkyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024) -
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026) -
Biased Dueling Bandits with Stochastic Delayed Feedback
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024) -
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025) -
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)