Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare
Fuente:
arXiv
Salvato in:
| Autori principali: | Ahmed, Maheed H., Ghasemi, Mahsa |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025)
Multi-Player Approaches for Dueling Bandits
di: Raveh, Or, et al.
Pubblicazione: (2024)
di: Raveh, Or, et al.
Pubblicazione: (2024)
Improved Algorithms for Nash Welfare in Linear Bandits
di: Sarkar, Dhruv, et al.
Pubblicazione: (2026)
di: Sarkar, Dhruv, et al.
Pubblicazione: (2026)
Separation Assurance between Heterogeneous Fleets of Small Unmanned Aerial Systems via Multi-Agent Reinforcement Learning
di: Sharifi, Iman, et al.
Pubblicazione: (2026)
di: Sharifi, Iman, et al.
Pubblicazione: (2026)
Federated Linear Dueling Bandits
di: Huang, Xuhan, et al.
Pubblicazione: (2025)
di: Huang, Xuhan, et al.
Pubblicazione: (2025)
Online Clustering of Dueling Bandits
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
Partial Structure Discovery is Sufficient for No-regret Learning in Causal Bandits
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2024)
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2024)
Biased Dueling Bandits with Stochastic Delayed Feedback
di: Yi, Bongsoo, et al.
Pubblicazione: (2024)
di: Yi, Bongsoo, et al.
Pubblicazione: (2024)
The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits
di: Saad, El Mehdi, et al.
Pubblicazione: (2026)
di: Saad, El Mehdi, et al.
Pubblicazione: (2026)
Linear and Neural Dueling Bandits with Delayed Feedback
di: Wang, Xiangyi, et al.
Pubblicazione: (2026)
di: Wang, Xiangyi, et al.
Pubblicazione: (2026)
Conversational Dueling Bandits in Generalized Linear Models
di: Yang, Shuhua, et al.
Pubblicazione: (2024)
di: Yang, Shuhua, et al.
Pubblicazione: (2024)
Fusing Reward and Dueling Feedback in Stochastic Bandits
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
Utility-based Dueling Bandits as a Partial Monitoring Game
di: Gajane, Pratik, et al.
Pubblicazione: (2015)
di: Gajane, Pratik, et al.
Pubblicazione: (2015)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
di: Sankagiri, Suryanarayana, et al.
Pubblicazione: (2025)
di: Sankagiri, Suryanarayana, et al.
Pubblicazione: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
di: Li, Xuheng, et al.
Pubblicazione: (2024)
di: Li, Xuheng, et al.
Pubblicazione: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
When Can We Track Significant Preference Shifts in Dueling Bandits?
di: Suk, Joe, et al.
Pubblicazione: (2023)
di: Suk, Joe, et al.
Pubblicazione: (2023)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
di: Di, Qiwei, et al.
Pubblicazione: (2024)
di: Di, Qiwei, et al.
Pubblicazione: (2024)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
di: Oh, Youngmin, et al.
Pubblicazione: (2025)
di: Oh, Youngmin, et al.
Pubblicazione: (2025)
Non-Stationary Dueling Bandits Under a Weighted Borda Criterion
di: Suk, Joe, et al.
Pubblicazione: (2024)
di: Suk, Joe, et al.
Pubblicazione: (2024)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
di: Verma, Arun, et al.
Pubblicazione: (2024)
di: Verma, Arun, et al.
Pubblicazione: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
di: Di, Qiwei, et al.
Pubblicazione: (2023)
di: Di, Qiwei, et al.
Pubblicazione: (2023)
Lipschitz Dueling Bandits over Continuous Action Spaces
di: Sharma, Mudit, et al.
Pubblicazione: (2026)
di: Sharma, Mudit, et al.
Pubblicazione: (2026)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
di: Wang, Shengbo, et al.
Pubblicazione: (2025)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
di: Xia, Fanzeng, et al.
Pubblicazione: (2024)
di: Xia, Fanzeng, et al.
Pubblicazione: (2024)
Falcon: Fair Active Learning using Multi-armed Bandits
di: Tae, Ki Hyun, et al.
Pubblicazione: (2024)
di: Tae, Ki Hyun, et al.
Pubblicazione: (2024)
Revisiting Social Welfare in Bandits: UCB is (Nearly) All You Need
di: Sarkar, Dhruv, et al.
Pubblicazione: (2025)
di: Sarkar, Dhruv, et al.
Pubblicazione: (2025)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
di: Akash, S, et al.
Pubblicazione: (2026)
di: Akash, S, et al.
Pubblicazione: (2026)
Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions
di: Oh, Youngmin
Pubblicazione: (2026)
di: Oh, Youngmin
Pubblicazione: (2026)
On the Regularity and Fairness of Combinatorial Multi-Armed Bandit
di: Wu, Xiaoyi, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyi, et al.
Pubblicazione: (2025)
Learning When to Trust in Contextual Bandits
di: Ghasemi, Majid, et al.
Pubblicazione: (2026)
di: Ghasemi, Majid, et al.
Pubblicazione: (2026)
No-Regret Learning for Fair Multi-Agent Social Welfare Optimization
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
di: Zhang, Mengxiao, et al.
Pubblicazione: (2024)
Fairness of Exposure in Online Restless Multi-armed Bandits
di: Sood, Archit, et al.
Pubblicazione: (2024)
di: Sood, Archit, et al.
Pubblicazione: (2024)
Multi-Agent Combinatorial-Multi-Armed-Bandit framework for the Submodular Welfare Problem under Bandit Feedback
di: Pokhriyal, Subham, et al.
Pubblicazione: (2026)
di: Pokhriyal, Subham, et al.
Pubblicazione: (2026)
BanditQ: Fair Bandits with Guaranteed Rewards
di: Sinha, Abhishek
Pubblicazione: (2023)
di: Sinha, Abhishek
Pubblicazione: (2023)
On the Low-Complexity of Fair Learning for Combinatorial Multi-Armed Bandit
di: Wu, Xiaoyi, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyi, et al.
Pubblicazione: (2025)
LLM Routing with Dueling Feedback
di: Chiang, Chao-Kai, et al.
Pubblicazione: (2025)
di: Chiang, Chao-Kai, et al.
Pubblicazione: (2025)
Fair Algorithms with Probing for Multi-Agent Multi-Armed Bandits
di: Xu, Tianyi, et al.
Pubblicazione: (2025)
di: Xu, Tianyi, et al.
Pubblicazione: (2025)
Multi-Objective Multi-Agent Bandits: From Learning Efficiency to Fairness Optimization
di: Wang, John, et al.
Pubblicazione: (2026)
di: Wang, John, et al.
Pubblicazione: (2026)
DP-Dueling: Learning from Preference Feedback without Compromising User Privacy
di: Saha, Aadirupa, et al.
Pubblicazione: (2024)
di: Saha, Aadirupa, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Reinforcement Learning from Multi-level and Episodic Human Feedback
di: Elahi, Muhammad Qasim, et al.
Pubblicazione: (2025) -
Multi-Player Approaches for Dueling Bandits
di: Raveh, Or, et al.
Pubblicazione: (2024) -
Improved Algorithms for Nash Welfare in Linear Bandits
di: Sarkar, Dhruv, et al.
Pubblicazione: (2026) -
Separation Assurance between Heterogeneous Fleets of Small Unmanned Aerial Systems via Multi-Agent Reinforcement Learning
di: Sharifi, Iman, et al.
Pubblicazione: (2026) -
Federated Linear Dueling Bandits
di: Huang, Xuhan, et al.
Pubblicazione: (2025)