Federated Linear Dueling Bandits
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Xuhan, Hu, Yan, Li, Zhiyan, Wang, Zhiyong, Wang, Benyou, Dai, Zhongxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Linear and Neural Dueling Bandits with Delayed Feedback
par: Wang, Xiangyi, et autres
Publié: (2026)
par: Wang, Xiangyi, et autres
Publié: (2026)
Online Clustering of Dueling Bandits
par: Wang, Zhiyong, et autres
Publié: (2025)
par: Wang, Zhiyong, et autres
Publié: (2025)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
par: Verma, Arun, et autres
Publié: (2025)
par: Verma, Arun, et autres
Publié: (2025)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
par: Verma, Arun, et autres
Publié: (2024)
par: Verma, Arun, et autres
Publié: (2024)
Conversational Dueling Bandits in Generalized Linear Models
par: Yang, Shuhua, et autres
Publié: (2024)
par: Yang, Shuhua, et autres
Publié: (2024)
Biased Dueling Bandits with Stochastic Delayed Feedback
par: Yi, Bongsoo, et autres
Publié: (2024)
par: Yi, Bongsoo, et autres
Publié: (2024)
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
par: Lu, Pingchen, et autres
Publié: (2025)
par: Lu, Pingchen, et autres
Publié: (2025)
Multi-Player Approaches for Dueling Bandits
par: Raveh, Or, et autres
Publié: (2024)
par: Raveh, Or, et autres
Publié: (2024)
Large Language Model-Enhanced Multi-Armed Bandits
par: Sun, Jiahang, et autres
Publié: (2025)
par: Sun, Jiahang, et autres
Publié: (2025)
Fusing Reward and Dueling Feedback in Stochastic Bandits
par: Wang, Xuchuang, et autres
Publié: (2025)
par: Wang, Xuchuang, et autres
Publié: (2025)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
par: Li, Xuheng, et autres
Publié: (2024)
par: Li, Xuheng, et autres
Publié: (2024)
Robust Linear Dueling Bandits with Post-serving Context under Unknown Delays and Adversarial Corruptions
par: Oh, Youngmin
Publié: (2026)
par: Oh, Youngmin
Publié: (2026)
The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits
par: Saad, El Mehdi, et autres
Publié: (2026)
par: Saad, El Mehdi, et autres
Publié: (2026)
Meta-Prompt Optimization for LLM-Based Sequential Decision Making
par: Kong, Mingze, et autres
Publié: (2025)
par: Kong, Mingze, et autres
Publié: (2025)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
par: Sankagiri, Suryanarayana, et autres
Publié: (2025)
par: Sankagiri, Suryanarayana, et autres
Publié: (2025)
Utility-based Dueling Bandits as a Partial Monitoring Game
par: Gajane, Pratik, et autres
Publié: (2015)
par: Gajane, Pratik, et autres
Publié: (2015)
Federated Linear Contextual Bandits with Heterogeneous Clients
par: Blaser, Ethan, et autres
Publié: (2024)
par: Blaser, Ethan, et autres
Publié: (2024)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
par: Oh, Youngmin, et autres
Publié: (2025)
par: Oh, Youngmin, et autres
Publié: (2025)
When Can We Track Significant Preference Shifts in Dueling Bandits?
par: Suk, Joe, et autres
Publié: (2023)
par: Suk, Joe, et autres
Publié: (2023)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
par: Di, Qiwei, et autres
Publié: (2024)
par: Di, Qiwei, et autres
Publié: (2024)
Non-Stationary Dueling Bandits Under a Weighted Borda Criterion
par: Suk, Joe, et autres
Publié: (2024)
par: Suk, Joe, et autres
Publié: (2024)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
par: Xia, Fanzeng, et autres
Publié: (2024)
par: Xia, Fanzeng, et autres
Publié: (2024)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
par: Di, Qiwei, et autres
Publié: (2023)
par: Di, Qiwei, et autres
Publié: (2023)
Lipschitz Dueling Bandits over Continuous Action Spaces
par: Sharma, Mudit, et autres
Publié: (2026)
par: Sharma, Mudit, et autres
Publié: (2026)
Multi-User Dueling Bandits: A Fair Approach using Nash Social Welfare
par: Ahmed, Maheed H., et autres
Publié: (2026)
par: Ahmed, Maheed H., et autres
Publié: (2026)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
par: Wang, Zhiyong, et autres
Publié: (2024)
par: Wang, Zhiyong, et autres
Publié: (2024)
Cascading Bandits Robust to Adversarial Corruptions
par: Xie, Jize, et autres
Publié: (2025)
par: Xie, Jize, et autres
Publié: (2025)
Pure Exploration in Asynchronous Federated Bandits
par: Wang, Zichen, et autres
Publié: (2023)
par: Wang, Zichen, et autres
Publié: (2023)
Scaling Federated Linear Contextual Bandits via Sketching
par: Yang, Hantao, et autres
Publié: (2026)
par: Yang, Hantao, et autres
Publié: (2026)
Bayesian Bandit Algorithms with Approximate Inference in Stochastic Linear Bandits
par: Huang, Ziyi, et autres
Publié: (2024)
par: Huang, Ziyi, et autres
Publié: (2024)
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
par: Yang, Hantao, et autres
Publié: (2024)
par: Yang, Hantao, et autres
Publié: (2024)
Contextual Linear Bandits with Delay as Payoff
par: Zhang, Mengxiao, et autres
Publié: (2025)
par: Zhang, Mengxiao, et autres
Publié: (2025)
Model Unlearning via Sparse Autoencoder Subspace Guided Projections
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Best-of-Both-Worlds Multi-Dueling Bandits: Unified Algorithms for Stochastic and Adversarial Preferences under Condorcet and Borda Objectives
par: Akash, S, et autres
Publié: (2026)
par: Akash, S, et autres
Publié: (2026)
Robust Causal Bandits for Linear Models
par: Yan, Zirui, et autres
Publié: (2023)
par: Yan, Zirui, et autres
Publié: (2023)
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
par: Hong, Zhi, et autres
Publié: (2026)
par: Hong, Zhi, et autres
Publié: (2026)
LLM Routing with Dueling Feedback
par: Chiang, Chao-Kai, et autres
Publié: (2025)
par: Chiang, Chao-Kai, et autres
Publié: (2025)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Riemannian Dueling Optimization
par: Ren, Yuxuan, et autres
Publié: (2026)
par: Ren, Yuxuan, et autres
Publié: (2026)
Documents similaires
-
Linear and Neural Dueling Bandits with Delayed Feedback
par: Wang, Xiangyi, et autres
Publié: (2026) -
Online Clustering of Dueling Bandits
par: Wang, Zhiyong, et autres
Publié: (2025) -
Active Human Feedback Collection via Neural Contextual Dueling Bandits
par: Verma, Arun, et autres
Publié: (2025) -
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
par: Verma, Arun, et autres
Publié: (2024) -
Conversational Dueling Bandits in Generalized Linear Models
par: Yang, Shuhua, et autres
Publié: (2024)