Online Clustering of Dueling Bandits
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Zhiyong, Sun, Jiahang, Kong, Mingze, Xie, Jize, Hu, Qinghua, Lui, John C. S., Dai, Zhongxiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
Large Language Model-Enhanced Multi-Armed Bandits
von: Sun, Jiahang, et al.
Veröffentlicht: (2025)
von: Sun, Jiahang, et al.
Veröffentlicht: (2025)
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2024)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2024)
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
von: Hong, Zhi, et al.
Veröffentlicht: (2026)
von: Hong, Zhi, et al.
Veröffentlicht: (2026)
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
Demystifying Online Clustering of Bandits: Enhanced Exploration Under Stochastic and Smoothed Adversarial Contexts
von: Li, Zhuohua, et al.
Veröffentlicht: (2025)
von: Li, Zhuohua, et al.
Veröffentlicht: (2025)
Federated Linear Dueling Bandits
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
T-POP: Test-Time Personalization with Online Preference Feedback
von: Qu, Zikun, et al.
Veröffentlicht: (2025)
von: Qu, Zikun, et al.
Veröffentlicht: (2025)
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
von: Yang, Hantao, et al.
Veröffentlicht: (2024)
von: Yang, Hantao, et al.
Veröffentlicht: (2024)
Leveraging the Power of Conversations: Optimal Key Term Selection in Conversational Contextual Bandits
von: Liu, Maoli, et al.
Veröffentlicht: (2025)
von: Liu, Maoli, et al.
Veröffentlicht: (2025)
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
von: Lu, Pingchen, et al.
Veröffentlicht: (2025)
von: Lu, Pingchen, et al.
Veröffentlicht: (2025)
FedConPE: Efficient Federated Conversational Bandits with Heterogeneous Clients
von: Li, Zhuohua, et al.
Veröffentlicht: (2024)
von: Li, Zhuohua, et al.
Veröffentlicht: (2024)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
Meta-Prompt Optimization for LLM-Based Sequential Decision Making
von: Kong, Mingze, et al.
Veröffentlicht: (2025)
von: Kong, Mingze, et al.
Veröffentlicht: (2025)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
Contextual Combinatorial Bandits with Probabilistically Triggered Arms
von: Liu, Xutong, et al.
Veröffentlicht: (2023)
von: Liu, Xutong, et al.
Veröffentlicht: (2023)
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
von: Zhang, Zeyu, et al.
Veröffentlicht: (2026)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2026)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Batch-Size Independent Regret Bounds for Combinatorial Semi-Bandits with Probabilistically Triggered Arms or Independent Arms
von: Liu, Xutong, et al.
Veröffentlicht: (2022)
von: Liu, Xutong, et al.
Veröffentlicht: (2022)
Cascading Bandits Robust to Adversarial Corruptions
von: Xie, Jize, et al.
Veröffentlicht: (2025)
von: Xie, Jize, et al.
Veröffentlicht: (2025)
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
von: Dai, Xiangxiang, et al.
Veröffentlicht: (2024)
von: Dai, Xiangxiang, et al.
Veröffentlicht: (2024)
Every Node is Different: Dynamically Fusing Self-Supervised Tasks for Attributed Graph Clustering
von: Zhu, Pengfei, et al.
Veröffentlicht: (2024)
von: Zhu, Pengfei, et al.
Veröffentlicht: (2024)
Learning to Play 7 Wonders Duel Without Human Supervision
von: Paolini, Giovanni, et al.
Veröffentlicht: (2024)
von: Paolini, Giovanni, et al.
Veröffentlicht: (2024)
Neural Combinatorial Clustered Bandits for Recommendation Systems
von: Atalar, Baran, et al.
Veröffentlicht: (2024)
von: Atalar, Baran, et al.
Veröffentlicht: (2024)
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
von: Han, Ziyi, et al.
Veröffentlicht: (2025)
von: Han, Ziyi, et al.
Veröffentlicht: (2025)
Refining Adaptive Zeroth-Order Optimization at Ease
von: Shu, Yao, et al.
Veröffentlicht: (2025)
von: Shu, Yao, et al.
Veröffentlicht: (2025)
Revisiting Clustering of Neural Bandits: Selective Reinitialization for Mitigating Loss of Plasticity
von: Su, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Su, Zhiyuan, et al.
Veröffentlicht: (2025)
Learning To Play Atari Games Using Dueling Q-Learning and Hebbian Plasticity
von: Salehin, Md Ashfaq
Veröffentlicht: (2024)
von: Salehin, Md Ashfaq
Veröffentlicht: (2024)
Expected Possession Value of Control and Duel Actions for Soccer Player's Skills Estimation
von: Shelopugin, Andrei
Veröffentlicht: (2024)
von: Shelopugin, Andrei
Veröffentlicht: (2024)
ALSO: Adversarial Online Strategy Optimization for Social Agents
von: Li, Xiang, et al.
Veröffentlicht: (2026)
von: Li, Xiang, et al.
Veröffentlicht: (2026)
Calibration-Gated LLM Pseudo-Observations for Online Contextual Bandits
von: Pershin, Maksim, et al.
Veröffentlicht: (2026)
von: Pershin, Maksim, et al.
Veröffentlicht: (2026)
Learning Tennis Strategy Through Curriculum-Based Dueling Double Deep Q-Networks
von: Mohan, Vishnu
Veröffentlicht: (2025)
von: Mohan, Vishnu
Veröffentlicht: (2025)
A Controlled Study of Double DQN and Dueling DQN Under Cross-Environment Transfer
von: Nasir, Azkaa, et al.
Veröffentlicht: (2026)
von: Nasir, Azkaa, et al.
Veröffentlicht: (2026)
Manifold-based Incomplete Multi-view Clustering via Bi-Consistency Guidance
von: Wang, Huibing, et al.
Veröffentlicht: (2024)
von: Wang, Huibing, et al.
Veröffentlicht: (2024)
Networked Restless Multi-Arm Bandits with Reinforcement Learning
von: Zhang, Hanmo, et al.
Veröffentlicht: (2025)
von: Zhang, Hanmo, et al.
Veröffentlicht: (2025)
Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective
von: Hu, Xiao, et al.
Veröffentlicht: (2026)
von: Hu, Xiao, et al.
Veröffentlicht: (2026)
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
von: Chen, Xinzhu, et al.
Veröffentlicht: (2025)
von: Chen, Xinzhu, et al.
Veröffentlicht: (2025)
Provable Anytime Ensemble Sampling Algorithms in Nonlinear Contextual Bandits
von: Sun, Jiazheng, et al.
Veröffentlicht: (2025)
von: Sun, Jiazheng, et al.
Veröffentlicht: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026) -
Large Language Model-Enhanced Multi-Armed Bandits
von: Sun, Jiahang, et al.
Veröffentlicht: (2025) -
Variance-Dependent Regret Bounds for Non-stationary Linear Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2024) -
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
von: Hong, Zhi, et al.
Veröffentlicht: (2026) -
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)