Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Poon, Manhin, Dai, XiangXiang, Liu, Xutong, Kong, Fang, Lui, John C. S., Zuo, Jinhang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contextual Combinatorial Bandits with Probabilistically Triggered Arms
di: Liu, Xutong, et al.
Pubblicazione: (2023)
di: Liu, Xutong, et al.
Pubblicazione: (2023)
Stochastic Bandits Robust to Adversarial Attacks
di: Wang, Xuchuang, et al.
Pubblicazione: (2024)
di: Wang, Xuchuang, et al.
Pubblicazione: (2024)
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
Offline Learning for Combinatorial Multi-armed Bandits
di: Liu, Xutong, et al.
Pubblicazione: (2025)
di: Liu, Xutong, et al.
Pubblicazione: (2025)
Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback
di: Zeng, Qirun, et al.
Pubblicazione: (2026)
di: Zeng, Qirun, et al.
Pubblicazione: (2026)
Cost-Effective Online Multi-LLM Selection with Versatile Reward Models
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
Fusing Reward and Dueling Feedback in Stochastic Bandits
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
di: Wang, Xuchuang, et al.
Pubblicazione: (2025)
Batch-Size Independent Regret Bounds for Combinatorial Semi-Bandits with Probabilistically Triggered Arms or Independent Arms
di: Liu, Xutong, et al.
Pubblicazione: (2022)
di: Liu, Xutong, et al.
Pubblicazione: (2022)
Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
di: Liu, Xutong, et al.
Pubblicazione: (2025)
di: Liu, Xutong, et al.
Pubblicazione: (2025)
Combinatorial Multivariant Multi-Armed Bandits with Applications to Episodic Reinforcement Learning and Beyond
di: Liu, Xutong, et al.
Pubblicazione: (2024)
di: Liu, Xutong, et al.
Pubblicazione: (2024)
Combinatorial Logistic Bandits
di: Liu, Xutong, et al.
Pubblicazione: (2024)
di: Liu, Xutong, et al.
Pubblicazione: (2024)
Leveraging the Power of Conversations: Optimal Key Term Selection in Conversational Contextual Bandits
di: Liu, Maoli, et al.
Pubblicazione: (2025)
di: Liu, Maoli, et al.
Pubblicazione: (2025)
Federated Contextual Cascading Bandits with Asynchronous Communication and Heterogeneous Users
di: Yang, Hantao, et al.
Pubblicazione: (2024)
di: Yang, Hantao, et al.
Pubblicazione: (2024)
A Multi-Agent Conversational Bandit Approach to Online Evaluation and Selection of User-Aligned LLM Responses
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025)
Demystifying Online Clustering of Bandits: Enhanced Exploration Under Stochastic and Smoothed Adversarial Contexts
di: Li, Zhuohua, et al.
Pubblicazione: (2025)
di: Li, Zhuohua, et al.
Pubblicazione: (2025)
Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
di: Zhang, Zeyu, et al.
Pubblicazione: (2026)
di: Zhang, Zeyu, et al.
Pubblicazione: (2026)
Scaling Federated Linear Contextual Bandits via Sketching
di: Yang, Hantao, et al.
Pubblicazione: (2026)
di: Yang, Hantao, et al.
Pubblicazione: (2026)
Online Clustering of Dueling Bandits
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
di: Wang, Zhiyong, et al.
Pubblicazione: (2025)
Offline Clustering of Linear Bandits: The Power of Clusters under Limited Data
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
Faster, Smaller, and Smarter: Task-Aware Expert Merging for Online MoE Inference
di: Han, Ziyi, et al.
Pubblicazione: (2025)
di: Han, Ziyi, et al.
Pubblicazione: (2025)
Multi-Agent Stochastic Bandits Robust to Adversarial Corruptions
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2024)
Continuous Semantic Caching for Low-Cost LLM Serving
di: Atalar, Baran, et al.
Pubblicazione: (2026)
di: Atalar, Baran, et al.
Pubblicazione: (2026)
Quantum Algorithm for Online Exp-concave Optimization
di: He, Jianhao, et al.
Pubblicazione: (2024)
di: He, Jianhao, et al.
Pubblicazione: (2024)
Heterogeneous Multi-Agent Bandits with Parsimonious Hints
di: Mirfakhar, Amirmahdi, et al.
Pubblicazione: (2025)
di: Mirfakhar, Amirmahdi, et al.
Pubblicazione: (2025)
Online Learning to Rank under Corruption: A Robust Cascading Bandits Approach
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2025)
di: Ghaffari, Fatemeh, et al.
Pubblicazione: (2025)
AxiomVision: Accuracy-Guaranteed Adaptive Visual Model Selection for Perspective-Aware Video Analytics
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
di: Dai, Xiangxiang, et al.
Pubblicazione: (2024)
Practical Adversarial Attacks on Stochastic Bandits via Fake Data Injection
di: Zeng, Qirun, et al.
Pubblicazione: (2025)
di: Zeng, Qirun, et al.
Pubblicazione: (2025)
Which LLM to Play? Convergence-Aware Online Model Selection with Time-Increasing Bandits
di: Xia, Yu, et al.
Pubblicazione: (2024)
di: Xia, Yu, et al.
Pubblicazione: (2024)
Active Context Selection Improves Simple Regret in Contextual Bandits
di: Shahverdikondori, Mohammad, et al.
Pubblicazione: (2026)
di: Shahverdikondori, Mohammad, et al.
Pubblicazione: (2026)
Large Language Model-Enhanced Multi-Armed Bandits
di: Sun, Jiahang, et al.
Pubblicazione: (2025)
di: Sun, Jiahang, et al.
Pubblicazione: (2025)
Calibration-Gated LLM Pseudo-Observations for Online Contextual Bandits
di: Pershin, Maksim, et al.
Pubblicazione: (2026)
di: Pershin, Maksim, et al.
Pubblicazione: (2026)
HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
di: Han, Ziyi, et al.
Pubblicazione: (2025)
di: Han, Ziyi, et al.
Pubblicazione: (2025)
Contextual Bandits for Unbounded Context Distributions
di: Zhao, Puning, et al.
Pubblicazione: (2024)
di: Zhao, Puning, et al.
Pubblicazione: (2024)
Causal Contextual Bandits with Adaptive Context
di: Madhavan, Rahul, et al.
Pubblicazione: (2024)
di: Madhavan, Rahul, et al.
Pubblicazione: (2024)
Constrained Contextual Bandits with Adversarial Contexts
di: Sarkar, Dhruv, et al.
Pubblicazione: (2026)
di: Sarkar, Dhruv, et al.
Pubblicazione: (2026)
Online Statistical Inference for Contextual Bandits via Stochastic Gradient Descent
di: Chang, Xiangyu, et al.
Pubblicazione: (2022)
di: Chang, Xiangyu, et al.
Pubblicazione: (2022)
Truthful Reverse Auctions for Adaptive Selection via Contextual Multi-Armed Bandits
di: Patra, Pronoy, et al.
Pubblicazione: (2026)
di: Patra, Pronoy, et al.
Pubblicazione: (2026)
Unlearning Offline Stochastic Multi-Armed Bandits
di: Ye, Zichun, et al.
Pubblicazione: (2026)
di: Ye, Zichun, et al.
Pubblicazione: (2026)
FedConPE: Efficient Federated Conversational Bandits with Heterogeneous Clients
di: Li, Zhuohua, et al.
Pubblicazione: (2024)
di: Li, Zhuohua, et al.
Pubblicazione: (2024)
Heterogeneous Multi-agent Multi-armed Bandits on Stochastic Block Models
di: Xu, Mengfan, et al.
Pubblicazione: (2025)
di: Xu, Mengfan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Contextual Combinatorial Bandits with Probabilistically Triggered Arms
di: Liu, Xutong, et al.
Pubblicazione: (2023) -
Stochastic Bandits Robust to Adversarial Attacks
di: Wang, Xuchuang, et al.
Pubblicazione: (2024) -
A Unified Online-Offline Framework for Co-Branding Campaign Recommendations
di: Dai, Xiangxiang, et al.
Pubblicazione: (2025) -
Offline Learning for Combinatorial Multi-armed Bandits
di: Liu, Xutong, et al.
Pubblicazione: (2025) -
Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback
di: Zeng, Qirun, et al.
Pubblicazione: (2026)