Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Donghao, Shi, Chengshuai, Ou, Weijuan, Shen, Cong, Yang, Jing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Prompt Optimization Through the Lens of Best Arm Identification
by: Shi, Chengshuai, et al.
Published: (2024)
by: Shi, Chengshuai, et al.
Published: (2024)
Greedy Sampling Is Provably Efficient for RLHF
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses
by: Wu, Di, et al.
Published: (2026)
by: Wu, Di, et al.
Published: (2026)
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
by: Lu, Pingchen, et al.
Published: (2025)
by: Lu, Pingchen, et al.
Published: (2025)
A Shared Low-Rank Adaptation Approach to Personalized RLHF
by: Liu, Renpu, et al.
Published: (2025)
by: Liu, Renpu, et al.
Published: (2025)
Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory
by: Dong, Songwei, et al.
Published: (2026)
by: Dong, Songwei, et al.
Published: (2026)
Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis
by: Huang, Ruiquan, et al.
Published: (2025)
by: Huang, Ruiquan, et al.
Published: (2025)
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
by: Hong, Zhi, et al.
Published: (2026)
by: Hong, Zhi, et al.
Published: (2026)
Prompt Optimization with Logged Bandit Data
by: Kiyohara, Haruka, et al.
Published: (2025)
by: Kiyohara, Haruka, et al.
Published: (2025)
On the Learn-to-Optimize Capabilities of Transformers in In-Context Sparse Recovery
by: Liu, Renpu, et al.
Published: (2024)
by: Liu, Renpu, et al.
Published: (2024)
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback
by: Xiong, Guojun, et al.
Published: (2024)
by: Xiong, Guojun, et al.
Published: (2024)
Online Prompt Pricing based on Combinatorial Multi-Armed Bandit and Hierarchical Stackelberg Game
by: Li, Meiling, et al.
Published: (2024)
by: Li, Meiling, et al.
Published: (2024)
KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
by: Ran, Dezhi, et al.
Published: (2025)
by: Ran, Dezhi, et al.
Published: (2025)
Cost-Aware Optimal Pairwise Pure Exploration
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
Harnessing the Power of Federated Learning in Federated Contextual Bandits
by: Shi, Chengshuai, et al.
Published: (2023)
by: Shi, Chengshuai, et al.
Published: (2023)
Multi-Armed Bandits-Based Optimization of Decision Trees
by: Shanto, Hasibul Karim, et al.
Published: (2025)
by: Shanto, Hasibul Karim, et al.
Published: (2025)
Data-adaptive Differentially Private Prompt Synthesis for In-Context Learning
by: Gao, Fengyu, et al.
Published: (2024)
by: Gao, Fengyu, et al.
Published: (2024)
BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms
by: Hou, Yunlong, et al.
Published: (2025)
by: Hou, Yunlong, et al.
Published: (2025)
Radiology Report Generation via Multi-objective Preference Optimization
by: Xiao, Ting, et al.
Published: (2024)
by: Xiao, Ting, et al.
Published: (2024)
Resource Efficient Sleep Staging via Multi-Level Masking and Prompt Learning
by: Ai, Lejun, et al.
Published: (2025)
by: Ai, Lejun, et al.
Published: (2025)
BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
by: Xu, Iris, et al.
Published: (2025)
by: Xu, Iris, et al.
Published: (2025)
Flickering Multi-Armed Bandits
by: Chakraborty, Sourav, et al.
Published: (2026)
by: Chakraborty, Sourav, et al.
Published: (2026)
Personalized Federated Continual Learning via Multi-granularity Prompt
by: Yu, Hao, et al.
Published: (2024)
by: Yu, Hao, et al.
Published: (2024)
Large Language Model-Enhanced Multi-Armed Bandits
by: Sun, Jiahang, et al.
Published: (2025)
by: Sun, Jiahang, et al.
Published: (2025)
Global Rewards in Restless Multi-Armed Bandits
by: Raman, Naveen, et al.
Published: (2024)
by: Raman, Naveen, et al.
Published: (2024)
Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems
by: Zhang, Jusheng, et al.
Published: (2026)
by: Zhang, Jusheng, et al.
Published: (2026)
Efficient Prompt Tuning by Multi-Space Projection and Prompt Fusion
by: Lan, Pengxiang, et al.
Published: (2024)
by: Lan, Pengxiang, et al.
Published: (2024)
Deceptive Exploration in Multi-armed Bandits
by: Vurankaya, I. Arda, et al.
Published: (2025)
by: Vurankaya, I. Arda, et al.
Published: (2025)
Causally Abstracted Multi-armed Bandits
by: Zennaro, Fabio Massimo, et al.
Published: (2024)
by: Zennaro, Fabio Massimo, et al.
Published: (2024)
Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization
by: Zhao, Yunfan, et al.
Published: (2023)
by: Zhao, Yunfan, et al.
Published: (2023)
Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits
by: Jeong, Woojin, et al.
Published: (2024)
by: Jeong, Woojin, et al.
Published: (2024)
Co-Exploration and Co-Exploitation via Shared Structure in Multi-Task Bandits
by: Mukherjee, Sumantrak, et al.
Published: (2025)
by: Mukherjee, Sumantrak, et al.
Published: (2025)
FedConPE: Efficient Federated Conversational Bandits with Heterogeneous Clients
by: Li, Zhuohua, et al.
Published: (2024)
by: Li, Zhuohua, et al.
Published: (2024)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
by: Li, Gang, et al.
Published: (2025)
by: Li, Gang, et al.
Published: (2025)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
by: Yang, Zhicheng, et al.
Published: (2023)
by: Yang, Zhicheng, et al.
Published: (2023)
Multi-Armed Bandits With Best-Action Queries
by: Bacchiocchi, Francesco, et al.
Published: (2026)
by: Bacchiocchi, Francesco, et al.
Published: (2026)
Efficient Data Selection for Multimodal Models via Incremental Optimization Utility
by: Jing, Jinhao, et al.
Published: (2026)
by: Jing, Jinhao, et al.
Published: (2026)
Impatient Bandits: Optimizing for the Long-Term Without Delay
by: Zhang, Kelly W., et al.
Published: (2025)
by: Zhang, Kelly W., et al.
Published: (2025)
Fair Algorithms with Probing for Multi-Agent Multi-Armed Bandits
by: Xu, Tianyi, et al.
Published: (2025)
by: Xu, Tianyi, et al.
Published: (2025)
Efficient Adversarial Attacks on High-dimensional Offline Bandits
by: Hosseini, Seyed Mohammad Hadi, et al.
Published: (2026)
by: Hosseini, Seyed Mohammad Hadi, et al.
Published: (2026)
Similar Items
-
Efficient Prompt Optimization Through the Lens of Best Arm Identification
by: Shi, Chengshuai, et al.
Published: (2024) -
Greedy Sampling Is Provably Efficient for RLHF
by: Wu, Di, et al.
Published: (2025) -
$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses
by: Wu, Di, et al.
Published: (2026) -
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
by: Lu, Pingchen, et al.
Published: (2025) -
A Shared Low-Rank Adaptation Approach to Personalized RLHF
by: Liu, Renpu, et al.
Published: (2025)