Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Verma, Arun, Dai, Zhongxiang, Lin, Xiaoqiang, Jaillet, Patrick, Low, Bryan Kian Hsiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Prompt Optimization with Human Feedback
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2024)
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2024)
Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2023)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2023)
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Online Clustering of Dueling Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
Incentivizing Truthfulness and Collaborative Fairness in Bayesian Learning
von: Sim, Rachael Hwee Ling, et al.
Veröffentlicht: (2026)
von: Sim, Rachael Hwee Ling, et al.
Veröffentlicht: (2026)
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
Helpful or Harmful Data? Fine-tuning-free Shapley Attribution for Explaining Language Model Predictions
von: Wang, Jingtan, et al.
Veröffentlicht: (2024)
von: Wang, Jingtan, et al.
Veröffentlicht: (2024)
DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
REFRAG: Rethinking RAG based Decoding
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
von: Tran, Thanh Q., et al.
Veröffentlicht: (2026)
von: Tran, Thanh Q., et al.
Veröffentlicht: (2026)
Dependency Structure Search Bayesian Optimization for Decision Making Models
von: Rajpal, Mohit, et al.
Veröffentlicht: (2023)
von: Rajpal, Mohit, et al.
Veröffentlicht: (2023)
DETAIL: Task DEmonsTration Attribution for Interpretable In-context Learning
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
Source Attribution for Large Language Model-Generated Data
von: Wang, Jingtan, et al.
Veröffentlicht: (2023)
von: Wang, Jingtan, et al.
Veröffentlicht: (2023)
BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks
von: Chew, Ruth Wan Theng, et al.
Veröffentlicht: (2026)
von: Chew, Ruth Wan Theng, et al.
Veröffentlicht: (2026)
Robustifying and Boosting Training-Free Neural Architecture Search
von: He, Zhenfeng, et al.
Veröffentlicht: (2024)
von: He, Zhenfeng, et al.
Veröffentlicht: (2024)
MASPOB: Bandit-Based Prompt Optimization for Multi-Agent Systems with Graph Neural Networks
von: Hong, Zhi, et al.
Veröffentlicht: (2026)
von: Hong, Zhi, et al.
Veröffentlicht: (2026)
On Newton's Method to Unlearn Neural Networks
von: Bui, Nhung, et al.
Veröffentlicht: (2024)
von: Bui, Nhung, et al.
Veröffentlicht: (2024)
Data value estimation on private gradients
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
DeRDaVa: Deletion-Robust Data Valuation for Machine Learning
von: Tian, Xiao, et al.
Veröffentlicht: (2023)
von: Tian, Xiao, et al.
Veröffentlicht: (2023)
INO-SGD: Addressing Utility Imbalance under Individualized Differential Privacy
von: Tian, Xiao, et al.
Veröffentlicht: (2026)
von: Tian, Xiao, et al.
Veröffentlicht: (2026)
MineDraft: A Framework for Batch Parallel Speculative Decoding
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
Federated Linear Dueling Bandits
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
von: Shu, Yao, et al.
Veröffentlicht: (2024)
von: Shu, Yao, et al.
Veröffentlicht: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
T-POP: Test-Time Personalization with Online Preference Feedback
von: Qu, Zikun, et al.
Veröffentlicht: (2025)
von: Qu, Zikun, et al.
Veröffentlicht: (2025)
Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
von: Xia, Fanzeng, et al.
Veröffentlicht: (2024)
FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits
von: Lu, Pingchen, et al.
Veröffentlicht: (2025)
von: Lu, Pingchen, et al.
Veröffentlicht: (2025)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
von: Huang, Zixuan, et al.
Veröffentlicht: (2025)
von: Huang, Zixuan, et al.
Veröffentlicht: (2025)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
Paid with Models: Optimal Contract Design for Collaborative Machine Learning
von: Wang, Bingchen, et al.
Veröffentlicht: (2024)
von: Wang, Bingchen, et al.
Veröffentlicht: (2024)
Adjusted Expected Improvement for Cumulative Regret Minimization in Noisy Bayesian Optimization
von: Hu, Shouri, et al.
Veröffentlicht: (2022)
von: Hu, Shouri, et al.
Veröffentlicht: (2022)
Large Language Model-Enhanced Multi-Armed Bandits
von: Sun, Jiahang, et al.
Veröffentlicht: (2025)
von: Sun, Jiahang, et al.
Veröffentlicht: (2025)
Is Data Shapley Not Better than Random in Data Selection? Ask NASH
von: Tian, Xiao, et al.
Veröffentlicht: (2026)
von: Tian, Xiao, et al.
Veröffentlicht: (2026)
How Hard Can It Be? Hardness-Aware Multi-Objective Unlearning
von: Chen, Jiangwei, et al.
Veröffentlicht: (2026)
von: Chen, Jiangwei, et al.
Veröffentlicht: (2026)
Decentralized Sum-of-Nonconvex Optimization
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Prompt Optimization with Human Feedback
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024) -
Active Human Feedback Collection via Neural Contextual Dueling Bandits
von: Verma, Arun, et al.
Veröffentlicht: (2025) -
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025) -
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026) -
Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2024)