Active Human Feedback Collection via Neural Contextual Dueling Bandits
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Verma, Arun, Lin, Xiaoqiang, Dai, Zhongxiang, Rus, Daniela, Low, Bryan Kian Hsiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
Prompt Optimization with Human Feedback
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024)
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
von: Verma, Arun, et al.
Veröffentlicht: (2025)
von: Verma, Arun, et al.
Veröffentlicht: (2025)
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)
Robustifying and Boosting Training-Free Neural Architecture Search
von: He, Zhenfeng, et al.
Veröffentlicht: (2024)
von: He, Zhenfeng, et al.
Veröffentlicht: (2024)
BarrierSteer: LLM Safety via Learning Barrier Steering
von: Tran, Thanh Q., et al.
Veröffentlicht: (2026)
von: Tran, Thanh Q., et al.
Veröffentlicht: (2026)
Federated Linear Dueling Bandits
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
von: Huang, Xuhan, et al.
Veröffentlicht: (2025)
DETAIL: Task DEmonsTration Attribution for Interpretable In-context Learning
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
Data value estimation on private gradients
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
von: Zhou, Zijian, et al.
Veröffentlicht: (2024)
Online Clustering of Dueling Bandits
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies
von: Verma, Arun, et al.
Veröffentlicht: (2024)
von: Verma, Arun, et al.
Veröffentlicht: (2024)
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
von: Di, Qiwei, et al.
Veröffentlicht: (2024)
Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2023)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2023)
MineDraft: A Framework for Batch Parallel Speculative Decoding
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
von: Tang, Zhenwei, et al.
Veröffentlicht: (2026)
Understanding the Relationship between Prompts and Response Uncertainty in Large Language Models
von: Zhang, Ze Yu, et al.
Veröffentlicht: (2024)
von: Zhang, Ze Yu, et al.
Veröffentlicht: (2024)
Adjusted Expected Improvement for Cumulative Regret Minimization in Noisy Bayesian Optimization
von: Hu, Shouri, et al.
Veröffentlicht: (2022)
von: Hu, Shouri, et al.
Veröffentlicht: (2022)
Self-Interested Agents in Collaborative Machine Learning: An Incentivized Adaptive Data-Centric Framework
von: Vijayan, Nithia, et al.
Veröffentlicht: (2024)
von: Vijayan, Nithia, et al.
Veröffentlicht: (2024)
Biased Dueling Bandits with Stochastic Delayed Feedback
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
von: Yi, Bongsoo, et al.
Veröffentlicht: (2024)
Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2024)
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2024)
Decentralized Sum-of-Nonconvex Optimization
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
TreeGrad-Ranker: Feature Ranking via $O(L)$-Time Gradients for Decision Trees
von: Li, Weida, et al.
Veröffentlicht: (2026)
von: Li, Weida, et al.
Veröffentlicht: (2026)
Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
von: Wang, Shengbo, et al.
Veröffentlicht: (2025)
REFRAG: Rethinking RAG based Decoding
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025)
Fusing Reward and Dueling Feedback in Stochastic Bandits
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
von: Wang, Xuchuang, et al.
Veröffentlicht: (2025)
Feel-Good Thompson Sampling for Contextual Dueling Bandits
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
von: Li, Xuheng, et al.
Veröffentlicht: (2024)
Recycling History: Efficient Recommendations from Contextual Dueling Bandits
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
von: Sankagiri, Suryanarayana, et al.
Veröffentlicht: (2025)
Helpful or Harmful Data? Fine-tuning-free Shapley Attribution for Explaining Language Model Predictions
von: Wang, Jingtan, et al.
Veröffentlicht: (2024)
von: Wang, Jingtan, et al.
Veröffentlicht: (2024)
Understanding Domain Generalization: A Noise Robustness Perspective
von: Qiao, Rui, et al.
Veröffentlicht: (2024)
von: Qiao, Rui, et al.
Veröffentlicht: (2024)
DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
von: Chen, Zhiliang, et al.
Veröffentlicht: (2025)
Variance-Aware Regret Bounds for Stochastic Contextual Dueling Bandits
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
von: Di, Qiwei, et al.
Veröffentlicht: (2023)
Provably Adaptive Linear Approximation for the Shapley Value and Beyond
von: Li, Weida, et al.
Veröffentlicht: (2026)
von: Li, Weida, et al.
Veröffentlicht: (2026)
Global-to-Local Support Spectrums for Language Model Explainability
von: Agussurja, Lucas, et al.
Veröffentlicht: (2024)
von: Agussurja, Lucas, et al.
Veröffentlicht: (2024)
Incremental Quasi-Newton Methods with Faster Superlinear Convergence Rates
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
von: Liu, Zhuanghua, et al.
Veröffentlicht: (2024)
PC-MoE: Memory-Efficient and Privacy-Preserving Collaborative Training for Mixture-of-Experts LLMs
von: Zhang, Ze Yu, et al.
Veröffentlicht: (2025)
von: Zhang, Ze Yu, et al.
Veröffentlicht: (2025)
Source Attribution for Large Language Model-Generated Data
von: Wang, Jingtan, et al.
Veröffentlicht: (2023)
von: Wang, Jingtan, et al.
Veröffentlicht: (2023)
Neural Contextual Bandits Under Delayed Feedback Constraints
von: Moghimi, Mohammadali, et al.
Veröffentlicht: (2025)
von: Moghimi, Mohammadali, et al.
Veröffentlicht: (2025)
Multi-Player Approaches for Dueling Bandits
von: Raveh, Or, et al.
Veröffentlicht: (2024)
von: Raveh, Or, et al.
Veröffentlicht: (2024)
MeMo: Memory as a Model
von: Quek, Ryan Wei Heng, et al.
Veröffentlicht: (2026)
von: Quek, Ryan Wei Heng, et al.
Veröffentlicht: (2026)
Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration
von: Oh, Youngmin, et al.
Veröffentlicht: (2025)
von: Oh, Youngmin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
von: Verma, Arun, et al.
Veröffentlicht: (2024) -
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2025) -
Prompt Optimization with Human Feedback
von: Lin, Xiaoqiang, et al.
Veröffentlicht: (2024) -
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
von: Verma, Arun, et al.
Veröffentlicht: (2025) -
Linear and Neural Dueling Bandits with Delayed Feedback
von: Wang, Xiangyi, et al.
Veröffentlicht: (2026)