ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Xiaoqiang, Verma, Arun, Dai, Zhongxiang, Rus, Daniela, Ng, See-Kiong, Low, Bryan Kian Hsiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt Optimization with Human Feedback
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2024)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2024)
Active Human Feedback Collection via Neural Contextual Dueling Bandits
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
di: Verma, Arun, et al.
Pubblicazione: (2024)
di: Verma, Arun, et al.
Pubblicazione: (2024)
Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2024)
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2024)
Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2023)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2023)
Localized Zeroth-Order Prompt Optimization
di: Hu, Wenyang, et al.
Pubblicazione: (2024)
di: Hu, Wenyang, et al.
Pubblicazione: (2024)
Source Attribution for Large Language Model-Generated Data
di: Wang, Jingtan, et al.
Pubblicazione: (2023)
di: Wang, Jingtan, et al.
Pubblicazione: (2023)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2025)
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2025)
PIED: Physics-Informed Experimental Design for Inverse Problems
di: Hemachandra, Apivich, et al.
Pubblicazione: (2025)
di: Hemachandra, Apivich, et al.
Pubblicazione: (2025)
PINNACLE: PINN Adaptive ColLocation and Experimental points selection
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
DETAIL: Task DEmonsTration Attribution for Interpretable In-context Learning
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
di: Shu, Yao, et al.
Pubblicazione: (2024)
di: Shu, Yao, et al.
Pubblicazione: (2024)
BarrierSteer: LLM Safety via Learning Barrier Steering
di: Tran, Thanh Q., et al.
Pubblicazione: (2026)
di: Tran, Thanh Q., et al.
Pubblicazione: (2026)
On Newton's Method to Unlearn Neural Networks
di: Bui, Nhung, et al.
Pubblicazione: (2024)
di: Bui, Nhung, et al.
Pubblicazione: (2024)
Data value estimation on private gradients
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies
di: Verma, Arun, et al.
Pubblicazione: (2024)
di: Verma, Arun, et al.
Pubblicazione: (2024)
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents
di: Verma, Arun, et al.
Pubblicazione: (2025)
di: Verma, Arun, et al.
Pubblicazione: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
di: Tang, Zhenwei, et al.
Pubblicazione: (2026)
TRACE: TRansformer-based Attribution using Contrastive Embeddings in LLMs
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
Dipper: Diversity in Prompts for Producing Large Language Model Ensembles in Reasoning tasks
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
Sample Efficient Preference Alignment in LLMs via Active Exploration
di: Mehta, Viraj, et al.
Pubblicazione: (2023)
di: Mehta, Viraj, et al.
Pubblicazione: (2023)
Adjusted Expected Improvement for Cumulative Regret Minimization in Noisy Bayesian Optimization
di: Hu, Shouri, et al.
Pubblicazione: (2022)
di: Hu, Shouri, et al.
Pubblicazione: (2022)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
REFRAG: Rethinking RAG based Decoding
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
Helpful or Harmful Data? Fine-tuning-free Shapley Attribution for Explaining Language Model Predictions
di: Wang, Jingtan, et al.
Pubblicazione: (2024)
di: Wang, Jingtan, et al.
Pubblicazione: (2024)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
Robustifying and Boosting Training-Free Neural Architecture Search
di: He, Zhenfeng, et al.
Pubblicazione: (2024)
di: He, Zhenfeng, et al.
Pubblicazione: (2024)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
DUPRE: Data Utility Prediction for Efficient Data Valuation
di: Pham, Kieu Thao Nguyen, et al.
Pubblicazione: (2025)
di: Pham, Kieu Thao Nguyen, et al.
Pubblicazione: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
Dependency Structure Search Bayesian Optimization for Decision Making Models
di: Rajpal, Mohit, et al.
Pubblicazione: (2023)
di: Rajpal, Mohit, et al.
Pubblicazione: (2023)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
Broaden your SCOPE! Efficient Multi-turn Conversation Planning for LLMs with Semantic Space
di: Chen, Zhiliang, et al.
Pubblicazione: (2025)
di: Chen, Zhiliang, et al.
Pubblicazione: (2025)
MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents
di: Zhou, Zijian, et al.
Pubblicazione: (2025)
di: Zhou, Zijian, et al.
Pubblicazione: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Spatio-Temporal Foundation Models: Vision, Challenges, and Opportunities
di: Goodge, Adam, et al.
Pubblicazione: (2025)
di: Goodge, Adam, et al.
Pubblicazione: (2025)
Decentralized Sum-of-Nonconvex Optimization
di: Liu, Zhuanghua, et al.
Pubblicazione: (2024)
di: Liu, Zhuanghua, et al.
Pubblicazione: (2024)
MeMo: Memory as a Model
di: Quek, Ryan Wei Heng, et al.
Pubblicazione: (2026)
di: Quek, Ryan Wei Heng, et al.
Pubblicazione: (2026)
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks
di: Chew, Ruth Wan Theng, et al.
Pubblicazione: (2026)
di: Chew, Ruth Wan Theng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Prompt Optimization with Human Feedback
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2024) -
Active Human Feedback Collection via Neural Contextual Dueling Bandits
di: Verma, Arun, et al.
Pubblicazione: (2025) -
Neural Dueling Bandits: Preference-Based Optimization with Human Feedback
di: Verma, Arun, et al.
Pubblicazione: (2024) -
Prompt Optimization with EASE? Efficient Ordering-aware Automated Selection of Exemplars
di: Wu, Zhaoxuan, et al.
Pubblicazione: (2024) -
Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2023)