Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Haoxiang, Lin, Yong, Xiong, Wei, Yang, Rui, Diao, Shizhe, Qiu, Shuang, Zhao, Han, Zhang, Tong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
di: Yang, Rui, et al.
Pubblicazione: (2024)
di: Yang, Rui, et al.
Pubblicazione: (2024)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
di: Guo, Yiju, et al.
Pubblicazione: (2024)
di: Guo, Yiju, et al.
Pubblicazione: (2024)
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
di: Zhang, Dylan, et al.
Pubblicazione: (2024)
di: Zhang, Dylan, et al.
Pubblicazione: (2024)
LLMAP: LLM-Assisted Multi-Objective Route Planning with User Preferences
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
di: Yuan, Liangqi, et al.
Pubblicazione: (2025)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
di: Lin, Yong, et al.
Pubblicazione: (2024)
di: Lin, Yong, et al.
Pubblicazione: (2024)
Entropy-Regularized Process Reward Model
di: Zhang, Hanning, et al.
Pubblicazione: (2024)
di: Zhang, Hanning, et al.
Pubblicazione: (2024)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
di: Zhao, Mengjie, et al.
Pubblicazione: (2026)
PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs
di: Zhao, Tianyu, et al.
Pubblicazione: (2026)
di: Zhao, Tianyu, et al.
Pubblicazione: (2026)
Robust Preference Alignment via Directional Neighborhood Consensus
di: Mao, Ruochen, et al.
Pubblicazione: (2025)
di: Mao, Ruochen, et al.
Pubblicazione: (2025)
Active Prompting with Chain-of-Thought for Large Language Models
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
di: Diao, Shizhe, et al.
Pubblicazione: (2023)
Diverse Preference Learning for Capabilities and Alignment
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
From 1,000,000 Users to Every User: Scaling Up Personalized Preference for User-level Alignment
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
di: Li, Jia-Nan, et al.
Pubblicazione: (2025)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
di: Gallego, Víctor
Pubblicazione: (2024)
di: Gallego, Víctor
Pubblicazione: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
di: Liu, Biao, et al.
Pubblicazione: (2025)
di: Liu, Biao, et al.
Pubblicazione: (2025)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Beyond the Binary: Capturing Diverse Preferences With Reward Regularization
di: Padmakumar, Vishakh, et al.
Pubblicazione: (2024)
di: Padmakumar, Vishakh, et al.
Pubblicazione: (2024)
Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMs
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
Direct Judgement Preference Optimization
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
di: Kim, Dongyoung, et al.
Pubblicazione: (2024)
Misaligned by Reward: Socially Undesirable Preferences in LLMs
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2026)
di: Ghazaryan, Gayane, et al.
Pubblicazione: (2026)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering
di: Yang, Hongyu, et al.
Pubblicazione: (2024)
di: Yang, Hongyu, et al.
Pubblicazione: (2024)
New Desiderata for Direct Preference Optimization
di: Hu, Xiangkun, et al.
Pubblicazione: (2024)
di: Hu, Xiangkun, et al.
Pubblicazione: (2024)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
di: Li, Moxin, et al.
Pubblicazione: (2025)
di: Li, Moxin, et al.
Pubblicazione: (2025)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
di: Huang, Kexin, et al.
Pubblicazione: (2025)
di: Huang, Kexin, et al.
Pubblicazione: (2025)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
di: Yang, Wen, et al.
Pubblicazione: (2025)
di: Yang, Wen, et al.
Pubblicazione: (2025)
Understanding the Logic of Direct Preference Alignment through Logic
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
di: Richardson, Kyle, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
di: Zhong, Yifan, et al.
Pubblicazione: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
di: Zhu, Kewen, et al.
Pubblicazione: (2026)
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
di: Kim, Minbeom, et al.
Pubblicazione: (2025)
di: Kim, Minbeom, et al.
Pubblicazione: (2025)
Automatic Prompt Augmentation and Selection with Chain-of-Thought from Labeled Data
di: Shum, KaShun, et al.
Pubblicazione: (2023)
di: Shum, KaShun, et al.
Pubblicazione: (2023)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment
di: Wang, Tianze, et al.
Pubblicazione: (2025)
di: Wang, Tianze, et al.
Pubblicazione: (2025)
Course-Correction: Safety Alignment Using Synthetic Preferences
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Reward-free Alignment for Conflicting Objectives
di: Chen, Peter, et al.
Pubblicazione: (2026)
di: Chen, Peter, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
di: Wang, Haoxiang, et al.
Pubblicazione: (2024) -
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
di: Yang, Rui, et al.
Pubblicazione: (2024) -
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
di: Guo, Yiju, et al.
Pubblicazione: (2024) -
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025) -
$\textbf{PLUM}$: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases
di: Zhang, Dylan, et al.
Pubblicazione: (2024)