Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bell, Henry, Schertel, Lara Neubauer da Costa, Ding, Bochu, Fain, Brandon |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale
von: Bell, Henry, et al.
Veröffentlicht: (2026)
von: Bell, Henry, et al.
Veröffentlicht: (2026)
ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference
von: Cai, Tianchi, et al.
Veröffentlicht: (2023)
von: Cai, Tianchi, et al.
Veröffentlicht: (2023)
Human Inspired Progressive Alignment and Comparative Learning for Grounded Word Acquisition
von: Bao, Yuwei, et al.
Veröffentlicht: (2023)
von: Bao, Yuwei, et al.
Veröffentlicht: (2023)
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
von: Peng, Andi, et al.
Veröffentlicht: (2024)
von: Peng, Andi, et al.
Veröffentlicht: (2024)
MaxMin-RLHF: Alignment with Diverse Human Preferences
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
Re-evaluating Automatic LLM System Ranking for Alignment with Human Preference
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
von: Gao, Mingqi, et al.
Veröffentlicht: (2024)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
von: Zhao, Shuai, et al.
Veröffentlicht: (2025)
von: Zhao, Shuai, et al.
Veröffentlicht: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
Value Alignment from Unstructured Text
von: Padhi, Inkit, et al.
Veröffentlicht: (2024)
von: Padhi, Inkit, et al.
Veröffentlicht: (2024)
Transfer Q Star: Principled Decoding for LLM Alignment
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)
Decoding the Ear: A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
von: Lin, Zhiyu, et al.
Veröffentlicht: (2025)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Robust Multi-Objective Preference Alignment with Online DPO
von: Gupta, Raghav, et al.
Veröffentlicht: (2025)
von: Gupta, Raghav, et al.
Veröffentlicht: (2025)
Alignment is Localized: A Causal Probe into Preference Layers
von: Chaudhury, Archie
Veröffentlicht: (2025)
von: Chaudhury, Archie
Veröffentlicht: (2025)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
von: Sun, Zhiqing, et al.
Veröffentlicht: (2024)
von: Sun, Zhiqing, et al.
Veröffentlicht: (2024)
PORT: Preference Optimization on Reasoning Traces
von: Lahlou, Salem, et al.
Veröffentlicht: (2024)
von: Lahlou, Salem, et al.
Veröffentlicht: (2024)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
von: Yu, Dian, et al.
Veröffentlicht: (2025)
von: Yu, Dian, et al.
Veröffentlicht: (2025)
Beyond Correctness: Learning Robust Reasoning via Transfer
von: Lee, Hyunseok, et al.
Veröffentlicht: (2026)
von: Lee, Hyunseok, et al.
Veröffentlicht: (2026)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
von: Zhang, Han, et al.
Veröffentlicht: (2023)
von: Zhang, Han, et al.
Veröffentlicht: (2023)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
von: Le, Quang-Hung, et al.
Veröffentlicht: (2024)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
von: Gallego, Víctor
Veröffentlicht: (2024)
von: Gallego, Víctor
Veröffentlicht: (2024)
SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
von: Xiao, Teng, et al.
Veröffentlicht: (2025)
von: Xiao, Teng, et al.
Veröffentlicht: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
Value Drifts: Tracing Value Alignment During LLM Post-Training
von: Bhatia, Mehar, et al.
Veröffentlicht: (2025)
von: Bhatia, Mehar, et al.
Veröffentlicht: (2025)
Reasoning Boosts Opinion Alignment in LLMs
von: Berdoz, Frédéric, et al.
Veröffentlicht: (2026)
von: Berdoz, Frédéric, et al.
Veröffentlicht: (2026)
Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences
von: Pattnaik, Pulkit, et al.
Veröffentlicht: (2024)
von: Pattnaik, Pulkit, et al.
Veröffentlicht: (2024)
Holistic Utility Preference Learning for Listwise Alignment
von: Zhou, Jiacong, et al.
Veröffentlicht: (2024)
von: Zhou, Jiacong, et al.
Veröffentlicht: (2024)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
von: Kim, Dongyoung, et al.
Veröffentlicht: (2024)
von: Kim, Dongyoung, et al.
Veröffentlicht: (2024)
GeoReasoner: Reasoning On Geospatially Grounded Context For Natural Language Understanding
von: Yan, Yibo, et al.
Veröffentlicht: (2024)
von: Yan, Yibo, et al.
Veröffentlicht: (2024)
Advancing LLM Reasoning Generalists with Preference Trees
von: Yuan, Lifan, et al.
Veröffentlicht: (2024)
von: Yuan, Lifan, et al.
Veröffentlicht: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
von: Yin, Yueqin, et al.
Veröffentlicht: (2024)
von: Yin, Yueqin, et al.
Veröffentlicht: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
PREDILECT: Preferences Delineated with Zero-Shot Language-based Reasoning in Reinforcement Learning
von: Holk, Simon, et al.
Veröffentlicht: (2024)
von: Holk, Simon, et al.
Veröffentlicht: (2024)
How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation
von: Lee, Wilson Y.
Veröffentlicht: (2026)
von: Lee, Wilson Y.
Veröffentlicht: (2026)
Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return
von: Peng, Nianli, et al.
Veröffentlicht: (2023)
von: Peng, Nianli, et al.
Veröffentlicht: (2023)
Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
von: Li, Moxin, et al.
Veröffentlicht: (2025)
von: Li, Moxin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale
von: Bell, Henry, et al.
Veröffentlicht: (2026) -
ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference
von: Cai, Tianchi, et al.
Veröffentlicht: (2023) -
Human Inspired Progressive Alignment and Comparative Learning for Grounded Word Acquisition
von: Bao, Yuwei, et al.
Veröffentlicht: (2023) -
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
von: Peng, Andi, et al.
Veröffentlicht: (2024) -
MaxMin-RLHF: Alignment with Diverse Human Preferences
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2024)