Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yifan, Zhang, Ge, Wu, Yue, Xu, Kangping, Gu, Quanquan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024)
von: He, Jiafan, et al.
Veröffentlicht: (2024)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
Group Representational Position Encoding
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
von: Yuan, Hui, et al.
Veröffentlicht: (2024)
von: Yuan, Hui, et al.
Veröffentlicht: (2024)
Training and Evaluating Language Models with Template-based Data Generation
von: Zhang, Yifan
Veröffentlicht: (2024)
von: Zhang, Yifan
Veröffentlicht: (2024)
Higher-order Linear Attention
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
von: Zhang, Zhiwei, et al.
Veröffentlicht: (2025)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
A Markov Categorical Framework for Language Modeling
von: Zhang, Yifan
Veröffentlicht: (2025)
von: Zhang, Yifan
Veröffentlicht: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
von: Ye, Jiasheng, et al.
Veröffentlicht: (2023)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
Teaching Your Models to Understand Code via Focal Preference Alignment
von: Wu, Jie, et al.
Veröffentlicht: (2025)
von: Wu, Jie, et al.
Veröffentlicht: (2025)
ROPO: Robust Preference Optimization for Large Language Models
von: Liang, Xize, et al.
Veröffentlicht: (2024)
von: Liang, Xize, et al.
Veröffentlicht: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
von: Zhao, Siyan, et al.
Veröffentlicht: (2023)
von: Zhao, Siyan, et al.
Veröffentlicht: (2023)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
von: Zhao, Shuai, et al.
Veröffentlicht: (2025)
von: Zhao, Shuai, et al.
Veröffentlicht: (2025)
Active Preference Learning for Large Language Models
von: Muldrew, William, et al.
Veröffentlicht: (2024)
von: Muldrew, William, et al.
Veröffentlicht: (2024)
Course-Correction: Safety Alignment Using Synthetic Preferences
von: Xu, Rongwu, et al.
Veröffentlicht: (2024)
von: Xu, Rongwu, et al.
Veröffentlicht: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
von: Zhu, Yu, et al.
Veröffentlicht: (2024)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
von: Imai, Saki, et al.
Veröffentlicht: (2026)
von: Imai, Saki, et al.
Veröffentlicht: (2026)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners
von: Xiao, Yijia, et al.
Veröffentlicht: (2023)
von: Xiao, Yijia, et al.
Veröffentlicht: (2023)
Deep Delta Learning
von: Zhang, Yifan, et al.
Veröffentlicht: (2026)
von: Zhang, Yifan, et al.
Veröffentlicht: (2026)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
von: Li, Junsong, et al.
Veröffentlicht: (2025)
von: Li, Junsong, et al.
Veröffentlicht: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
von: Wan, Xu, et al.
Veröffentlicht: (2025)
von: Wan, Xu, et al.
Veröffentlicht: (2025)
Improving Context-Aware Preference Modeling for Language Models
von: Pitis, Silviu, et al.
Veröffentlicht: (2024)
von: Pitis, Silviu, et al.
Veröffentlicht: (2024)
Surveying Attitudinal Alignment Between Large Language Models Vs. Humans Towards 17 Sustainable Development Goals
von: Wu, Qingyang, et al.
Veröffentlicht: (2024)
von: Wu, Qingyang, et al.
Veröffentlicht: (2024)
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees
von: Wu, Yongtao, et al.
Veröffentlicht: (2025)
von: Wu, Yongtao, et al.
Veröffentlicht: (2025)
On the Robustness of Reward Models for Language Model Alignment
von: Hong, Jiwoo, et al.
Veröffentlicht: (2025)
von: Hong, Jiwoo, et al.
Veröffentlicht: (2025)
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
Would I Lie To You? Inference Time Alignment of Language Models using Direct Preference Heads
von: Hadji-Kyriacou, Avelina Asada, et al.
Veröffentlicht: (2024)
von: Hadji-Kyriacou, Avelina Asada, et al.
Veröffentlicht: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
von: Yu, Yue, et al.
Veröffentlicht: (2024)
von: Yu, Yue, et al.
Veröffentlicht: (2024)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhang, Wenxuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024) -
Accelerated Preference Optimization for Large Language Model Alignment
von: He, Jiafan, et al.
Veröffentlicht: (2024) -
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024) -
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023) -
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)