PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Rongzhi, Shen, Jiaming, Liu, Tianqi, Wang, Haorui, Qin, Zhen, Han, Feng, Liu, Jialu, Baumgartner, Simon, Bendersky, Michael, Zhang, Chao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multilingual Fine-Grained News Headline Hallucination Detection
by: Shen, Jiaming, et al.
Published: (2024)
by: Shen, Jiaming, et al.
Published: (2024)
Boosting Reward Model with Preference-Conditional Multi-Aspect Synthetic Data Generation
by: Shen, Jiaming, et al.
Published: (2024)
by: Shen, Jiaming, et al.
Published: (2024)
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
LiPO: Listwise Preference Optimization through Learning-to-Rank
by: Liu, Tianqi, et al.
Published: (2024)
by: Liu, Tianqi, et al.
Published: (2024)
Predicting Text Preference Via Structured Comparative Reasoning
by: Yan, Jing Nathan, et al.
Published: (2023)
by: Yan, Jing Nathan, et al.
Published: (2023)
Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting
by: Qin, Zhen, et al.
Published: (2023)
by: Qin, Zhen, et al.
Published: (2023)
PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design
by: Xu, Andy, et al.
Published: (2025)
by: Xu, Andy, et al.
Published: (2025)
Statistical Rejection Sampling Improves Preference Optimization
by: Liu, Tianqi, et al.
Published: (2023)
by: Liu, Tianqi, et al.
Published: (2023)
Building Math Agents with Multi-Turn Iterative Preference Learning
by: Xiong, Wei, et al.
Published: (2024)
by: Xiong, Wei, et al.
Published: (2024)
LRHP: Learning Representations for Human Preferences via Preference Pairs
by: Wang, Chenglong, et al.
Published: (2024)
by: Wang, Chenglong, et al.
Published: (2024)
TPD: Enhancing Student Language Model Reasoning via Principle Discovery and Guidance
by: Wang, Haorui, et al.
Published: (2024)
by: Wang, Haorui, et al.
Published: (2024)
Bridging the Preference Gap between Retrievers and LLMs
by: Ke, Zixuan, et al.
Published: (2024)
by: Ke, Zixuan, et al.
Published: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
by: Pi, Renjie, et al.
Published: (2024)
by: Pi, Renjie, et al.
Published: (2024)
Direct Preference Knowledge Distillation for Large Language Models
by: Li, Yixing, et al.
Published: (2024)
by: Li, Yixing, et al.
Published: (2024)
PLaMo 2 Technical Report
by: Networks, Preferred, et al.
Published: (2025)
by: Networks, Preferred, et al.
Published: (2025)
Preference Optimization for Reasoning with Pseudo Feedback
by: Jiao, Fangkai, et al.
Published: (2024)
by: Jiao, Fangkai, et al.
Published: (2024)
Aligning Large Language Models with Representation Editing: A Control Perspective
by: Kong, Lingkai, et al.
Published: (2024)
by: Kong, Lingkai, et al.
Published: (2024)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
by: Gu, Yanggan, et al.
Published: (2025)
by: Gu, Yanggan, et al.
Published: (2025)
Assessing Logical Puzzle Solving in Large Language Models: Insights from a Minesweeper Case Study
by: Li, Yinghao, et al.
Published: (2023)
by: Li, Yinghao, et al.
Published: (2023)
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
by: Liu, Ning, et al.
Published: (2026)
by: Liu, Ning, et al.
Published: (2026)
Preference-Consistent Knowledge Distillation for Recommender System
by: Zhu, Zhangchi, et al.
Published: (2023)
by: Zhu, Zhangchi, et al.
Published: (2023)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
K-order Ranking Preference Optimization for Large Language Models
by: Cai, Shihao, et al.
Published: (2025)
by: Cai, Shihao, et al.
Published: (2025)
Discrete Preference Learning for Personalized Multimodal Generation
by: Zhang, Yuting, et al.
Published: (2026)
by: Zhang, Yuting, et al.
Published: (2026)
Geometry Denoising with Preferred Normal Vectors
by: Weiß, Manuel, et al.
Published: (2025)
by: Weiß, Manuel, et al.
Published: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
by: Feng, Xiaohua, et al.
Published: (2025)
by: Feng, Xiaohua, et al.
Published: (2025)
Active Preference Learning for Large Language Models
by: Muldrew, William, et al.
Published: (2024)
by: Muldrew, William, et al.
Published: (2024)
TablePilot: Recommending Human-Preferred Tabular Data Analysis with Large Language Models
by: Yi, Deyin, et al.
Published: (2025)
by: Yi, Deyin, et al.
Published: (2025)
Human Alignment of Large Language Models through Online Preference Optimisation
by: Calandriello, Daniele, et al.
Published: (2024)
by: Calandriello, Daniele, et al.
Published: (2024)
PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency
by: Elements, Preferred, et al.
Published: (2024)
by: Elements, Preferred, et al.
Published: (2024)
EmoPrefer: Can Large Language Models Understand Human Emotion Preferences?
by: Lian, Zheng, et al.
Published: (2025)
by: Lian, Zheng, et al.
Published: (2025)
Improving Attributed Text Generation of Large Language Models via Preference Learning
by: Li, Dongfang, et al.
Published: (2024)
by: Li, Dongfang, et al.
Published: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
by: Cho, Jaekyung
Published: (2026)
by: Cho, Jaekyung
Published: (2026)
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
by: Wang, Yu, et al.
Published: (2025)
by: Wang, Yu, et al.
Published: (2025)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
by: Zhang, Weixu, et al.
Published: (2026)
by: Zhang, Weixu, et al.
Published: (2026)
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
by: Leng, Jiaqi, et al.
Published: (2026)
by: Leng, Jiaqi, et al.
Published: (2026)
RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models
by: Yan, Qihang, et al.
Published: (2025)
by: Yan, Qihang, et al.
Published: (2025)
Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs
by: Lu, Yunhong, et al.
Published: (2026)
by: Lu, Yunhong, et al.
Published: (2026)
Towards Understanding Valuable Preference Data for Large Language Model Alignment
by: Zhang, Zizhuo, et al.
Published: (2025)
by: Zhang, Zizhuo, et al.
Published: (2025)
Beyond Single-Reward: Multi-Pair, Multi-Perspective Preference Optimization for Machine Translation
by: Wang, Hao, et al.
Published: (2025)
by: Wang, Hao, et al.
Published: (2025)
Similar Items
-
Multilingual Fine-Grained News Headline Hallucination Detection
by: Shen, Jiaming, et al.
Published: (2024) -
Boosting Reward Model with Preference-Conditional Multi-Aspect Synthetic Data Generation
by: Shen, Jiaming, et al.
Published: (2024) -
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
by: Qin, Zhen, et al.
Published: (2024) -
LiPO: Listwise Preference Optimization through Learning-to-Rank
by: Liu, Tianqi, et al.
Published: (2024) -
Predicting Text Preference Via Structured Comparative Reasoning
by: Yan, Jing Nathan, et al.
Published: (2023)