Not All Preferences are What You Need for Post-Training: Selective Alignment Strategy for Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Dong, Zhijin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
Training on the Benchmark Is Not All You Need
par: Ni, Shiwen, et autres
Publié: (2024)
par: Ni, Shiwen, et autres
Publié: (2024)
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
par: Dhaliwal, Mehak, et autres
Publié: (2026)
par: Dhaliwal, Mehak, et autres
Publié: (2026)
Preference Ranking Optimization for Human Alignment
par: Song, Feifan, et autres
Publié: (2023)
par: Song, Feifan, et autres
Publié: (2023)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
Rho-1: Not All Tokens Are What You Need
par: Lin, Zhenghao, et autres
Publié: (2024)
par: Lin, Zhenghao, et autres
Publié: (2024)
Not All Documents Are What You Need for Extracting Instruction Tuning Data
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Controlling What You Share: Assessing Language Model Adherence to Privacy Preferences
par: Ramírez, Guillem, et autres
Publié: (2025)
par: Ramírez, Guillem, et autres
Publié: (2025)
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
par: Xia, Tingyu, et autres
Publié: (2024)
par: Xia, Tingyu, et autres
Publié: (2024)
Contrast Is All You Need
par: Kilic, Burak, et autres
Publié: (2023)
par: Kilic, Burak, et autres
Publié: (2023)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
par: Zhang, Jianfei, et autres
Publié: (2024)
par: Zhang, Jianfei, et autres
Publié: (2024)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
par: Gupta, Taneesh, et autres
Publié: (2025)
par: Gupta, Taneesh, et autres
Publié: (2025)
Preference Alignment Improves Language Model-Based TTS
par: Tian, Jinchuan, et autres
Publié: (2024)
par: Tian, Jinchuan, et autres
Publié: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
The Limits of Preference Data for Post-Training
par: Zhao, Eric, et autres
Publié: (2025)
par: Zhao, Eric, et autres
Publié: (2025)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
par: Wu, Jiayi, et autres
Publié: (2024)
par: Wu, Jiayi, et autres
Publié: (2024)
Word Alignment as Preference for Machine Translation
par: Wu, Qiyu, et autres
Publié: (2024)
par: Wu, Qiyu, et autres
Publié: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)
par: He, Jiafan, et autres
Publié: (2024)
Self-Play Preference Optimization for Language Model Alignment
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
Creative Preference Optimization
par: Ismayilzada, Mete, et autres
Publié: (2025)
par: Ismayilzada, Mete, et autres
Publié: (2025)
CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
par: Cho, Jaekyung
Publié: (2026)
par: Cho, Jaekyung
Publié: (2026)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
par: Lyu, Yougang, et autres
Publié: (2024)
par: Lyu, Yougang, et autres
Publié: (2024)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
par: Zhu, Mingye, et autres
Publié: (2024)
par: Zhu, Mingye, et autres
Publié: (2024)
TSO: Self-Training with Scaled Preference Optimization
par: Chen, Kaihui, et autres
Publié: (2024)
par: Chen, Kaihui, et autres
Publié: (2024)
Agents Are All You Need for LLM Unlearning
par: Sanyal, Debdeep, et autres
Publié: (2025)
par: Sanyal, Debdeep, et autres
Publié: (2025)
On the Role of Preference Variance in Preference Optimization
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
par: Liu, Tong, et autres
Publié: (2025)
par: Liu, Tong, et autres
Publié: (2025)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
par: Wang, Jialu, et autres
Publié: (2026)
par: Wang, Jialu, et autres
Publié: (2026)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
par: Guo, Yiju, et autres
Publié: (2024)
par: Guo, Yiju, et autres
Publié: (2024)
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
par: D'Oosterlinck, Karel, et autres
Publié: (2024)
par: D'Oosterlinck, Karel, et autres
Publié: (2024)
Post-edits Are Preferences Too
par: Berger, Nathaniel, et autres
Publié: (2024)
par: Berger, Nathaniel, et autres
Publié: (2024)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
ICDPO: Effectively Borrowing Alignment Capability of Others via In-context Direct Preference Optimization
par: Song, Feifan, et autres
Publié: (2024)
par: Song, Feifan, et autres
Publié: (2024)
Multiplayer Nash Preference Optimization
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
Iterative Reasoning Preference Optimization
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
par: Deng, Xun, et autres
Publié: (2025)
par: Deng, Xun, et autres
Publié: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
par: Kim, Dongyoung, et autres
Publié: (2024)
par: Kim, Dongyoung, et autres
Publié: (2024)
On-the-fly Preference Alignment via Principle-Guided Decoding
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Documents similaires
-
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024) -
Training on the Benchmark Is Not All You Need
par: Ni, Shiwen, et autres
Publié: (2024) -
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
par: Dhaliwal, Mehak, et autres
Publié: (2026) -
Preference Ranking Optimization for Human Alignment
par: Song, Feifan, et autres
Publié: (2023) -
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)