Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Fan, Yuchen, Hong, Yuzhong, Wang, Qiushi, Bao, Junwei, Jiang, Hongfei, Song, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
by: Hong, Yuzhong, et al.
Published: (2024)
by: Hong, Yuzhong, et al.
Published: (2024)
BoRA: Bi-dimensional Weight-Decomposed Low-Rank Adaptation
by: Wang, Qiushi, et al.
Published: (2024)
by: Wang, Qiushi, et al.
Published: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
by: Xiong, Guanming, et al.
Published: (2024)
by: Xiong, Guanming, et al.
Published: (2024)
Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment
by: Zhao, Jing, et al.
Published: (2026)
by: Zhao, Jing, et al.
Published: (2026)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
by: Zhang, Kaichen, et al.
Published: (2025)
by: Zhang, Kaichen, et al.
Published: (2025)
FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning
by: Pan, Haihui, et al.
Published: (2026)
by: Pan, Haihui, et al.
Published: (2026)
Consensus-Aligned Neuron Efficient Fine-Tuning Large Language Models for Multi-Domain Machine Translation
by: Jiang, Shuting, et al.
Published: (2026)
by: Jiang, Shuting, et al.
Published: (2026)
Aligning Large Language Models via Fine-grained Supervision
by: Xu, Dehong, et al.
Published: (2024)
by: Xu, Dehong, et al.
Published: (2024)
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
by: Jiang, Haitao, et al.
Published: (2026)
by: Jiang, Haitao, et al.
Published: (2026)
Dissecting Fine-Tuning Unlearning in Large Language Models
by: Hong, Yihuai, et al.
Published: (2024)
by: Hong, Yihuai, et al.
Published: (2024)
Parameter-Efficient Fine-Tuning with Differential Privacy for Robust Instruction Adaptation in Large Language Models
by: Huang, Yulin, et al.
Published: (2025)
by: Huang, Yulin, et al.
Published: (2025)
Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management
by: Wang, Yanan, et al.
Published: (2026)
by: Wang, Yanan, et al.
Published: (2026)
Selective Self-to-Supervised Fine-Tuning for Generalization in Large Language Models
by: Gupta, Sonam, et al.
Published: (2025)
by: Gupta, Sonam, et al.
Published: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
by: Ding, Fei, et al.
Published: (2025)
by: Ding, Fei, et al.
Published: (2025)
Aligning Large Language Models with Searcher Preferences
by: Wu, Wei, et al.
Published: (2026)
by: Wu, Wei, et al.
Published: (2026)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models
by: Zhang, Kaichen, et al.
Published: (2025)
by: Zhang, Kaichen, et al.
Published: (2025)
Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning
by: Mecklenburg, Nick, et al.
Published: (2024)
by: Mecklenburg, Nick, et al.
Published: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
by: Zhou, Yiyang, et al.
Published: (2024)
by: Zhou, Yiyang, et al.
Published: (2024)
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
by: Shi, Jiacheng, et al.
Published: (2025)
by: Shi, Jiacheng, et al.
Published: (2025)
MetaAlign: Align Large Language Models with Diverse Preferences during Inference Time
by: Zhang, Mozhi, et al.
Published: (2024)
by: Zhang, Mozhi, et al.
Published: (2024)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
by: Tan, Zhaoxuan, et al.
Published: (2025)
by: Tan, Zhaoxuan, et al.
Published: (2025)
Personalized Collaborative Fine-Tuning for On-Device Large Language Models
by: Wagner, Nicolas, et al.
Published: (2024)
by: Wagner, Nicolas, et al.
Published: (2024)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
by: Hong, Joey, et al.
Published: (2024)
by: Hong, Joey, et al.
Published: (2024)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
by: Savage, Thomas, et al.
Published: (2024)
by: Savage, Thomas, et al.
Published: (2024)
Dynamics of Instruction Fine-Tuning for Chinese Large Language Models
by: Song, Chiyu, et al.
Published: (2023)
by: Song, Chiyu, et al.
Published: (2023)
Efficient Fine-Tuning of Large Language Models for Automated Medical Documentation
by: Leong, Hui Yi, et al.
Published: (2024)
by: Leong, Hui Yi, et al.
Published: (2024)
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
by: Xue, Chao, et al.
Published: (2026)
by: Xue, Chao, et al.
Published: (2026)
MVPBench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values
by: Liang, Yao, et al.
Published: (2025)
by: Liang, Yao, et al.
Published: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
by: Liu, Wenhao, et al.
Published: (2023)
by: Liu, Wenhao, et al.
Published: (2023)
HFT: Half Fine-Tuning for Large Language Models
by: Hui, Tingfeng, et al.
Published: (2024)
by: Hui, Tingfeng, et al.
Published: (2024)
Federated Fine-Tuning of Large Language Models: Kahneman-Tversky vs. Direct Preference Optimization
by: Spadea, Fernando, et al.
Published: (2025)
by: Spadea, Fernando, et al.
Published: (2025)
Aligning Large Language Model Behavior with Human Citation Preferences
by: Ando, Kenichiro, et al.
Published: (2026)
by: Ando, Kenichiro, et al.
Published: (2026)
Taiyi: A Bilingual Fine-Tuned Large Language Model for Diverse Biomedical Tasks
by: Luo, Ling, et al.
Published: (2023)
by: Luo, Ling, et al.
Published: (2023)
Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models
by: Deng, Guanzhi, et al.
Published: (2026)
by: Deng, Guanzhi, et al.
Published: (2026)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
Efficient Response Generation Strategy Selection for Fine-Tuning Large Language Models Through Self-Aligned Perplexity
by: Ren, Xuan, et al.
Published: (2025)
by: Ren, Xuan, et al.
Published: (2025)
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
by: Yu, Bin, et al.
Published: (2025)
by: Yu, Bin, et al.
Published: (2025)
Phased Instruction Fine-Tuning for Large Language Models
by: Pang, Wei, et al.
Published: (2024)
by: Pang, Wei, et al.
Published: (2024)
Similar Items
-
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
by: Hong, Yuzhong, et al.
Published: (2024) -
BoRA: Bi-dimensional Weight-Decomposed Low-Rank Adaptation
by: Wang, Qiushi, et al.
Published: (2024) -
Multi-Turn Interactions for Text-to-SQL with Large Language Models
by: Xiong, Guanming, et al.
Published: (2024) -
Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment
by: Zhao, Jing, et al.
Published: (2026) -
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
by: Zhang, Kaichen, et al.
Published: (2025)