SimPER: A Minimalist Approach to Preference Alignment without Hyperparameters
Fuente:
arXiv
Saved in:
| Main Authors: | Xiao, Teng, Yuan, Yige, Chen, Zhengyu, Li, Mingxiao, Liang, Shangsong, Ren, Zhaochun, Honavar, Vasant G |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
On a Connection Between Imitation Learning and RLHF
by: Xiao, Teng, et al.
Published: (2025)
by: Xiao, Teng, et al.
Published: (2025)
MolBind: Multimodal Alignment of Language, Molecules, and Proteins
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
3M-Diffusion: Latent Multi-Modal Diffusion for Language-Guided Molecular Structure Generation
by: Zhu, Huaisheng, et al.
Published: (2024)
by: Zhu, Huaisheng, et al.
Published: (2024)
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
by: Ren, Weijieying, et al.
Published: (2025)
by: Ren, Weijieying, et al.
Published: (2025)
EsaCL: Efficient Continual Learning of Sparse Models
by: Ren, Weijieying, et al.
Published: (2024)
by: Ren, Weijieying, et al.
Published: (2024)
Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning
by: Dalvi, Abhishek, et al.
Published: (2026)
by: Dalvi, Abhishek, et al.
Published: (2026)
Intrinsic Mutual Information as a Modulator for Preference Optimization
by: Liao, Peng, et al.
Published: (2026)
by: Liao, Peng, et al.
Published: (2026)
GeomCLIP: Contrastive Geometry-Text Pre-training for Molecules
by: Xiao, Teng, et al.
Published: (2024)
by: Xiao, Teng, et al.
Published: (2024)
Simple Denoising Diffusion Language Models
by: Zhu, Huaisheng, et al.
Published: (2025)
by: Zhu, Huaisheng, et al.
Published: (2025)
Hyperdimensional Representation Learning for Node Classification and Link Prediction
by: Dalvi, Abhishek, et al.
Published: (2024)
by: Dalvi, Abhishek, et al.
Published: (2024)
Deep Learning within Tabular Data: Foundations, Challenges, Advances and Future Directions
by: Ren, Weijieying, et al.
Published: (2025)
by: Ren, Weijieying, et al.
Published: (2025)
Explaining Length Bias in LLM-Based Preference Evaluations
by: Hu, Zhengyu, et al.
Published: (2024)
by: Hu, Zhengyu, et al.
Published: (2024)
C-HDNet: Hyperdimensional Computing for Causal Effect Estimation from Observational Data Under Network Interference
by: Dalvi, Abhishek, et al.
Published: (2025)
by: Dalvi, Abhishek, et al.
Published: (2025)
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
by: Liu, Zehao, et al.
Published: (2026)
by: Liu, Zehao, et al.
Published: (2026)
SimPO: Simple Preference Optimization with a Reference-Free Reward
by: Meng, Yu, et al.
Published: (2024)
by: Meng, Yu, et al.
Published: (2024)
Projection-Free Transformers via Gaussian Kernel Attention
by: Kundu, Debarshi, et al.
Published: (2026)
by: Kundu, Debarshi, et al.
Published: (2026)
ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference
by: Cai, Tianchi, et al.
Published: (2023)
by: Cai, Tianchi, et al.
Published: (2023)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively
by: Gu, Jiawei, et al.
Published: (2025)
by: Gu, Jiawei, et al.
Published: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
by: Xiong, Wei, et al.
Published: (2025)
by: Xiong, Wei, et al.
Published: (2025)
Accelerated Preference Optimization for Large Language Model Alignment
by: He, Jiafan, et al.
Published: (2024)
by: He, Jiafan, et al.
Published: (2024)
MGM: Global Understanding of Audience Overlap Graphs for Predicting the Factuality and the Bias of News Media
by: Manzoor, Muhammad Arslan, et al.
Published: (2024)
by: Manzoor, Muhammad Arslan, et al.
Published: (2024)
Simple and Asymmetric Graph Contrastive Learning without Augmentations
by: Xiao, Teng, et al.
Published: (2023)
by: Xiao, Teng, et al.
Published: (2023)
Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
by: Huang, Audrey, et al.
Published: (2024)
by: Huang, Audrey, et al.
Published: (2024)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
by: Zhao, Shuai, et al.
Published: (2025)
by: Zhao, Shuai, et al.
Published: (2025)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
by: Xiao, Teng, et al.
Published: (2026)
by: Xiao, Teng, et al.
Published: (2026)
Self-Play Preference Optimization for Language Model Alignment
by: Wu, Yue, et al.
Published: (2024)
by: Wu, Yue, et al.
Published: (2024)
ComPO: Preference Alignment via Comparison Oracles
by: Chen, Peter, et al.
Published: (2025)
by: Chen, Peter, et al.
Published: (2025)
Skin-R1: Toward Trustworthy Clinical Reasoning for Dermatological Diagnosis
by: Liu, Zehao, et al.
Published: (2025)
by: Liu, Zehao, et al.
Published: (2025)
Inference-time Alignment in Continuous Space
by: Yuan, Yige, et al.
Published: (2025)
by: Yuan, Yige, et al.
Published: (2025)
Self-Supervised Visual Preference Alignment
by: Zhu, Ke, et al.
Published: (2024)
by: Zhu, Ke, et al.
Published: (2024)
Self-Supervised Position Debiasing for Large Language Models
by: Liu, Zhongkun, et al.
Published: (2024)
by: Liu, Zhongkun, et al.
Published: (2024)
MaxMin-RLHF: Alignment with Diverse Human Preferences
by: Chakraborty, Souradip, et al.
Published: (2024)
by: Chakraborty, Souradip, et al.
Published: (2024)
Robust Multi-Objective Preference Alignment with Online DPO
by: Gupta, Raghav, et al.
Published: (2025)
by: Gupta, Raghav, et al.
Published: (2025)
Alignment is Localized: A Causal Probe into Preference Layers
by: Chaudhury, Archie
Published: (2025)
by: Chaudhury, Archie
Published: (2025)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
by: Yin, Yueqin, et al.
Published: (2024)
by: Yin, Yueqin, et al.
Published: (2024)
Bridging the Gap Between Preference Alignment and Machine Unlearning
by: Feng, Xiaohua, et al.
Published: (2025)
by: Feng, Xiaohua, et al.
Published: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
by: Jian, Chengtao, et al.
Published: (2025)
by: Jian, Chengtao, et al.
Published: (2025)
Similar Items
-
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
by: Xiao, Teng, et al.
Published: (2024) -
How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective
by: Xiao, Teng, et al.
Published: (2024) -
On a Connection Between Imitation Learning and RLHF
by: Xiao, Teng, et al.
Published: (2025) -
MolBind: Multimodal Alignment of Language, Molecules, and Proteins
by: Xiao, Teng, et al.
Published: (2024) -
3M-Diffusion: Latent Multi-Modal Diffusion for Language-Guided Molecular Structure Generation
by: Zhu, Huaisheng, et al.
Published: (2024)