Hard Negative Sample-Augmented DPO Post-Training for Small Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Haocheng, Zhu, Minjun, Yu, Henry |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Supervised Contrastive Learning with Hard Negative Samples
par: Jiang, Ruijie, et autres
Publié: (2022)
par: Jiang, Ruijie, et autres
Publié: (2022)
Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
par: Oh, Giyeong, et autres
Publié: (2026)
par: Oh, Giyeong, et autres
Publié: (2026)
Momentum Contrastive Learning with Enhanced Negative Sampling and Hard Negative Filtering
par: Hoang, Duy, et autres
Publié: (2025)
par: Hoang, Duy, et autres
Publié: (2025)
When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
Post-Training Augmentation Invariance
par: Eikenberry, Keenan, et autres
Publié: (2025)
par: Eikenberry, Keenan, et autres
Publié: (2025)
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
par: Surana, Rohan, et autres
Publié: (2026)
par: Surana, Rohan, et autres
Publié: (2026)
Bootstrapping Language Models with DPO Implicit Rewards
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
par: Jung, Sunghee, et autres
Publié: (2025)
par: Jung, Sunghee, et autres
Publié: (2025)
g-DPO: Scalable Preference Optimization for Protein Language Models
par: Ferragu, Constance, et autres
Publié: (2025)
par: Ferragu, Constance, et autres
Publié: (2025)
Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models
par: Mouiche, Inoussa
Publié: (2026)
par: Mouiche, Inoussa
Publié: (2026)
A Post-Training Enhanced Optimization Approach for Small Language Models
par: Zhai, Keke
Publié: (2024)
par: Zhai, Keke
Publié: (2024)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
par: Xiao, He, et autres
Publié: (2025)
par: Xiao, He, et autres
Publié: (2025)
Boosting Protein Language Models with Negative Sample Mining
par: Xu, Yaoyao, et autres
Publié: (2024)
par: Xu, Yaoyao, et autres
Publié: (2024)
Layer-diverse Negative Sampling for Graph Neural Networks
par: Duan, Wei, et autres
Publié: (2024)
par: Duan, Wei, et autres
Publié: (2024)
Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Models
par: Solgi, Ryan, et autres
Publié: (2025)
par: Solgi, Ryan, et autres
Publié: (2025)
Hard-Negative Sampling for Contrastive Learning: Optimal Representation Geometry and Neural- vs Dimensional-Collapse
par: Jiang, Ruijie, et autres
Publié: (2023)
par: Jiang, Ruijie, et autres
Publié: (2023)
Contrastive Learning with Negative Sampling Correction
par: Wang, Lu, et autres
Publié: (2024)
par: Wang, Lu, et autres
Publié: (2024)
Robust Training of Temporal GNNs using Nearest Neighbours based Hard Negatives
par: Gupta, Shubham, et autres
Publié: (2024)
par: Gupta, Shubham, et autres
Publié: (2024)
Provably Robust DPO: Aligning Language Models with Noisy Feedback
par: Chowdhury, Sayak Ray, et autres
Publié: (2024)
par: Chowdhury, Sayak Ray, et autres
Publié: (2024)
SCONE: A Novel Stochastic Sampling to Generate Contrastive Views and Hard Negative Samples for Recommendation
par: Lee, Chaejeong, et autres
Publié: (2024)
par: Lee, Chaejeong, et autres
Publié: (2024)
Learning Dynamics in RL Post-Training for Language Models
par: Tomihari, Akiyoshi
Publié: (2026)
par: Tomihari, Akiyoshi
Publié: (2026)
On the Plasticity and Stability for Post-Training Large Language Models
par: Qiang, Wenwen, et autres
Publié: (2026)
par: Qiang, Wenwen, et autres
Publié: (2026)
Synthetic Data Generation for Augmenting Small Samples
par: Liu, Dan, et autres
Publié: (2025)
par: Liu, Dan, et autres
Publié: (2025)
What Matters in Data for DPO?
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Investigating the Impact of Hard Samples on Accuracy Reveals In-class Data Imbalance
par: Pukowski, Pawel, et autres
Publié: (2024)
par: Pukowski, Pawel, et autres
Publié: (2024)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
SFBD Flow: A Continuous-Optimization Framework for Training Diffusion Models with Noisy Samples
par: Lu, Haoye, et autres
Publié: (2025)
par: Lu, Haoye, et autres
Publié: (2025)
Take the Bull by the Horns: Hard Sample-Reweighted Continual Training Improves LLM Generalization
par: Chen, Xuxi, et autres
Publié: (2024)
par: Chen, Xuxi, et autres
Publié: (2024)
HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models
par: Yan, Xin, et autres
Publié: (2026)
par: Yan, Xin, et autres
Publié: (2026)
Evaluating Synthetic Tabular Data Generated To Augment Small Sample Datasets
par: Marin, Javier
Publié: (2022)
par: Marin, Javier
Publié: (2022)
Computational Bottlenecks of Training Small-scale Large Language Models
par: Ashkboos, Saleh, et autres
Publié: (2024)
par: Ashkboos, Saleh, et autres
Publié: (2024)
Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search
par: Gu, Yuxian, et autres
Publié: (2025)
par: Gu, Yuxian, et autres
Publié: (2025)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
par: Yu, Peiqi, et autres
Publié: (2026)
par: Yu, Peiqi, et autres
Publié: (2026)
DiRL: An Efficient Post-Training Framework for Diffusion Language Models
par: Zhu, Ying, et autres
Publié: (2025)
par: Zhu, Ying, et autres
Publié: (2025)
TADA: Improved Diffusion Sampling with Training-free Augmented Dynamics
par: Chen, Tianrong, et autres
Publié: (2025)
par: Chen, Tianrong, et autres
Publié: (2025)
Better World Models Can Lead to Better Post-Training Performance
par: Gupta, Prakhar, et autres
Publié: (2025)
par: Gupta, Prakhar, et autres
Publié: (2025)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
Group Causal Policy Optimization for Post-Training Large Language Models
par: Gu, Ziyin, et autres
Publié: (2025)
par: Gu, Ziyin, et autres
Publié: (2025)
Documents similaires
-
Supervised Contrastive Learning with Hard Negative Samples
par: Jiang, Ruijie, et autres
Publié: (2022) -
Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
par: Oh, Giyeong, et autres
Publié: (2026) -
Momentum Contrastive Learning with Enhanced Negative Sampling and Hard Negative Filtering
par: Hoang, Duy, et autres
Publié: (2025) -
When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval
par: Zhang, Zhicheng, et autres
Publié: (2026) -
Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms
par: Su, Xuerui, et autres
Publié: (2025)