Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Siqi, Hong, Ilgee, Balmaseda, Vicente, Yu, Changlong, Qiu, Liang, Liu, Xin, Jiang, Haoming, Zhao, Tuo, Yang, Tianbao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
par: Hong, Ilgee, et autres
Publié: (2024)
par: Hong, Ilgee, et autres
Publié: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
par: Hong, Ilgee, et autres
Publié: (2025)
par: Hong, Ilgee, et autres
Publié: (2025)
Ask a Strong LLM Judge when Your Reward Model is Uncertain
par: Xu, Zhenghao, et autres
Publié: (2025)
par: Xu, Zhenghao, et autres
Publié: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
par: Bukharin, Alexander, et autres
Publié: (2024)
par: Bukharin, Alexander, et autres
Publié: (2024)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
To Cool or not to Cool? Temperature Network Meets Large Foundation Models via DRO
par: Qiu, Zi-Hao, et autres
Publié: (2024)
par: Qiu, Zi-Hao, et autres
Publié: (2024)
DRTriton: Large-Scale Synthetic Data Driven Reinforcement Learning for Triton Kernel Generation
par: Guo, Siqi, et autres
Publié: (2026)
par: Guo, Siqi, et autres
Publié: (2026)
Finetuning Generative Large Language Models with Discrimination Instructions for Knowledge Graph Completion
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
par: Li, Zichong, et autres
Publié: (2025)
par: Li, Zichong, et autres
Publié: (2025)
Discovering Global False Negatives On the Fly for Self-supervised Contrastive Learning
par: Balmaseda, Vicente, et autres
Publié: (2025)
par: Balmaseda, Vicente, et autres
Publié: (2025)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
par: Liu, Biao, et autres
Publié: (2026)
par: Liu, Biao, et autres
Publié: (2026)
PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion Models
par: Deng, Fei, et autres
Publié: (2024)
par: Deng, Fei, et autres
Publié: (2024)
Transfer Learning of Tabular Data by Finetuning Large Language Models
par: Rabbani, Shourav B., et autres
Publié: (2025)
par: Rabbani, Shourav B., et autres
Publié: (2025)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
par: Qiu, Wenjie, et autres
Publié: (2025)
par: Qiu, Wenjie, et autres
Publié: (2025)
Large Language Models to Diffusion Finetuning
par: Cetin, Edoardo, et autres
Publié: (2025)
par: Cetin, Edoardo, et autres
Publié: (2025)
On Discriminative Probabilistic Modeling for Self-Supervised Representation Learning
par: Wang, Bokun, et autres
Publié: (2024)
par: Wang, Bokun, et autres
Publié: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
par: Zhu, Zining, et autres
Publié: (2025)
par: Zhu, Zining, et autres
Publié: (2025)
Boosting Reward Model with Preference-Conditional Multi-Aspect Synthetic Data Generation
par: Shen, Jiaming, et autres
Publié: (2024)
par: Shen, Jiaming, et autres
Publié: (2024)
Towards Active Synthetic Data Generation for Finetuning Language Models
par: Kessler, Samuel, et autres
Publié: (2025)
par: Kessler, Samuel, et autres
Publié: (2025)
IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models
par: Song, Haonan, et autres
Publié: (2026)
par: Song, Haonan, et autres
Publié: (2026)
Scaling Reward Modeling without Human Supervision
par: Fan, Jingxuan, et autres
Publié: (2026)
par: Fan, Jingxuan, et autres
Publié: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
Contextual Text Denoising with Masked Language Models
par: Sun, Yifu, et autres
Publié: (2019)
par: Sun, Yifu, et autres
Publié: (2019)
BlendFilter: Advancing Retrieval-Augmented Large Language Models via Query Generation Blending and Knowledge Filtering
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
A Survey on Human Preference Learning for Large Language Models
par: Jiang, Ruili, et autres
Publié: (2024)
par: Jiang, Ruili, et autres
Publié: (2024)
Finetuning Large Language Model for Personalized Ranking
par: Bai, Zhuoxi, et autres
Publié: (2024)
par: Bai, Zhuoxi, et autres
Publié: (2024)
Risk-Averse Finetuning of Large Language Models
par: Chaudhary, Sapana, et autres
Publié: (2025)
par: Chaudhary, Sapana, et autres
Publié: (2025)
Finetuning Large Language Models for Vulnerability Detection
par: Shestov, Alexey, et autres
Publié: (2024)
par: Shestov, Alexey, et autres
Publié: (2024)
Transfer Learning for Finetuning Large Language Models
par: Strangmann, Tobias, et autres
Publié: (2024)
par: Strangmann, Tobias, et autres
Publié: (2024)
PILAF: Optimal Human Preference Sampling for Reward Modeling
par: Feng, Yunzhen, et autres
Publié: (2025)
par: Feng, Yunzhen, et autres
Publié: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
par: Zhang, Ruohong, et autres
Publié: (2024)
par: Zhang, Ruohong, et autres
Publié: (2024)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
par: Zhao, Shuai, et autres
Publié: (2025)
par: Zhao, Shuai, et autres
Publié: (2025)
Relational Database Augmented Large Language Model
par: Qin, Zongyue, et autres
Publié: (2024)
par: Qin, Zongyue, et autres
Publié: (2024)
ROPO: Robust Preference Optimization for Large Language Models
par: Liang, Xize, et autres
Publié: (2024)
par: Liang, Xize, et autres
Publié: (2024)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
par: Luu, Tung M., et autres
Publié: (2025)
par: Luu, Tung M., et autres
Publié: (2025)
Can Language Models Follow Multiple Turns of Entangled Instructions?
par: Han, Chi, et autres
Publié: (2025)
par: Han, Chi, et autres
Publié: (2025)
Documents similaires
-
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
par: Hong, Ilgee, et autres
Publié: (2024) -
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
par: Hong, Ilgee, et autres
Publié: (2025) -
Ask a Strong LLM Judge when Your Reward Model is Uncertain
par: Xu, Zhenghao, et autres
Publié: (2025) -
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025) -
Robust Reinforcement Learning from Corrupted Human Feedback
par: Bukharin, Alexander, et autres
Publié: (2024)