LRHP: Learning Representations for Human Preferences via Preference Pairs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chenglong, Gan, Yang, Huo, Yifu, Mu, Yongyu, He, Qiaozhi, Yang, Murun, Xiao, Tong, Zhang, Chunliang, Liu, Tongran, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
par: Wang, Chenglong, et autres
Publié: (2024)
par: Wang, Chenglong, et autres
Publié: (2024)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
par: Huo, Yifu, et autres
Publié: (2025)
par: Huo, Yifu, et autres
Publié: (2025)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
Revealing the Parallel Multilingual Learning within Large Language Models
par: Mu, Yongyu, et autres
Publié: (2024)
par: Mu, Yongyu, et autres
Publié: (2024)
Cross-layer Attention Sharing for Pre-trained Large Language Models
par: Mu, Yongyu, et autres
Publié: (2024)
par: Mu, Yongyu, et autres
Publié: (2024)
Hybrid Alignment Training for Large Language Models
par: Wang, Chenglong, et autres
Publié: (2024)
par: Wang, Chenglong, et autres
Publié: (2024)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
par: Huo, Yifu, et autres
Publié: (2026)
par: Huo, Yifu, et autres
Publié: (2026)
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
par: Chang, Kaiyan, et autres
Publié: (2026)
par: Chang, Kaiyan, et autres
Publié: (2026)
Learning Evaluation Models from Large Language Models for Sequence Generation
par: Wang, Chenglong, et autres
Publié: (2023)
par: Wang, Chenglong, et autres
Publié: (2023)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
par: Mu, Yongyu, et autres
Publié: (2025)
par: Mu, Yongyu, et autres
Publié: (2025)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
par: Wang, Yilin, et autres
Publié: (2026)
par: Wang, Yilin, et autres
Publié: (2026)
SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
par: Wang, Chenglong, et autres
Publié: (2026)
par: Wang, Chenglong, et autres
Publié: (2026)
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
par: Zhu, Ziming, et autres
Publié: (2025)
par: Zhu, Ziming, et autres
Publié: (2025)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
par: Wang, Chenglong, et autres
Publié: (2026)
par: Wang, Chenglong, et autres
Publié: (2026)
LoRA-LiteE: A Computationally Efficient Framework for Chatbot Preference-Tuning
par: Yang, Yahe, et autres
Publié: (2024)
par: Yang, Yahe, et autres
Publié: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
par: Huang, Pengcheng, et autres
Publié: (2024)
par: Huang, Pengcheng, et autres
Publié: (2024)
Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learning
par: Yang, Sen, et autres
Publié: (2024)
par: Yang, Sen, et autres
Publié: (2024)
Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
par: Gan, Woody Haosheng, et autres
Publié: (2026)
par: Gan, Woody Haosheng, et autres
Publié: (2026)
Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
par: Fan, Yuchun, et autres
Publié: (2025)
par: Fan, Yuchun, et autres
Publié: (2025)
Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning
par: Wang, Shanyong, et autres
Publié: (2026)
par: Wang, Shanyong, et autres
Publié: (2026)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
par: Mu, Yongyu, et autres
Publié: (2025)
par: Mu, Yongyu, et autres
Publié: (2025)
PLOT: Enhancing Preference Learning via Optimal Transport
par: Zhu, Liang, et autres
Publié: (2026)
par: Zhu, Liang, et autres
Publié: (2026)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
par: Zhu, Zining, et autres
Publié: (2025)
par: Zhu, Zining, et autres
Publié: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
par: Liu, Tong, et autres
Publié: (2025)
par: Liu, Tong, et autres
Publié: (2025)
A Survey on Human Preference Learning for Large Language Models
par: Jiang, Ruili, et autres
Publié: (2024)
par: Jiang, Ruili, et autres
Publié: (2024)
Aligning Large Language Models with Human Preferences through Representation Engineering
par: Liu, Wenhao, et autres
Publié: (2023)
par: Liu, Wenhao, et autres
Publié: (2023)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
par: Fan, Yuchun, et autres
Publié: (2026)
par: Fan, Yuchun, et autres
Publié: (2026)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
par: Fan, Yuchun, et autres
Publié: (2025)
par: Fan, Yuchun, et autres
Publié: (2025)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
par: Zhang, Rongzhi, et autres
Publié: (2024)
par: Zhang, Rongzhi, et autres
Publié: (2024)
Evaluating and Aligning CodeLLMs on Human Preference
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
par: Mu, Yongyu, et autres
Publié: (2026)
par: Mu, Yongyu, et autres
Publié: (2026)
New Desiderata for Direct Preference Optimization
par: Hu, Xiangkun, et autres
Publié: (2024)
par: Hu, Xiangkun, et autres
Publié: (2024)
Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation
par: Luo, Yingfeng, et autres
Publié: (2025)
par: Luo, Yingfeng, et autres
Publié: (2025)
NiuTrans.LMT: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
par: Luo, Yingfeng, et autres
Publié: (2025)
par: Luo, Yingfeng, et autres
Publié: (2025)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
par: Zhou, Zhenglin, et autres
Publié: (2025)
par: Zhou, Zhenglin, et autres
Publié: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
par: Jian, Chengtao, et autres
Publié: (2025)
par: Jian, Chengtao, et autres
Publié: (2025)
Documents similaires
-
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
par: Wang, Chenglong, et autres
Publié: (2024) -
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
par: Wang, Chenglong, et autres
Publié: (2025) -
GRAM: A Generative Foundation Reward Model for Reward Generalization
par: Wang, Chenglong, et autres
Publié: (2025) -
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
par: Huo, Yifu, et autres
Publié: (2025) -
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
par: Wang, Chenglong, et autres
Publié: (2025)