Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Qiu, Wenjie, Li, Yi-Chen, Zhang, Xuqin, Zhang, Tianyi, Zhang, Yihang, Zhang, Zongzhang, Yu, Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EEG-Based Brain-LLM Interface for Human Preference Aligned Generation
von: Zhang, Junzi, et al.
Veröffentlicht: (2026)
von: Zhang, Junzi, et al.
Veröffentlicht: (2026)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024)
Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024)
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
von: Ma, Qiyao, et al.
Veröffentlicht: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
von: Lin, Yong, et al.
Veröffentlicht: (2024)
von: Lin, Yong, et al.
Veröffentlicht: (2024)
AgentRec: Agent Recommendation Using Sentence Embeddings Aligned to Human Feedback
von: Park, Joshua, et al.
Veröffentlicht: (2025)
von: Park, Joshua, et al.
Veröffentlicht: (2025)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models
von: Yu, Zichao, et al.
Veröffentlicht: (2025)
von: Yu, Zichao, et al.
Veröffentlicht: (2025)
ProgRM: Build Better GUI Agents with Progress Rewards
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
ReMoDetect: Reward Models Recognize Aligned LLM's Generations
von: Lee, Hyunseok, et al.
Veröffentlicht: (2024)
von: Lee, Hyunseok, et al.
Veröffentlicht: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
von: Zhou, Zhenglin, et al.
Veröffentlicht: (2025)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
von: Jia, Chen
Veröffentlicht: (2024)
von: Jia, Chen
Veröffentlicht: (2024)
Dial-In LLM: Human-Aligned LLM-in-the-loop Intent Clustering for Customer Service Dialogues
von: Hong, Mengze, et al.
Veröffentlicht: (2024)
von: Hong, Mengze, et al.
Veröffentlicht: (2024)
Computational Sentence-level Metrics Predicting Human Sentence Comprehension
von: Sun, Kun, et al.
Veröffentlicht: (2024)
von: Sun, Kun, et al.
Veröffentlicht: (2024)
Consolidating Rewarded Perturbations for LLM Post-Training
von: Zhang, Zheyu, et al.
Veröffentlicht: (2026)
von: Zhang, Zheyu, et al.
Veröffentlicht: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
Debiased Offline Representation Learning for Fast Online Adaptation in Non-stationary Dynamics
von: Zhang, Xinyu, et al.
Veröffentlicht: (2024)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2024)
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
von: Xu, Zhenyu, et al.
Veröffentlicht: (2024)
von: Xu, Zhenyu, et al.
Veröffentlicht: (2024)
Fine-tuning Language Models with Generative Adversarial Reward Modelling
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
von: Yu, Zhang Ze, et al.
Veröffentlicht: (2023)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Hongxiang, et al.
Veröffentlicht: (2025)
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
von: Peng, Andi, et al.
Veröffentlicht: (2024)
von: Peng, Andi, et al.
Veröffentlicht: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
von: Sun, Shengyang, et al.
Veröffentlicht: (2025)
Pre-Trained Policy Discriminators are General Reward Models
von: Dou, Shihan, et al.
Veröffentlicht: (2025)
von: Dou, Shihan, et al.
Veröffentlicht: (2025)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
von: Shen, Han, et al.
Veröffentlicht: (2024)
von: Shen, Han, et al.
Veröffentlicht: (2024)
CodeJudge: Evaluating Code Generation with Large Language Models
von: Tong, Weixi, et al.
Veröffentlicht: (2024)
von: Tong, Weixi, et al.
Veröffentlicht: (2024)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
von: Xu, Ran, et al.
Veröffentlicht: (2026)
von: Xu, Ran, et al.
Veröffentlicht: (2026)
ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
von: Zhang, Xuqin, et al.
Veröffentlicht: (2026)
von: Zhang, Xuqin, et al.
Veröffentlicht: (2026)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations
von: Yang, Xinyi, et al.
Veröffentlicht: (2025)
von: Yang, Xinyi, et al.
Veröffentlicht: (2025)
Entropy-Regularized Process Reward Model
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
von: Zhang, Hanning, et al.
Veröffentlicht: (2024)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
SimPO: Simple Preference Optimization with a Reference-Free Reward
von: Meng, Yu, et al.
Veröffentlicht: (2024)
von: Meng, Yu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
EEG-Based Brain-LLM Interface for Human Preference Aligned Generation
von: Zhang, Junzi, et al.
Veröffentlicht: (2026) -
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
von: Zhang, Fuxiang, et al.
Veröffentlicht: (2024) -
Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation
von: Li, Yi-Chen, et al.
Veröffentlicht: (2024) -
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
von: Ma, Qiyao, et al.
Veröffentlicht: (2026) -
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)