Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Shenao, Liu, Zhihan, Liu, Boyi, Zhang, Yufeng, Yang, Yingxiang, Liu, Yongfei, Chen, Liyu, Sun, Tao, Wang, Zhaoran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
von: Liu, Zhihan, et al.
Veröffentlicht: (2024)
Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency
von: Liu, Zhihan, et al.
Veröffentlicht: (2023)
von: Liu, Zhihan, et al.
Veröffentlicht: (2023)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
von: Zhang, Yufeng, et al.
Veröffentlicht: (2024)
von: Zhang, Yufeng, et al.
Veröffentlicht: (2024)
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
How Can LLM Guide RL? A Value-Based Approach
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)
Just Say What You Want: Only-prompting Self-rewarding Online Preference Optimization
von: Xu, Ruijie, et al.
Veröffentlicht: (2024)
von: Xu, Ruijie, et al.
Veröffentlicht: (2024)
Hindsight Planner: A Closed-Loop Few-Shot Planner for Embodied Instruction Following
von: Yang, Yuxiao, et al.
Veröffentlicht: (2024)
von: Yang, Yuxiao, et al.
Veröffentlicht: (2024)
BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning
von: Zhong, Han, et al.
Veröffentlicht: (2025)
von: Zhong, Han, et al.
Veröffentlicht: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Can Large Language Models Play Games? A Case Study of A Self-Play Approach
von: Guo, Hongyi, et al.
Veröffentlicht: (2024)
von: Guo, Hongyi, et al.
Veröffentlicht: (2024)
Let Models Speak Ciphers: Multiagent Debate through Embeddings
von: Pham, Chau, et al.
Veröffentlicht: (2023)
von: Pham, Chau, et al.
Veröffentlicht: (2023)
Aligning CodeLLMs with Direct Preference Optimization
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
From Demonstrations to Rewards: Alignment Without Explicit Human Preferences
von: Zeng, Siliang, et al.
Veröffentlicht: (2025)
von: Zeng, Siliang, et al.
Veröffentlicht: (2025)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2023)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
DavIR: Data Selection via Implicit Reward for Large Language Models
von: Zhou, Haotian, et al.
Veröffentlicht: (2023)
von: Zhou, Haotian, et al.
Veröffentlicht: (2023)
Direct Alignment with Heterogeneous Preferences
von: Shirali, Ali, et al.
Veröffentlicht: (2025)
von: Shirali, Ali, et al.
Veröffentlicht: (2025)
Reward Learning From Preference With Ties
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents
von: Liu, Zhihan, et al.
Veröffentlicht: (2026)
von: Liu, Zhihan, et al.
Veröffentlicht: (2026)
SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking
von: Ren, Jie, et al.
Veröffentlicht: (2025)
von: Ren, Jie, et al.
Veröffentlicht: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
von: Fan, Zhengyuan, et al.
Veröffentlicht: (2026)
von: Fan, Zhengyuan, et al.
Veröffentlicht: (2026)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
ATLAS: Autoformalizing Theorems through Lifting, Augmentation, and Synthesis of Data
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2025)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
von: Hou, Xiaoyang, et al.
Veröffentlicht: (2026)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
von: Zhang, Shenao, et al.
Veröffentlicht: (2025)
Proximity Matters: Local Proximity Enhanced Balancing for Treatment Effect Estimation
von: Wang, Hao, et al.
Veröffentlicht: (2024)
von: Wang, Hao, et al.
Veröffentlicht: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
von: Lin, Baijiong, et al.
Veröffentlicht: (2025)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
Planning-Augmented Sampling with Early Guidance for High-Reward Discovery
von: Zhu, Rui, et al.
Veröffentlicht: (2025)
von: Zhu, Rui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
von: Liu, Zhihan, et al.
Veröffentlicht: (2024) -
Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer
von: Liu, Zhihan, et al.
Veröffentlicht: (2024) -
Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency
von: Liu, Zhihan, et al.
Veröffentlicht: (2023) -
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
von: Zhang, Yufeng, et al.
Veröffentlicht: (2024) -
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
von: Zhang, Shenao, et al.
Veröffentlicht: (2024)