Towards Comprehensive Preference Data Collection for Reward Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Yulan, Li, Qingyang, Ouyang, Sheng, Chen, Ge, Chen, Kaihui, Mei, Lijun, Ye, Xucheng, Zhang, Fuzheng, Liu, Yong |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
by: Ouyang, Sheng, et al.
Published: (2025)
by: Ouyang, Sheng, et al.
Published: (2025)
TSO: Self-Training with Scaled Preference Optimization
by: Chen, Kaihui, et al.
Published: (2024)
by: Chen, Kaihui, et al.
Published: (2024)
SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin
by: Yi, Hao, et al.
Published: (2025)
by: Yi, Hao, et al.
Published: (2025)
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
by: Hu, Yulan, et al.
Published: (2025)
by: Hu, Yulan, et al.
Published: (2025)
GUNDAM: Aligning Large Language Models with Graph Understanding
by: Ouyang, Sheng, et al.
Published: (2024)
by: Ouyang, Sheng, et al.
Published: (2024)
Graph Ranking Contrastive Learning: A Extremely Simple yet Efficient Method
by: Hu, Yulan, et al.
Published: (2023)
by: Hu, Yulan, et al.
Published: (2023)
Preserving Node Distinctness in Graph Autoencoders via Similarity Distillation
by: Chen, Ge, et al.
Published: (2024)
by: Chen, Ge, et al.
Published: (2024)
Refining Latent Representations: A Generative SSL Approach for Heterogeneous Graph Learning
by: Hu, Yulan, et al.
Published: (2023)
by: Hu, Yulan, et al.
Published: (2023)
VIGraph: Generative Self-supervised Learning for Class-Imbalanced Node Classification
by: Hu, Yulan, et al.
Published: (2023)
by: Hu, Yulan, et al.
Published: (2023)
Exploring Task Unification in Graph Representation Learning via Generative Approach
by: Hu, Yulan, et al.
Published: (2024)
by: Hu, Yulan, et al.
Published: (2024)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
by: Yi, Hao, et al.
Published: (2026)
by: Yi, Hao, et al.
Published: (2026)
Reward Learning From Preference With Ties
by: Liu, Jinsong, et al.
Published: (2024)
by: Liu, Jinsong, et al.
Published: (2024)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
by: Zhang, Shenao, et al.
Published: (2024)
by: Zhang, Shenao, et al.
Published: (2024)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
by: Yi, Hao, et al.
Published: (2024)
by: Yi, Hao, et al.
Published: (2024)
Aligning Crowd Feedback via Distributional Preference Reward Modeling
by: Li, Dexun, et al.
Published: (2024)
by: Li, Dexun, et al.
Published: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
by: Jin, Zhuoran, et al.
Published: (2025)
by: Jin, Zhuoran, et al.
Published: (2025)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
by: Mei, Xiaoyong, et al.
Published: (2026)
by: Mei, Xiaoyong, et al.
Published: (2026)
Rectifying Shortcut Behaviors in Preference-based Reward Learning
by: Ye, Wenqian, et al.
Published: (2025)
by: Ye, Wenqian, et al.
Published: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
by: Ye, Ziyi, et al.
Published: (2024)
by: Ye, Ziyi, et al.
Published: (2024)
DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
by: Zhang, Zhihong, et al.
Published: (2026)
by: Zhang, Zhihong, et al.
Published: (2026)
Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator
by: Chen, Zhuotong, et al.
Published: (2025)
by: Chen, Zhuotong, et al.
Published: (2025)
Towards Understanding the Influence of Reward Margin on Preference Model Performance
by: Qin, Bowen, et al.
Published: (2024)
by: Qin, Bowen, et al.
Published: (2024)
Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving
by: Han, Ye, et al.
Published: (2025)
by: Han, Ye, et al.
Published: (2025)
Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
by: Wang, Jiaxuan, et al.
Published: (2026)
by: Wang, Jiaxuan, et al.
Published: (2026)
Unified Algorithms for RL with Decision-Estimation Coefficients: PAC, Reward-Free, Preference-Based Learning, and Beyond
by: Chen, Fan, et al.
Published: (2022)
by: Chen, Fan, et al.
Published: (2022)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
by: Chen, Xinlong, et al.
Published: (2025)
by: Chen, Xinlong, et al.
Published: (2025)
Self-Controlled Dynamic Expansion Model for Continual Learning
by: Wu, Runqing, et al.
Published: (2025)
by: Wu, Runqing, et al.
Published: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
by: Jin, Zhuoran, et al.
Published: (2024)
by: Jin, Zhuoran, et al.
Published: (2024)
A Novel Approach to Malicious Code Detection Using CNN-BiLSTM and Feature Fusion
by: Zhang, Lixia, et al.
Published: (2024)
by: Zhang, Lixia, et al.
Published: (2024)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
by: Dang, Jisheng, et al.
Published: (2025)
by: Dang, Jisheng, et al.
Published: (2025)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
by: Zhang, Zhihong, et al.
Published: (2025)
by: Zhang, Zhihong, et al.
Published: (2025)
SheetAgent: Towards A Generalist Agent for Spreadsheet Reasoning and Manipulation via Large Language Models
by: Chen, Yibin, et al.
Published: (2024)
by: Chen, Yibin, et al.
Published: (2024)
Exploring and Addressing Reward Confusion in Offline Preference Learning
by: Chen, Xin, et al.
Published: (2024)
by: Chen, Xin, et al.
Published: (2024)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
by: Yang, Wen, et al.
Published: (2025)
by: Yang, Wen, et al.
Published: (2025)
Multimodal Fusion on Low-quality Data: A Comprehensive Survey
by: Zhang, Qingyang, et al.
Published: (2024)
by: Zhang, Qingyang, et al.
Published: (2024)
A Differentiated Reward Method for Reinforcement Learning based Multi-Vehicle Cooperative Decision-Making Algorithms
by: Han, Ye, et al.
Published: (2025)
by: Han, Ye, et al.
Published: (2025)
On Diversified Preferences of Large Language Model Alignment
by: Zeng, Dun, et al.
Published: (2023)
by: Zeng, Dun, et al.
Published: (2023)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
by: Lin, Baijiong, et al.
Published: (2025)
by: Lin, Baijiong, et al.
Published: (2025)
Just Ask One More Time! Self-Agreement Improves Reasoning of Language Models in (Almost) All Scenarios
by: Lin, Lei, et al.
Published: (2023)
by: Lin, Lei, et al.
Published: (2023)
Similar Items
-
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
by: Ouyang, Sheng, et al.
Published: (2025) -
TSO: Self-Training with Scaled Preference Optimization
by: Chen, Kaihui, et al.
Published: (2024) -
SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin
by: Yi, Hao, et al.
Published: (2025) -
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
by: Hu, Yulan, et al.
Published: (2025) -
GUNDAM: Aligning Large Language Models with Graph Understanding
by: Ouyang, Sheng, et al.
Published: (2024)