RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiahui, Li, Lin, Chang, Tai-wei, Kuang, Kun, Chen, Long, Zhou, Jun, Yang, Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
par: Tan, Hongze, et autres
Publié: (2025)
par: Tan, Hongze, et autres
Publié: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
par: Zhou, Wenxuan, et autres
Publié: (2024)
par: Zhou, Wenxuan, et autres
Publié: (2024)
Selective Preference Optimization via Token-Level Reward Function Estimation
par: Yang, Kailai, et autres
Publié: (2024)
par: Yang, Kailai, et autres
Publié: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
par: Liu, Shang, et autres
Publié: (2024)
par: Liu, Shang, et autres
Publié: (2024)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Reward-free Alignment for Conflicting Objectives
par: Chen, Peter, et autres
Publié: (2026)
par: Chen, Peter, et autres
Publié: (2026)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025)
par: Chen, Hongzhan, et autres
Publié: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
par: Gao, Shiping, et autres
Publié: (2026)
par: Gao, Shiping, et autres
Publié: (2026)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
par: Lin, Xingyu, et autres
Publié: (2025)
par: Lin, Xingyu, et autres
Publié: (2025)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
par: Yoon, Eunseop, et autres
Publié: (2024)
par: Yoon, Eunseop, et autres
Publié: (2024)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
par: Shen, Wei, et autres
Publié: (2024)
par: Shen, Wei, et autres
Publié: (2024)
PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models
par: Song, Mingyang, et autres
Publié: (2025)
par: Song, Mingyang, et autres
Publié: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
par: Lin, Xingyu, et autres
Publié: (2026)
par: Lin, Xingyu, et autres
Publié: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
par: Ackermann, Johannes, et autres
Publié: (2026)
par: Ackermann, Johannes, et autres
Publié: (2026)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
par: Xie, Yutao, et autres
Publié: (2026)
par: Xie, Yutao, et autres
Publié: (2026)
CAMEL: Confidence-Gated Reflection for Reward Modeling
par: Zhu, Zirui, et autres
Publié: (2026)
par: Zhu, Zirui, et autres
Publié: (2026)
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
par: Luo, Renjie, et autres
Publié: (2025)
par: Luo, Renjie, et autres
Publié: (2025)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
par: Elle
Publié: (2025)
par: Elle
Publié: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
Learning to Generate Secure Code via Token-Level Rewards
par: Quan, Jiazheng, et autres
Publié: (2026)
par: Quan, Jiazheng, et autres
Publié: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
Process Reward Model with Q-Value Rankings
par: Li, Wendi, et autres
Publié: (2024)
par: Li, Wendi, et autres
Publié: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
par: Jin, Zhuoran, et autres
Publié: (2025)
par: Jin, Zhuoran, et autres
Publié: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
par: Li, Yanshi, et autres
Publié: (2024)
par: Li, Yanshi, et autres
Publié: (2024)
Self-Evolved Reward Learning for LLMs
par: Huang, Chenghua, et autres
Publié: (2024)
par: Huang, Chenghua, et autres
Publié: (2024)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
par: Zhang, Shun, et autres
Publié: (2024)
par: Zhang, Shun, et autres
Publié: (2024)
CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
par: Xue, Xiangyuan, et autres
Publié: (2025)
par: Xue, Xiangyuan, et autres
Publié: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
par: Li, Jiachun, et autres
Publié: (2025)
par: Li, Jiachun, et autres
Publié: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
par: Wu, Yuning, et autres
Publié: (2026)
par: Wu, Yuning, et autres
Publié: (2026)
Feedback Loops With Language Models Drive In-Context Reward Hacking
par: Pan, Alexander, et autres
Publié: (2024)
par: Pan, Alexander, et autres
Publié: (2024)
RewardAnything: Generalizable Principle-Following Reward Models
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Documents similaires
-
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
par: Tan, Hongze, et autres
Publié: (2025) -
T-REG: Preference Optimization with Token-Level Reward Regularization
par: Zhou, Wenxuan, et autres
Publié: (2024) -
Selective Preference Optimization via Token-Level Reward Function Estimation
par: Yang, Kailai, et autres
Publié: (2024) -
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024) -
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
par: Liu, Shang, et autres
Publié: (2024)