Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Tianze, Zheng, Yanzhao, Lu, Pengrui, Ye, Lyumanshan, Wu, Yong, Zhang, Zhentao, Yu, Yuanqiang, Ma, Chao, Zhu, Jihuai, Liu, Pengfei, Dong, Baohua, Zhu, Hangcheng, Huang, Ruohui, Yu, Gang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
von: Ding, Liang
Veröffentlicht: (2026)
von: Ding, Liang
Veröffentlicht: (2026)
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
von: Xu, Tianze, et al.
Veröffentlicht: (2025)
von: Xu, Tianze, et al.
Veröffentlicht: (2025)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
von: Pan, Tianjun, et al.
Veröffentlicht: (2026)
von: Pan, Tianjun, et al.
Veröffentlicht: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
von: Liu, Tianci, et al.
Veröffentlicht: (2025)
SkillRouter: Skill Routing for LLM Agents at Scale
von: Zheng, YanZhao, et al.
Veröffentlicht: (2026)
von: Zheng, YanZhao, et al.
Veröffentlicht: (2026)
SERL: Self-Examining Reinforcement Learning on Open-Domain
von: Ou, Weixuan, et al.
Veröffentlicht: (2025)
von: Ou, Weixuan, et al.
Veröffentlicht: (2025)
Reason from Future: Reverse Thought Chain Enhances LLM Reasoning
von: Xu, Yinlong, et al.
Veröffentlicht: (2025)
von: Xu, Yinlong, et al.
Veröffentlicht: (2025)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
von: Tyagi, Utkarsh, et al.
Veröffentlicht: (2026)
von: Tyagi, Utkarsh, et al.
Veröffentlicht: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
von: Jia, Mengzhao, et al.
Veröffentlicht: (2025)
von: Jia, Mengzhao, et al.
Veröffentlicht: (2025)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
von: Li, Gaotang, et al.
Veröffentlicht: (2026)
Visual Preference Optimization with Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Robust Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
von: Xie, Lipeng, et al.
Veröffentlicht: (2025)
von: Xie, Lipeng, et al.
Veröffentlicht: (2025)
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
von: Xu, Yifei, et al.
Veröffentlicht: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
Step-wise Rubric Rewards for LLM Reasoning
von: Xie, Weichu, et al.
Veröffentlicht: (2026)
von: Xie, Weichu, et al.
Veröffentlicht: (2026)
AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
von: He, Yun, et al.
Veröffentlicht: (2025)
von: He, Yun, et al.
Veröffentlicht: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
von: Huang, Yu, et al.
Veröffentlicht: (2026)
von: Huang, Yu, et al.
Veröffentlicht: (2026)
Robust Reward Modeling via Causal Rubrics
von: Srivastava, Pragya, et al.
Veröffentlicht: (2025)
von: Srivastava, Pragya, et al.
Veröffentlicht: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
von: Mahmoud, Anas, et al.
Veröffentlicht: (2026)
von: Mahmoud, Anas, et al.
Veröffentlicht: (2026)
Rubrics.
von: Callison, Daniel
Veröffentlicht: (2000)
von: Callison, Daniel
Veröffentlicht: (2000)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
von: Wu, Peilin, et al.
Veröffentlicht: (2026)
von: Wu, Peilin, et al.
Veröffentlicht: (2026)
R3: Robust Rubric-Agnostic Reward Models
von: Anugraha, David, et al.
Veröffentlicht: (2025)
von: Anugraha, David, et al.
Veröffentlicht: (2025)
Training AI Co-Scientists Using Rubric Rewards
von: Goel, Shashwat, et al.
Veröffentlicht: (2025)
von: Goel, Shashwat, et al.
Veröffentlicht: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
von: Gunjal, Anisha, et al.
Veröffentlicht: (2025)
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
von: Shen, William F., et al.
Veröffentlicht: (2026)
von: Shen, William F., et al.
Veröffentlicht: (2026)
RubricBench: Aligning Model-Generated Rubrics with Human Standards
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
von: Liu, Xue, et al.
Veröffentlicht: (2026)
von: Liu, Xue, et al.
Veröffentlicht: (2026)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
von: Liu, Rui, et al.
Veröffentlicht: (2026)
von: Liu, Rui, et al.
Veröffentlicht: (2026)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
von: Yuan, Youliang, et al.
Veröffentlicht: (2025)
von: Yuan, Youliang, et al.
Veröffentlicht: (2025)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
von: Feng, Xuelu, et al.
Veröffentlicht: (2025)
von: Feng, Xuelu, et al.
Veröffentlicht: (2025)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
von: Bhattarai, Manish, et al.
Veröffentlicht: (2026)
von: Bhattarai, Manish, et al.
Veröffentlicht: (2026)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
von: Jia, Ruipeng, et al.
Veröffentlicht: (2026)
von: Jia, Ruipeng, et al.
Veröffentlicht: (2026)
Using Rubrics to Assess Learning in Course-Integrated Library Instruction
von: Gariepy, Laura W., et al.
Veröffentlicht: (2016)
von: Gariepy, Laura W., et al.
Veröffentlicht: (2016)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
von: Sharma, Manasi, et al.
Veröffentlicht: (2025)
von: Sharma, Manasi, et al.
Veröffentlicht: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
von: Guan, Xin, et al.
Veröffentlicht: (2026)
von: Guan, Xin, et al.
Veröffentlicht: (2026)
Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
von: Sun, Haoran, et al.
Veröffentlicht: (2024)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
von: Anugraha, David, et al.
Veröffentlicht: (2025)
von: Anugraha, David, et al.
Veröffentlicht: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
von: Ye, Zhiling, et al.
Veröffentlicht: (2025)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
von: Ding, Liang
Veröffentlicht: (2026) -
ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry
von: Xu, Tianze, et al.
Veröffentlicht: (2025) -
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
von: Pan, Tianjun, et al.
Veröffentlicht: (2026) -
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
von: Liu, Tianci, et al.
Veröffentlicht: (2025) -
SkillRouter: Skill Routing for LLM Agents at Scale
von: Zheng, YanZhao, et al.
Veröffentlicht: (2026)