Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tyagi, Utkarsh, Guo, Xingang, Rezaei, MohammadHossein, George, Daniel, Mahmoud, Anas, Lee, Jackson, Liu, Bing, He, Yunzhong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reward Hacking in Rubric-Based Reinforcement Learning
par: Mahmoud, Anas, et autres
Publié: (2026)
par: Mahmoud, Anas, et autres
Publié: (2026)
Online Rubrics Elicitation from Pairwise Comparisons
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Agentic Rubrics as Contextual Verifiers for SWE Agents
par: Raghavendra, Mohit, et autres
Publié: (2026)
par: Raghavendra, Mohit, et autres
Publié: (2026)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
par: Li, Gaotang, et autres
Publié: (2026)
par: Li, Gaotang, et autres
Publié: (2026)
Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
par: Jia, Mengzhao, et autres
Publié: (2025)
par: Jia, Mengzhao, et autres
Publié: (2025)
Paraphrasing in Affirmative Terms Improves Negation Understanding
par: Rezaei, MohammadHossein, et autres
Publié: (2024)
par: Rezaei, MohammadHossein, et autres
Publié: (2024)
Making Language Models Robust Against Negation
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
Rubrics.
par: Callison, Daniel
Publié: (2000)
par: Callison, Daniel
Publié: (2000)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025)
par: Xie, Lipeng, et autres
Publié: (2025)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Visual Preference Optimization with Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
R3: Robust Rubric-Agnostic Reward Models
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification
par: Zhao, Jiale, et autres
Publié: (2026)
par: Zhao, Jiale, et autres
Publié: (2026)
Step-wise Rubric Rewards for LLM Reasoning
par: Xie, Weichu, et autres
Publié: (2026)
par: Xie, Weichu, et autres
Publié: (2026)
Robust Reward Modeling via Causal Rubrics
par: Srivastava, Pragya, et autres
Publié: (2025)
par: Srivastava, Pragya, et autres
Publié: (2025)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
Training AI Co-Scientists Using Rubric Rewards
par: Goel, Shashwat, et autres
Publié: (2025)
par: Goel, Shashwat, et autres
Publié: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
par: Sharma, Manasi, et autres
Publié: (2025)
par: Sharma, Manasi, et autres
Publié: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
RubricBench: Aligning Model-Generated Rubrics with Human Standards
par: Zhang, Qiyuan, et autres
Publié: (2026)
par: Zhang, Qiyuan, et autres
Publié: (2026)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
par: Ye, Zhiling, et autres
Publié: (2025)
par: Ye, Zhiling, et autres
Publié: (2025)
Preference-Aware Rubric Learning for Personalized Evaluation
par: Qiu, Yilun, et autres
Publié: (2026)
par: Qiu, Yilun, et autres
Publié: (2026)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
par: Bhattarai, Manish, et autres
Publié: (2026)
par: Bhattarai, Manish, et autres
Publié: (2026)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
par: Jia, Ruipeng, et autres
Publié: (2026)
par: Jia, Ruipeng, et autres
Publié: (2026)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
par: Chen, Yinzhu, et autres
Publié: (2026)
par: Chen, Yinzhu, et autres
Publié: (2026)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
par: Zhang, Jiajie, et autres
Publié: (2026)
par: Zhang, Jiajie, et autres
Publié: (2026)
Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
par: Bi, Baolong, et autres
Publié: (2025)
par: Bi, Baolong, et autres
Publié: (2025)
Rubric-based On-policy Distillation
par: Fang, Junfeng, et autres
Publié: (2026)
par: Fang, Junfeng, et autres
Publié: (2026)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
par: Pan, Tianjun, et autres
Publié: (2026)
par: Pan, Tianjun, et autres
Publié: (2026)
Teaching and Learning Information Synthesis: An Intervention and Rubric Based Assessment
par: Lundstrom, Kacy, et autres
Publié: (2015)
par: Lundstrom, Kacy, et autres
Publié: (2015)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
par: Guan, Xin, et autres
Publié: (2026)
par: Guan, Xin, et autres
Publié: (2026)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
par: Sanders, Kate, et autres
Publié: (2026)
par: Sanders, Kate, et autres
Publié: (2026)
Documents similaires
-
Reward Hacking in Rubric-Based Reinforcement Learning
par: Mahmoud, Anas, et autres
Publié: (2026) -
Online Rubrics Elicitation from Pairwise Comparisons
par: Rezaei, MohammadHossein, et autres
Publié: (2025) -
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025) -
Agentic Rubrics as Contextual Verifiers for SWE Agents
par: Raghavendra, Mohit, et autres
Publié: (2026) -
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
par: Li, Gaotang, et autres
Publié: (2026)