RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Gaotang, Mishra, Bhavana Dalvi, Wang, Zifeng, Yan, Jun, Chen, Yanfei, Li, Chun-Liang, Le, Long T., Han, Rujun, Lee, George, Tong, Hanghang, Lee, Chen-Yu, Pfister, Tomas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
par: Tyagi, Utkarsh, et autres
Publié: (2026)
par: Tyagi, Utkarsh, et autres
Publié: (2026)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
Taming Knowledge Conflicts in Language Models
par: Li, Gaotang, et autres
Publié: (2025)
par: Li, Gaotang, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
par: Guan, Xin, et autres
Publié: (2026)
par: Guan, Xin, et autres
Publié: (2026)
SkillOS: Learning Skill Curation for Self-Evolving Agents
par: Ouyang, Siru, et autres
Publié: (2026)
par: Ouyang, Siru, et autres
Publié: (2026)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
par: Bhattarai, Manish, et autres
Publié: (2026)
par: Bhattarai, Manish, et autres
Publié: (2026)
Visual Preference Optimization with Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
par: Xie, Lipeng, et autres
Publié: (2025)
par: Xie, Lipeng, et autres
Publié: (2025)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
par: Huang, Jiawei, et autres
Publié: (2026)
par: Huang, Jiawei, et autres
Publié: (2026)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
par: Jia, Mengzhao, et autres
Publié: (2025)
par: Jia, Mengzhao, et autres
Publié: (2025)
Step-wise Rubric Rewards for LLM Reasoning
par: Xie, Weichu, et autres
Publié: (2026)
par: Xie, Weichu, et autres
Publié: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
par: Pan, Tianjun, et autres
Publié: (2026)
par: Pan, Tianjun, et autres
Publié: (2026)
Agentic Rubrics as Contextual Verifiers for SWE Agents
par: Raghavendra, Mohit, et autres
Publié: (2026)
par: Raghavendra, Mohit, et autres
Publié: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
Robust Reward Modeling via Causal Rubrics
par: Srivastava, Pragya, et autres
Publié: (2025)
par: Srivastava, Pragya, et autres
Publié: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
par: Mahmoud, Anas, et autres
Publié: (2026)
par: Mahmoud, Anas, et autres
Publié: (2026)
Rubrics.
par: Callison, Daniel
Publié: (2000)
par: Callison, Daniel
Publié: (2000)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
RubricBench: Aligning Model-Generated Rubrics with Human Standards
par: Zhang, Qiyuan, et autres
Publié: (2026)
par: Zhang, Qiyuan, et autres
Publié: (2026)
mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
par: Lan, Guangchen, et autres
Publié: (2026)
par: Lan, Guangchen, et autres
Publié: (2026)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
Graph Homophily Booster: Rethinking the Role of Discrete Features on Heterophilic Graphs
par: Qiu, Ruizhong, et autres
Publié: (2025)
par: Qiu, Ruizhong, et autres
Publié: (2025)
Graph homophily booster: Reimagining the role of discrete features in heterophilic graph learning
par: Qiu, Ruizhong, et autres
Publié: (2026)
par: Qiu, Ruizhong, et autres
Publié: (2026)
R3: Robust Rubric-Agnostic Reward Models
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
Training AI Co-Scientists Using Rubric Rewards
par: Goel, Shashwat, et autres
Publié: (2025)
par: Goel, Shashwat, et autres
Publié: (2025)
An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs
par: Ma, Linyue, et autres
Publié: (2025)
par: Ma, Linyue, et autres
Publié: (2025)
When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
par: Ikezogwo, Wisdom, et autres
Publié: (2026)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
par: Huang, Yu, et autres
Publié: (2026)
par: Huang, Yu, et autres
Publié: (2026)
LiSA: Lifelong Safety Adaptation via Conservative Policy Induction
par: Kim, Minbeom, et autres
Publié: (2026)
par: Kim, Minbeom, et autres
Publié: (2026)
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
par: Li, Sunzhu, et autres
Publié: (2026)
par: Li, Sunzhu, et autres
Publié: (2026)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
par: Wu, Peilin, et autres
Publié: (2026)
par: Wu, Peilin, et autres
Publié: (2026)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
par: Liu, Dengcan, et autres
Publié: (2026)
par: Liu, Dengcan, et autres
Publié: (2026)
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
par: Tian, Juanxi, et autres
Publié: (2026)
par: Tian, Juanxi, et autres
Publié: (2026)
Documents similaires
-
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
par: Tyagi, Utkarsh, et autres
Publié: (2026) -
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025) -
Taming Knowledge Conflicts in Language Models
par: Li, Gaotang, et autres
Publié: (2025) -
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025) -
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
par: Guan, Xin, et autres
Publié: (2026)