RubricBench: Aligning Model-Generated Rubrics with Human Standards
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Qiyuan, Zhou, Junyi, Wang, Yufei, Lyu, Fuyuan, Ming, Yidong, Xu, Can, Sun, Qingfeng, Zheng, Kai, Kang, Peng, Liu, Xue, Ma, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
di: Jia, Mengzhao, et al.
Pubblicazione: (2025)
An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs
di: Ma, Linyue, et al.
Pubblicazione: (2025)
di: Ma, Linyue, et al.
Pubblicazione: (2025)
Rubrics.
di: Callison, Daniel
Pubblicazione: (2000)
di: Callison, Daniel
Pubblicazione: (2000)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
di: Guan, Xin, et al.
Pubblicazione: (2026)
di: Guan, Xin, et al.
Pubblicazione: (2026)
Collaborative Performance Prediction for Large Language Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
di: Zhang, Qiyuan, et al.
Pubblicazione: (2024)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
di: Jia, Ruipeng, et al.
Pubblicazione: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
di: Xu, Tianze, et al.
Pubblicazione: (2026)
di: Xu, Tianze, et al.
Pubblicazione: (2026)
Learning Query-Specific Rubrics from Human Preferences for DeepResearch Report Generation
di: Lv, Changze, et al.
Pubblicazione: (2026)
di: Lv, Changze, et al.
Pubblicazione: (2026)
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
di: Li, Sunzhu, et al.
Pubblicazione: (2026)
di: Li, Sunzhu, et al.
Pubblicazione: (2026)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
di: Chen, Xin-Sheng, et al.
Pubblicazione: (2026)
di: Chen, Xin-Sheng, et al.
Pubblicazione: (2026)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
di: Tyagi, Utkarsh, et al.
Pubblicazione: (2026)
di: Tyagi, Utkarsh, et al.
Pubblicazione: (2026)
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
di: Pan, Tianjun, et al.
Pubblicazione: (2026)
di: Pan, Tianjun, et al.
Pubblicazione: (2026)
Reinforcement Learning with Rubric Anchors
di: Huang, Zenan, et al.
Pubblicazione: (2025)
di: Huang, Zenan, et al.
Pubblicazione: (2025)
Rubric-based On-policy Distillation
di: Fang, Junfeng, et al.
Pubblicazione: (2026)
di: Fang, Junfeng, et al.
Pubblicazione: (2026)
RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation
di: Dhole, Kaustubh D., et al.
Pubblicazione: (2026)
di: Dhole, Kaustubh D., et al.
Pubblicazione: (2026)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
di: Xie, Lipeng, et al.
Pubblicazione: (2025)
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Reinforcement Learning with Robust Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
di: Fan, Zhiting, et al.
Pubblicazione: (2026)
di: Fan, Zhiting, et al.
Pubblicazione: (2026)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
di: Li, Gaotang, et al.
Pubblicazione: (2026)
di: Li, Gaotang, et al.
Pubblicazione: (2026)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
di: Ding, Liang
Pubblicazione: (2026)
di: Ding, Liang
Pubblicazione: (2026)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
di: Wu, Peilin, et al.
Pubblicazione: (2026)
di: Wu, Peilin, et al.
Pubblicazione: (2026)
When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification
di: Zhao, Jiale, et al.
Pubblicazione: (2026)
di: Zhao, Jiale, et al.
Pubblicazione: (2026)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
di: Wang, Zhilin, et al.
Pubblicazione: (2025)
EssayCBM: Rubric-Aligned Concept Bottleneck Models for Transparent Essay Grading
di: Chaudhary, Kumar Satvik, et al.
Pubblicazione: (2025)
di: Chaudhary, Kumar Satvik, et al.
Pubblicazione: (2025)
Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics
di: Pathak, Aditya, et al.
Pubblicazione: (2025)
di: Pathak, Aditya, et al.
Pubblicazione: (2025)
LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation
di: Yan, Zhiling, et al.
Pubblicazione: (2026)
di: Yan, Zhiling, et al.
Pubblicazione: (2026)
Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement
di: Huynh, Jessica, et al.
Pubblicazione: (2026)
di: Huynh, Jessica, et al.
Pubblicazione: (2026)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
di: Liu, Xue, et al.
Pubblicazione: (2026)
di: Liu, Xue, et al.
Pubblicazione: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
Development of REGAI: Rubric Enabled Generative Artificial Intelligence
di: Johnson, Zach, et al.
Pubblicazione: (2024)
di: Johnson, Zach, et al.
Pubblicazione: (2024)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
Step-wise Rubric Rewards for LLM Reasoning
di: Xie, Weichu, et al.
Pubblicazione: (2026)
di: Xie, Weichu, et al.
Pubblicazione: (2026)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
di: Xu, Shanshan, et al.
Pubblicazione: (2026)
di: Xu, Shanshan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
di: Zhang, Qiyuan, et al.
Pubblicazione: (2026) -
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
di: Jia, Mengzhao, et al.
Pubblicazione: (2025) -
An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs
di: Ma, Linyue, et al.
Pubblicazione: (2025) -
Rubrics.
di: Callison, Daniel
Pubblicazione: (2000) -
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
di: Liu, Tianci, et al.
Pubblicazione: (2025)