Autorubric: Unifying Rubric-based LLM Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Delip, Callison-Burch, Chris |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
par: Liu, Muxin, et autres
Publié: (2026)
par: Liu, Muxin, et autres
Publié: (2026)
BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Overhearing LLM Agents: A Survey, Taxonomy, and Roadmap
par: Zhu, Andrew, et autres
Publié: (2025)
par: Zhu, Andrew, et autres
Publié: (2025)
NSF-SciFy: Mining the NSF Awards Database for Scientific Claims
par: Rao, Delip, et autres
Publié: (2025)
par: Rao, Delip, et autres
Publié: (2025)
First Steps Towards Overhearing LLM Agents: A Case Study With Dungeons & Dragons Gameplay
par: Zhu, Andrew, et autres
Publié: (2025)
par: Zhu, Andrew, et autres
Publié: (2025)
You Have Thirteen Hours in Which to Solve the Labyrinth: Enhancing AI Game Masters with Function Calling
par: Song, Jaewoo, et autres
Publié: (2024)
par: Song, Jaewoo, et autres
Publié: (2024)
WithdrarXiv: A Large-Scale Dataset for Retraction Study
par: Rao, Delip, et autres
Publié: (2024)
par: Rao, Delip, et autres
Publié: (2024)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
Probabilistic Soundness Guarantees in LLM Reasoning Chains
par: You, Weiqiu, et autres
Publié: (2025)
par: You, Weiqiu, et autres
Publié: (2025)
ParaGuide: Guided Diffusion Paraphrasers for Plug-and-Play Textual Style Transfer
par: Horvitz, Zachary, et autres
Publié: (2023)
par: Horvitz, Zachary, et autres
Publié: (2023)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
Evaluating Vision-Language Models on Bistable Images
par: Panagopoulou, Artemis, et autres
Publié: (2024)
par: Panagopoulou, Artemis, et autres
Publié: (2024)
ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training
par: Han, Feijiang, et autres
Publié: (2025)
par: Han, Feijiang, et autres
Publié: (2025)
LASER: An LLM-based ASR Scoring and Evaluation Rubric
par: Parulekar, Amruta, et autres
Publié: (2025)
par: Parulekar, Amruta, et autres
Publié: (2025)
Large Language Models Can Self-Improve At Web Agent Tasks
par: Patel, Ajay, et autres
Publié: (2024)
par: Patel, Ajay, et autres
Publié: (2024)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
par: Chen, Yinzhu, et autres
Publié: (2026)
par: Chen, Yinzhu, et autres
Publié: (2026)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
par: Liu, Xue, et autres
Publié: (2026)
par: Liu, Xue, et autres
Publié: (2026)
Concept Lancet: Image Editing with Compositional Representation Transplant
par: Luo, Jinqi, et autres
Publié: (2025)
par: Luo, Jinqi, et autres
Publié: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
par: Sharma, Manasi, et autres
Publié: (2025)
par: Sharma, Manasi, et autres
Publié: (2025)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
par: Hong, Yihan, et autres
Publié: (2026)
par: Hong, Yihan, et autres
Publié: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias
par: Kucia, Filip J., et autres
Publié: (2026)
par: Kucia, Filip J., et autres
Publié: (2026)
Self-Preference Bias in Rubric-Based Evaluation of Large Language Models
par: Pombal, José, et autres
Publié: (2026)
par: Pombal, José, et autres
Publié: (2026)
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
This Land is {Your, My} Land: Evaluating Geopolitical Biases in Language Models
par: Li, Bryan, et autres
Publié: (2023)
par: Li, Bryan, et autres
Publié: (2023)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes
par: Shah, Raj Sanjay, et autres
Publié: (2025)
par: Shah, Raj Sanjay, et autres
Publié: (2025)
Domain Gating Ensemble Networks for AI-Generated Text Detection
par: Tripathi, Arihant, et autres
Publié: (2025)
par: Tripathi, Arihant, et autres
Publié: (2025)
Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams
par: Tang, Xiuxiu, et autres
Publié: (2026)
par: Tang, Xiuxiu, et autres
Publié: (2026)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
par: Ding, Ruomeng, et autres
Publié: (2026)
par: Ding, Ruomeng, et autres
Publié: (2026)
DataDreamer: A Tool for Synthetic Data Generation and Reproducible LLM Workflows
par: Patel, Ajay, et autres
Publié: (2024)
par: Patel, Ajay, et autres
Publié: (2024)
PaCE: Parsimonious Concept Engineering for Large Language Models
par: Luo, Jinqi, et autres
Publié: (2024)
par: Luo, Jinqi, et autres
Publié: (2024)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
Configurable Preference Tuning with Rubric-Guided Synthetic Data
par: Gallego, Víctor
Publié: (2025)
par: Gallego, Víctor
Publié: (2025)
Documents similaires
-
ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models
par: Rao, Delip, et autres
Publié: (2026) -
Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why
par: Rao, Delip, et autres
Publié: (2026) -
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
par: Liu, Muxin, et autres
Publié: (2026) -
BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
par: Rao, Delip, et autres
Publié: (2026) -
What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis
par: Rao, Delip, et autres
Publié: (2026)