LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Shanshan, Lindholm, Johan, Raina, Amogh, Olsen, Henrik Palmer, Hershcovich, Daniel |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes
von: Shah, Raj Sanjay, et al.
Veröffentlicht: (2025)
von: Shah, Raj Sanjay, et al.
Veröffentlicht: (2025)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
von: Lee, Jinu, et al.
Veröffentlicht: (2025)
von: Lee, Jinu, et al.
Veröffentlicht: (2025)
Towards Compositionally Generalizable Semantic Parsing in Large Language Models: A Survey
von: Mannekote, Amogh
Veröffentlicht: (2024)
von: Mannekote, Amogh
Veröffentlicht: (2024)
Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models
von: Yadav, Srishti, et al.
Veröffentlicht: (2025)
von: Yadav, Srishti, et al.
Veröffentlicht: (2025)
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
von: Yoo, Haneul, et al.
Veröffentlicht: (2024)
von: Yoo, Haneul, et al.
Veröffentlicht: (2024)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
von: Khatun, Aisha, et al.
Veröffentlicht: (2024)
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
von: Su, Weihang, et al.
Veröffentlicht: (2026)
von: Su, Weihang, et al.
Veröffentlicht: (2026)
EvalCards: A Framework for Standardized Evaluation Reporting
von: Dhar, Ruchira, et al.
Veröffentlicht: (2025)
von: Dhar, Ruchira, et al.
Veröffentlicht: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
von: Shi, Yuzhen, et al.
Veröffentlicht: (2026)
von: Shi, Yuzhen, et al.
Veröffentlicht: (2026)
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
von: Fan, Zhiting, et al.
Veröffentlicht: (2026)
von: Fan, Zhiting, et al.
Veröffentlicht: (2026)
VLQA: The First Comprehensive, Large, and High-Quality Vietnamese Dataset for Legal Question Answering
von: Nguyen, Tan-Minh, et al.
Veröffentlicht: (2025)
von: Nguyen, Tan-Minh, et al.
Veröffentlicht: (2025)
ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models
von: Hijazi, Faris, et al.
Veröffentlicht: (2024)
von: Hijazi, Faris, et al.
Veröffentlicht: (2024)
Making Task-Oriented Dialogue Datasets More Natural by Synthetically Generating Indirect User Requests
von: Mannekote, Amogh, et al.
Veröffentlicht: (2024)
von: Mannekote, Amogh, et al.
Veröffentlicht: (2024)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
von: Xu, Tianze, et al.
Veröffentlicht: (2026)
von: Xu, Tianze, et al.
Veröffentlicht: (2026)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
von: Ding, Liang
Veröffentlicht: (2026)
von: Ding, Liang
Veröffentlicht: (2026)
LegalCore: A Dataset for Event Coreference Resolution in Legal Documents
von: Wei, Kangda, et al.
Veröffentlicht: (2025)
von: Wei, Kangda, et al.
Veröffentlicht: (2025)
An Efficient Rubric-based Generative Verifier for Search-Augmented LLMs
von: Ma, Linyue, et al.
Veröffentlicht: (2025)
von: Ma, Linyue, et al.
Veröffentlicht: (2025)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
von: Sanders, Kate, et al.
Veröffentlicht: (2026)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2025)
von: Pokharel, Rhitabrat, et al.
Veröffentlicht: (2025)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
von: Liu, Xue, et al.
Veröffentlicht: (2026)
von: Liu, Xue, et al.
Veröffentlicht: (2026)
ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation
von: Zhou, Siying, et al.
Veröffentlicht: (2025)
von: Zhou, Siying, et al.
Veröffentlicht: (2025)
Check-Eval: A Checklist-based Approach for Evaluating Text Quality
von: Pereira, Jayr, et al.
Veröffentlicht: (2024)
von: Pereira, Jayr, et al.
Veröffentlicht: (2024)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
von: Zhao, Jiahao, et al.
Veröffentlicht: (2025)
EUROPA: A Legal Multilingual Keyphrase Generation Dataset
von: Salaün, Olivier, et al.
Veröffentlicht: (2024)
von: Salaün, Olivier, et al.
Veröffentlicht: (2024)
Question Difficulty Ranking for Multiple-Choice Reading Comprehension
von: Raina, Vatsal, et al.
Veröffentlicht: (2024)
von: Raina, Vatsal, et al.
Veröffentlicht: (2024)
Measuring all the noises of LLM Evals
von: Wang, Sida
Veröffentlicht: (2025)
von: Wang, Sida
Veröffentlicht: (2025)
Autorubric: Unifying Rubric-based LLM Evaluation
von: Rao, Delip, et al.
Veröffentlicht: (2026)
von: Rao, Delip, et al.
Veröffentlicht: (2026)
PatentEval: Understanding Errors in Patent Generation
von: Zuo, You, et al.
Veröffentlicht: (2024)
von: Zuo, You, et al.
Veröffentlicht: (2024)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
von: Zhao, Jingqian, et al.
Veröffentlicht: (2025)
von: Zhao, Jingqian, et al.
Veröffentlicht: (2025)
Reinforcement Learning with Rubric Anchors
von: Huang, Zenan, et al.
Veröffentlicht: (2025)
von: Huang, Zenan, et al.
Veröffentlicht: (2025)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
von: Huang, Zhongzhan, et al.
Veröffentlicht: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
von: Sharma, Manasi, et al.
Veröffentlicht: (2025)
von: Sharma, Manasi, et al.
Veröffentlicht: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
von: Chen, Yinzhu, et al.
Veröffentlicht: (2026)
von: Chen, Yinzhu, et al.
Veröffentlicht: (2026)
Configurable Preference Tuning with Rubric-Guided Synthetic Data
von: Gallego, Víctor
Veröffentlicht: (2025)
von: Gallego, Víctor
Veröffentlicht: (2025)
LP-LM: No Hallucinations in Question Answering with Logic Programming
von: Wu, Katherine, et al.
Veröffentlicht: (2025)
von: Wu, Katherine, et al.
Veröffentlicht: (2025)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
von: Garg, Madhav Krishan, et al.
Veröffentlicht: (2025)
von: Garg, Madhav Krishan, et al.
Veröffentlicht: (2025)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
von: Wu, Peilin, et al.
Veröffentlicht: (2026)
von: Wu, Peilin, et al.
Veröffentlicht: (2026)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
von: Chu, Yucheng, et al.
Veröffentlicht: (2026)
von: Chu, Yucheng, et al.
Veröffentlicht: (2026)
NLP at UC Santa Cruz at SemEval-2024 Task 5: Legal Answer Validation using Few-Shot Multi-Choice QA
von: Pahilajani, Anish, et al.
Veröffentlicht: (2024)
von: Pahilajani, Anish, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TN-Eval: Rubric and Evaluation Protocols for Measuring the Quality of Behavioral Therapy Notes
von: Shah, Raj Sanjay, et al.
Veröffentlicht: (2025) -
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
von: Lee, Jinu, et al.
Veröffentlicht: (2025) -
Towards Compositionally Generalizable Semantic Parsing in Large Language Models: A Survey
von: Mannekote, Amogh
Veröffentlicht: (2024) -
Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models
von: Yadav, Srishti, et al.
Veröffentlicht: (2025) -
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
von: Yoo, Haneul, et al.
Veröffentlicht: (2024)