Automatic Legal Writing Evaluation of LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pires, Ramon, Junior, Roseval Malaquias, Nogueira, Rodrigo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Juru: Legal Brazilian Large Language Model from Reputable Sources
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
par: Pires, Ramon, et autres
Publié: (2026)
par: Pires, Ramon, et autres
Publié: (2026)
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
The interplay between domain specialization and model size
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
Sabiá-3 Technical Report
par: Abonizio, Hugo, et autres
Publié: (2024)
par: Abonizio, Hugo, et autres
Publié: (2024)
Sabiá-2: A New Generation of Portuguese Large Language Models
par: Almeida, Thales Sales, et autres
Publié: (2024)
par: Almeida, Thales Sales, et autres
Publié: (2024)
Evaluation Ethics of LLMs in Legal Domain
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
par: Luo, Kangcheng, et autres
Publié: (2025)
par: Luo, Kangcheng, et autres
Publié: (2025)
Automatic Evaluation of Healthcare LLMs Beyond Question-Answering
par: Arias-Duart, Anna, et autres
Publié: (2025)
par: Arias-Duart, Anna, et autres
Publié: (2025)
Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles
par: Truong, Kimberly Le, et autres
Publié: (2025)
par: Truong, Kimberly Le, et autres
Publié: (2025)
LLMs in Interpreting Legal Documents
par: Corbo, Simone
Publié: (2025)
par: Corbo, Simone
Publié: (2025)
How Reliable Are Automatic Evaluation Methods for Instruction-Tuned LLMs?
par: Doostmohammadi, Ehsan, et autres
Publié: (2024)
par: Doostmohammadi, Ehsan, et autres
Publié: (2024)
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
par: Almeida, Thales Sales, et autres
Publié: (2026)
par: Almeida, Thales Sales, et autres
Publié: (2026)
Sabiá-4 Technical Report
par: Laitz, Thiago, et autres
Publié: (2026)
par: Laitz, Thiago, et autres
Publié: (2026)
Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning
par: Juvekar, Kush, et autres
Publié: (2025)
par: Juvekar, Kush, et autres
Publié: (2025)
Using LLMs to Discover Legal Factors
par: Gray, Morgan, et autres
Publié: (2024)
par: Gray, Morgan, et autres
Publié: (2024)
IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions
par: Elmahjub, Ezieddin, et autres
Publié: (2026)
par: Elmahjub, Ezieddin, et autres
Publié: (2026)
Meow: End-to-End Outline Writing for Automatic Academic Survey
par: Ma, Zhaoyu, et autres
Publié: (2025)
par: Ma, Zhaoyu, et autres
Publié: (2025)
Ex3: Automatic Novel Writing by Extracting, Excelsior and Expanding
par: Huang, Lei, et autres
Publié: (2024)
par: Huang, Lei, et autres
Publié: (2024)
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
par: Wang, Wanying, et autres
Publié: (2024)
par: Wang, Wanying, et autres
Publié: (2024)
Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data
par: Khatri, Mann, et autres
Publié: (2025)
par: Khatri, Mann, et autres
Publié: (2025)
Exploring the psychology of LLMs' Moral and Legal Reasoning
par: Almeida, Guilherme F. C. F., et autres
Publié: (2023)
par: Almeida, Guilherme F. C. F., et autres
Publié: (2023)
KRAG Framework for Enhancing LLMs in the Legal Domain
par: Thanh, Nguyen Ha, et autres
Publié: (2024)
par: Thanh, Nguyen Ha, et autres
Publié: (2024)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
par: Lee, Jinu, et autres
Publié: (2025)
par: Lee, Jinu, et autres
Publié: (2025)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
Can LLMs Automate Fact-Checking Article Writing?
par: Sahnan, Dhruv, et autres
Publié: (2025)
par: Sahnan, Dhruv, et autres
Publié: (2025)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
Automatic Posology Structuration : What role for LLMs?
par: Bobkova, Natalia, et autres
Publié: (2025)
par: Bobkova, Natalia, et autres
Publié: (2025)
FlowMind: Automatic Workflow Generation with LLMs
par: Zeng, Zhen, et autres
Publié: (2024)
par: Zeng, Zhen, et autres
Publié: (2024)
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
par: Enguehard, Joseph, et autres
Publié: (2025)
par: Enguehard, Joseph, et autres
Publié: (2025)
LegalLens: Leveraging LLMs for Legal Violation Identification in Unstructured Text
par: Bernsohn, Dor, et autres
Publié: (2024)
par: Bernsohn, Dor, et autres
Publié: (2024)
On the Suitability of pre-trained foundational LLMs for Analysis in German Legal Education
par: Wendlinger, Lorenz, et autres
Publié: (2024)
par: Wendlinger, Lorenz, et autres
Publié: (2024)
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
par: Ferraretto, Fernando, et autres
Publié: (2024)
par: Ferraretto, Fernando, et autres
Publié: (2024)
From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation
par: Graus, David
Publié: (2026)
par: Graus, David
Publié: (2026)
Exploiting LLMs' Reasoning Capability to Infer Implicit Concepts in Legal Information Retrieval
par: Nguyen, Hai-Long, et autres
Publié: (2024)
par: Nguyen, Hai-Long, et autres
Publié: (2024)
An Automatic Question Usability Evaluation Toolkit
par: Moore, Steven, et autres
Publié: (2024)
par: Moore, Steven, et autres
Publié: (2024)
Plan-and-Write: Structure-Guided Length Control for LLMs without Model Retraining
par: Akinfaderin, Adewale, et autres
Publié: (2025)
par: Akinfaderin, Adewale, et autres
Publié: (2025)
Documents similaires
-
Juru: Legal Brazilian Large Language Model from Reputable Sources
par: Junior, Roseval Malaquias, et autres
Publié: (2024) -
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
par: Pires, Ramon, et autres
Publié: (2026) -
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026) -
The interplay between domain specialization and model size
par: Junior, Roseval Malaquias, et autres
Publié: (2025) -
Sabiá-3 Technical Report
par: Abonizio, Hugo, et autres
Publié: (2024)