Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pires, Ramon, Almeida, Thales Sales, Junior, Celio Larcher, Bonás, Giovana, Abonizio, Hugo, Piau, Marcos, Junior, Roseval Malaquias, Laitz, Thiago, Nogueira, Rodrigo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
par: Junior, Roseval Malaquias, et autres
Publié: (2026)
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
par: Almeida, Thales Sales, et autres
Publié: (2026)
par: Almeida, Thales Sales, et autres
Publié: (2026)
Sabiá-4 Technical Report
par: Laitz, Thiago, et autres
Publié: (2026)
par: Laitz, Thiago, et autres
Publié: (2026)
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
Sabiá-3 Technical Report
par: Abonizio, Hugo, et autres
Publié: (2024)
par: Abonizio, Hugo, et autres
Publié: (2024)
Automatic Legal Writing Evaluation of LLMs
par: Pires, Ramon, et autres
Publié: (2025)
par: Pires, Ramon, et autres
Publié: (2025)
Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
Juru: Legal Brazilian Large Language Model from Reputable Sources
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
Sabiá-2: A New Generation of Portuguese Large Language Models
par: Almeida, Thales Sales, et autres
Publié: (2024)
par: Almeida, Thales Sales, et autres
Publié: (2024)
TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
The interplay between domain specialization and model size
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
BRoverbs -- Measuring how much LLMs understand Portuguese proverbs
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning
par: Santos, João Guilherme Alves, et autres
Publié: (2025)
par: Santos, João Guilherme Alves, et autres
Publié: (2025)
Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
par: Abonizio, Hugo, et autres
Publié: (2025)
par: Abonizio, Hugo, et autres
Publié: (2025)
SurveySum: A Dataset for Summarizing Multiple Scientific Articles into a Survey Section
par: Fernandes, Leandro Carísio, et autres
Publié: (2024)
par: Fernandes, Leandro Carísio, et autres
Publié: (2024)
The Chronicles of RAG: The Retriever, the Chunk and the Generator
par: Finardi, Paulo, et autres
Publié: (2024)
par: Finardi, Paulo, et autres
Publié: (2024)
Explainable LightGBM Approach for Predicting Myocardial Infarction Mortality
par: Vicente, Ana Letícia Garcez, et autres
Publié: (2024)
par: Vicente, Ana Letícia Garcez, et autres
Publié: (2024)
ptt5-v2: A Closer Look at Continued Pretraining of T5 Models for the Portuguese Language
par: Piau, Marcos, et autres
Publié: (2024)
par: Piau, Marcos, et autres
Publié: (2024)
Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining
par: Almeida, Thales Sales, et autres
Publié: (2026)
par: Almeida, Thales Sales, et autres
Publié: (2026)
Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
InRanker: Distilled Rankers for Zero-shot Information Retrieval
par: Laitz, Thiago, et autres
Publié: (2024)
par: Laitz, Thiago, et autres
Publié: (2024)
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
par: Ferraretto, Fernando, et autres
Publié: (2024)
par: Ferraretto, Fernando, et autres
Publié: (2024)
LEITURA EM SALA DE AULA DE CIÊNCIAS COMO UMA PRÁTICA SOCIAL DIALÓGICA E PEDAGÓGICA
par: Célio da Silveira Júnior
Publié: (2015)
par: Célio da Silveira Júnior
Publié: (2015)
O ensino de ciências da vida e da natureza aos surdos: o que dizem importantes periódicos da área a respeito?
par: Célio da Silveira Júnior
Publié: (2021)
par: Célio da Silveira Júnior
Publié: (2021)
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
par: Abonizio, Hugo, et autres
Publié: (2026)
par: Abonizio, Hugo, et autres
Publié: (2026)
HIV/AIDS Stigma and Discrimination among Nurses in Suriname
par: Winston Roseval
Publié: (2007)
par: Winston Roseval
Publié: (2007)
Optische Magie
par: Gronemeyer, Nicole
Publié: (2020)
par: Gronemeyer, Nicole
Publié: (2020)
Origami‐Magie
par: Michael Groß
Publié: (2025)
par: Michael Groß
Publié: (2025)
Atitudes do Consumidor Frente ao Consumo de Marcas de Cosméticos
par: Célio Gomes de Lima Júnior
Publié: (2018)
par: Célio Gomes de Lima Júnior
Publié: (2018)
Measuring Cross-lingual Transfer in Bytes
par: de Souza, Leandro Rodrigues, et autres
Publié: (2024)
par: de Souza, Leandro Rodrigues, et autres
Publié: (2024)
Magistral
par: Mistral-AI, et autres
Publié: (2025)
par: Mistral-AI, et autres
Publié: (2025)
CONFLITOS À MESA: Vegetarianos, consumo e identidade
par: Juliana Abonizio
Publié: (2016)
par: Juliana Abonizio
Publié: (2016)
Por uma quiromancia da vida urbana
par: Juliana Abonizio
Publié: (2011)
par: Juliana Abonizio
Publié: (2011)
Consumo alimentar e anticonsumismo: veganos e freeganos
par: Juliana Abonizio
Publié: (2013)
par: Juliana Abonizio
Publié: (2013)
PROPOSIÇÃO DE INDICADORES PARA O CORPO DISCENTE E ANÁLISE DE AGRUPAMENTOS APLICADA AOS CURSOS DE GRADUAÇÃO DA UFES
par: Jaime Souza Sales Junior
Publié: (2013)
par: Jaime Souza Sales Junior
Publié: (2013)
Início da adoção das IFRS no Brasil: Os impactos provocados na relação entre o lucro e o fluxo de caixa operacional
par: Edgard Nogueira Junior
Publié: (2012)
par: Edgard Nogueira Junior
Publié: (2012)
Documents similaires
-
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
par: Bonás, Giovana Kerche, et autres
Publié: (2026) -
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
par: Junior, Roseval Malaquias, et autres
Publié: (2026) -
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
par: Almeida, Thales Sales, et autres
Publié: (2026) -
Sabiá-4 Technical Report
par: Laitz, Thiago, et autres
Publié: (2026) -
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
par: Nogueira, Rodrigo, et autres
Publié: (2026)