Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Junior, Roseval Malaquias, Bonás, Giovana Kerche, Almeida, Thales Sales, Abonizio, Hugo, Laitz, Thiago, Pires, Ramon, Piau, Marcos, Larcher, Celio, Nogueira, Rodrigo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
par: Bonás, Giovana Kerche, et autres
Publié: (2026)
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
par: Almeida, Thales Sales, et autres
Publié: (2026)
par: Almeida, Thales Sales, et autres
Publié: (2026)
Sabiá-4 Technical Report
par: Laitz, Thiago, et autres
Publié: (2026)
par: Laitz, Thiago, et autres
Publié: (2026)
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
par: Nogueira, Rodrigo, et autres
Publié: (2026)
par: Nogueira, Rodrigo, et autres
Publié: (2026)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
par: Pires, Ramon, et autres
Publié: (2026)
par: Pires, Ramon, et autres
Publié: (2026)
Sabiá-3 Technical Report
par: Abonizio, Hugo, et autres
Publié: (2024)
par: Abonizio, Hugo, et autres
Publié: (2024)
Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
BRoverbs -- Measuring how much LLMs understand Portuguese proverbs
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
Sabiá-2: A New Generation of Portuguese Large Language Models
par: Almeida, Thales Sales, et autres
Publié: (2024)
par: Almeida, Thales Sales, et autres
Publié: (2024)
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
Juru: Legal Brazilian Large Language Model from Reputable Sources
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
par: Junior, Roseval Malaquias, et autres
Publié: (2024)
Automatic Legal Writing Evaluation of LLMs
par: Pires, Ramon, et autres
Publié: (2025)
par: Pires, Ramon, et autres
Publié: (2025)
BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning
par: Santos, João Guilherme Alves, et autres
Publié: (2025)
par: Santos, João Guilherme Alves, et autres
Publié: (2025)
The interplay between domain specialization and model size
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
par: Junior, Roseval Malaquias, et autres
Publié: (2025)
ptt5-v2: A Closer Look at Continued Pretraining of T5 Models for the Portuguese Language
par: Piau, Marcos, et autres
Publié: (2024)
par: Piau, Marcos, et autres
Publié: (2024)
Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
par: Abonizio, Hugo, et autres
Publié: (2025)
par: Abonizio, Hugo, et autres
Publié: (2025)
Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining
par: Almeida, Thales Sales, et autres
Publié: (2026)
par: Almeida, Thales Sales, et autres
Publié: (2026)
Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
The Chronicles of RAG: The Retriever, the Chunk and the Generator
par: Finardi, Paulo, et autres
Publié: (2024)
par: Finardi, Paulo, et autres
Publié: (2024)
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
par: Abonizio, Hugo, et autres
Publié: (2026)
par: Abonizio, Hugo, et autres
Publié: (2026)
SurveySum: A Dataset for Summarizing Multiple Scientific Articles into a Survey Section
par: Fernandes, Leandro Carísio, et autres
Publié: (2024)
par: Fernandes, Leandro Carísio, et autres
Publié: (2024)
InRanker: Distilled Rankers for Zero-shot Information Retrieval
par: Laitz, Thiago, et autres
Publié: (2024)
par: Laitz, Thiago, et autres
Publié: (2024)
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
par: Ferraretto, Fernando, et autres
Publié: (2024)
par: Ferraretto, Fernando, et autres
Publié: (2024)
Explainable LightGBM Approach for Predicting Myocardial Infarction Mortality
par: Vicente, Ana Letícia Garcez, et autres
Publié: (2024)
par: Vicente, Ana Letícia Garcez, et autres
Publié: (2024)
Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining
par: Almeida, Thales Sales, et autres
Publié: (2025)
par: Almeida, Thales Sales, et autres
Publié: (2025)
HIV/AIDS Stigma and Discrimination among Nurses in Suriname
par: Winston Roseval
Publié: (2007)
par: Winston Roseval
Publié: (2007)
The Brazilian Federal Public Prosecutor's Office: from Defender of Rights to Anticorruption Fighter (1988-2018)
par: Kerche, Fabio, et autres
Publié: (2023)
par: Kerche, Fabio, et autres
Publié: (2023)
Prosa
Publié: (2021)
Publié: (2021)
CONFLITOS À MESA: Vegetarianos, consumo e identidade
par: Juliana Abonizio
Publié: (2016)
par: Juliana Abonizio
Publié: (2016)
Por uma quiromancia da vida urbana
par: Juliana Abonizio
Publié: (2011)
par: Juliana Abonizio
Publié: (2011)
Consumo alimentar e anticonsumismo: veganos e freeganos
par: Juliana Abonizio
Publié: (2013)
par: Juliana Abonizio
Publié: (2013)
INDEPENDÊNCIA, PODER JUDICIÁRIO E MINISTÉRIO PÚBLICO
par: Fábio Kerche
Publié: (2018)
par: Fábio Kerche
Publié: (2018)
MINISTÉRIO PÚBLICO, LAVA JATO E MÃOS LIMPAS: UMA ABORDAGEM INSTITUCIONAL
par: Fábio Kerche
Publié: (2018)
par: Fábio Kerche
Publié: (2018)
Os Conselhos Nacionais de Justiça e do Ministério Público no Brasil: instrumentos de accountability?
par: Fábio Kerche
Publié: (2020)
par: Fábio Kerche
Publié: (2020)
Autonomia e Discricionariedade do Ministério Público no Brasil
par: Fábio Kerche
Publié: (2007)
par: Fábio Kerche
Publié: (2007)
Predictive Authoring for Brazilian Portuguese Augmentative and Alternative Communication
par: Pereira, Jayr, et autres
Publié: (2023)
par: Pereira, Jayr, et autres
Publié: (2023)
So, Morphological Awareness Contributes to Reading in Brazilian Portuguese?
par: Pedro Viana de Freitas Junior
Publié: (2015)
par: Pedro Viana de Freitas Junior
Publié: (2015)
DE SEM-TERRA A SEM-TERRA: MEMÓRIAS E IDENTIDADES
par: Natália Kerche Alvaides
Publié: (2013)
par: Natália Kerche Alvaides
Publié: (2013)
Documents similaires
-
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
par: Bonás, Giovana Kerche, et autres
Publié: (2026) -
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
par: Almeida, Thales Sales, et autres
Publié: (2026) -
Sabiá-4 Technical Report
par: Laitz, Thiago, et autres
Publié: (2026) -
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
par: Nogueira, Rodrigo, et autres
Publié: (2026) -
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
par: Nogueira, Rodrigo, et autres
Publié: (2026)