MARCA: A Checklist-Based Benchmark for Multilingual Web Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Almeida, Thales Sales, Bonás, Giovana Kerche, Pires, Ramon, Larcher, Celio, Abonizio, Hugo, Piau, Marcos, Junior, Roseval Malaquias, Nogueira, Rodrigo, Laitz, Thiago |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
di: Bonás, Giovana Kerche, et al.
Pubblicazione: (2026)
di: Bonás, Giovana Kerche, et al.
Pubblicazione: (2026)
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2026)
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2026)
Sabiá-4 Technical Report
di: Laitz, Thiago, et al.
Pubblicazione: (2026)
di: Laitz, Thiago, et al.
Pubblicazione: (2026)
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026)
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026)
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026)
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
di: Pires, Ramon, et al.
Pubblicazione: (2026)
di: Pires, Ramon, et al.
Pubblicazione: (2026)
Sabiá-3 Technical Report
di: Abonizio, Hugo, et al.
Pubblicazione: (2024)
di: Abonizio, Hugo, et al.
Pubblicazione: (2024)
Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
BRoverbs -- Measuring how much LLMs understand Portuguese proverbs
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning
di: Santos, João Guilherme Alves, et al.
Pubblicazione: (2025)
di: Santos, João Guilherme Alves, et al.
Pubblicazione: (2025)
Sabiá-2: A New Generation of Portuguese Large Language Models
di: Almeida, Thales Sales, et al.
Pubblicazione: (2024)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2024)
Automatic Legal Writing Evaluation of LLMs
di: Pires, Ramon, et al.
Pubblicazione: (2025)
di: Pires, Ramon, et al.
Pubblicazione: (2025)
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
The interplay between domain specialization and model size
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2025)
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2025)
Juru: Legal Brazilian Large Language Model from Reputable Sources
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2024)
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2024)
Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
di: Abonizio, Hugo, et al.
Pubblicazione: (2025)
di: Abonizio, Hugo, et al.
Pubblicazione: (2025)
SurveySum: A Dataset for Summarizing Multiple Scientific Articles into a Survey Section
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
The Chronicles of RAG: The Retriever, the Chunk and the Generator
di: Finardi, Paulo, et al.
Pubblicazione: (2024)
di: Finardi, Paulo, et al.
Pubblicazione: (2024)
ptt5-v2: A Closer Look at Continued Pretraining of T5 Models for the Portuguese Language
di: Piau, Marcos, et al.
Pubblicazione: (2024)
di: Piau, Marcos, et al.
Pubblicazione: (2024)
Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
InRanker: Distilled Rankers for Zero-shot Information Retrieval
di: Laitz, Thiago, et al.
Pubblicazione: (2024)
di: Laitz, Thiago, et al.
Pubblicazione: (2024)
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
di: Ferraretto, Fernando, et al.
Pubblicazione: (2024)
di: Ferraretto, Fernando, et al.
Pubblicazione: (2024)
Explainable LightGBM Approach for Predicting Myocardial Infarction Mortality
di: Vicente, Ana Letícia Garcez, et al.
Pubblicazione: (2024)
di: Vicente, Ana Letícia Garcez, et al.
Pubblicazione: (2024)
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
di: Abonizio, Hugo, et al.
Pubblicazione: (2026)
di: Abonizio, Hugo, et al.
Pubblicazione: (2026)
HIV/AIDS Stigma and Discrimination among Nurses in Suriname
di: Winston Roseval
Pubblicazione: (2007)
di: Winston Roseval
Pubblicazione: (2007)
Measuring Cross-lingual Transfer in Bytes
di: de Souza, Leandro Rodrigues, et al.
Pubblicazione: (2024)
di: de Souza, Leandro Rodrigues, et al.
Pubblicazione: (2024)
CONFLITOS À MESA: Vegetarianos, consumo e identidade
di: Juliana Abonizio
Pubblicazione: (2016)
di: Juliana Abonizio
Pubblicazione: (2016)
Por uma quiromancia da vida urbana
di: Juliana Abonizio
Pubblicazione: (2011)
di: Juliana Abonizio
Pubblicazione: (2011)
Consumo alimentar e anticonsumismo: veganos e freeganos
di: Juliana Abonizio
Pubblicazione: (2013)
di: Juliana Abonizio
Pubblicazione: (2013)
INDEPENDÊNCIA, PODER JUDICIÁRIO E MINISTÉRIO PÚBLICO
di: Fábio Kerche
Pubblicazione: (2018)
di: Fábio Kerche
Pubblicazione: (2018)
MINISTÉRIO PÚBLICO, LAVA JATO E MÃOS LIMPAS: UMA ABORDAGEM INSTITUCIONAL
di: Fábio Kerche
Pubblicazione: (2018)
di: Fábio Kerche
Pubblicazione: (2018)
Os Conselhos Nacionais de Justiça e do Ministério Público no Brasil: instrumentos de accountability?
di: Fábio Kerche
Pubblicazione: (2020)
di: Fábio Kerche
Pubblicazione: (2020)
Autonomia e Discricionariedade do Ministério Público no Brasil
di: Fábio Kerche
Pubblicazione: (2007)
di: Fábio Kerche
Pubblicazione: (2007)
DE SEM-TERRA A SEM-TERRA: MEMÓRIAS E IDENTIDADES
di: Natália Kerche Alvaides
Pubblicazione: (2013)
di: Natália Kerche Alvaides
Pubblicazione: (2013)
Desenvolvimento, gestão e cooperação internacional: um estudo do projeto de desenvolvimento comunitário da bacia do Rio Gavião no sudoeste da Bahia
di: Weslei Gusmão Piau Santana
Pubblicazione: (2013)
di: Weslei Gusmão Piau Santana
Pubblicazione: (2013)
Checklist Engineering Empowers Multilingual LLM Judges
di: Mohammadkhani, Mohammad Ghiasvand, et al.
Pubblicazione: (2025)
di: Mohammadkhani, Mohammad Ghiasvand, et al.
Pubblicazione: (2025)
Estudo do uso de plantas medicinais pela comunidade quilombola Senhor do Bonfim - Areia-PB
di: Giovana Patrícia dos Santos Sales
Pubblicazione: (2009)
di: Giovana Patrícia dos Santos Sales
Pubblicazione: (2009)
Documenti analoghi
-
CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
di: Bonás, Giovana Kerche, et al.
Pubblicazione: (2026) -
Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese
di: Junior, Roseval Malaquias, et al.
Pubblicazione: (2026) -
Sabiá-4 Technical Report
di: Laitz, Thiago, et al.
Pubblicazione: (2026) -
Measuring Opinion Bias and Sycophancy via LLM-based Persuasion
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026) -
LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs
di: Nogueira, Rodrigo, et al.
Pubblicazione: (2026)