MLissard: Multilingual Long and Simple Sequential Reasoning Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Bueno, Mirelle, Lotufo, Roberto, Nogueira, Rodrigo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Lissard: Long and Simple Sequential Reasoning Datasets
di: Bueno, Mirelle, et al.
Pubblicazione: (2024)
di: Bueno, Mirelle, et al.
Pubblicazione: (2024)
ptt5-v2: A Closer Look at Continued Pretraining of T5 Models for the Portuguese Language
di: Piau, Marcos, et al.
Pubblicazione: (2024)
di: Piau, Marcos, et al.
Pubblicazione: (2024)
Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
di: Abonizio, Hugo, et al.
Pubblicazione: (2025)
di: Abonizio, Hugo, et al.
Pubblicazione: (2025)
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
di: Abonizio, Hugo, et al.
Pubblicazione: (2026)
di: Abonizio, Hugo, et al.
Pubblicazione: (2026)
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
di: Ferraretto, Fernando, et al.
Pubblicazione: (2024)
di: Ferraretto, Fernando, et al.
Pubblicazione: (2024)
Measuring Cross-lingual Transfer in Bytes
di: de Souza, Leandro Rodrigues, et al.
Pubblicazione: (2024)
di: de Souza, Leandro Rodrigues, et al.
Pubblicazione: (2024)
MMATH: A Multilingual Benchmark for Mathematical Reasoning
di: Luo, Wenyang, et al.
Pubblicazione: (2025)
di: Luo, Wenyang, et al.
Pubblicazione: (2025)
MARCA: A Checklist-Based Benchmark for Multilingual Web Search
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2026)
PublicHearingBR: A Brazilian Portuguese Dataset of Public Hearing Transcripts for Summarization of Long Documents
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
JUÁ -- A Benchmark for Information Retrieval in Brazilian Legal Text Collections
di: Pereira, Jayr, et al.
Pubblicazione: (2026)
di: Pereira, Jayr, et al.
Pubblicazione: (2026)
Check-Eval: A Checklist-based Approach for Evaluating Text Quality
di: Pereira, Jayr, et al.
Pubblicazione: (2024)
di: Pereira, Jayr, et al.
Pubblicazione: (2024)
SurveySum: A Dataset for Summarizing Multiple Scientific Articles into a Survey Section
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
di: Fernandes, Leandro Carísio, et al.
Pubblicazione: (2024)
Evaluating Multilingual Long-Context Models for Retrieval and Reasoning
di: Agrawal, Ameeta, et al.
Pubblicazione: (2024)
di: Agrawal, Ameeta, et al.
Pubblicazione: (2024)
MastermindEval: A Simple But Scalable Reasoning Benchmark
di: Golde, Jonas, et al.
Pubblicazione: (2025)
di: Golde, Jonas, et al.
Pubblicazione: (2025)
MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
di: Xu, Tianyi, et al.
Pubblicazione: (2026)
Quati: A Brazilian Portuguese Information Retrieval Dataset from Native Speakers
di: Bueno, Mirelle, et al.
Pubblicazione: (2024)
di: Bueno, Mirelle, et al.
Pubblicazione: (2024)
Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
di: Dobler, Konstantin, et al.
Pubblicazione: (2026)
TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities
di: Draetta, Lia, et al.
Pubblicazione: (2026)
di: Draetta, Lia, et al.
Pubblicazione: (2026)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
di: Ling, Zhan, et al.
Pubblicazione: (2025)
di: Ling, Zhan, et al.
Pubblicazione: (2025)
Self-Improving Multilingual Long Reasoning via Translation-Reasoning Integrated Training
di: Liu, Junxiao, et al.
Pubblicazione: (2026)
di: Liu, Junxiao, et al.
Pubblicazione: (2026)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
di: Bruun, Sofie Helene, et al.
Pubblicazione: (2025)
di: Bruun, Sofie Helene, et al.
Pubblicazione: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
di: Alonso, Iñigo, et al.
Pubblicazione: (2024)
di: Alonso, Iñigo, et al.
Pubblicazione: (2024)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
di: Ko, Donghyeon, et al.
Pubblicazione: (2025)
Multilingual Medical Reasoning for Question Answering with Large Language Models
di: Ferrazzi, Pietro, et al.
Pubblicazione: (2025)
di: Ferrazzi, Pietro, et al.
Pubblicazione: (2025)
Frustratingly Simple Retrieval Improves Challenging, Reasoning-Intensive Benchmarks
di: Lyu, Xinxi, et al.
Pubblicazione: (2025)
di: Lyu, Xinxi, et al.
Pubblicazione: (2025)
INACIA: Integrating Large Language Models in Brazilian Audit Courts: Opportunities and Challenges
di: Pereira, Jayr, et al.
Pubblicazione: (2024)
di: Pereira, Jayr, et al.
Pubblicazione: (2024)
MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning
di: Sobhani, Mahbub E, et al.
Pubblicazione: (2025)
di: Sobhani, Mahbub E, et al.
Pubblicazione: (2025)
Macaron: Controlled, Human-Written Benchmark for Multilingual and Multicultural Reasoning via Template-Filling
di: Elsetohy, Alaa, et al.
Pubblicazione: (2026)
di: Elsetohy, Alaa, et al.
Pubblicazione: (2026)
LangBridge: Multilingual Reasoning Without Multilingual Supervision
di: Yoon, Dongkeun, et al.
Pubblicazione: (2024)
di: Yoon, Dongkeun, et al.
Pubblicazione: (2024)
Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts
di: Yu, Yifei, et al.
Pubblicazione: (2025)
di: Yu, Yifei, et al.
Pubblicazione: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
Contamination Report for Multilingual Benchmarks
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
di: Ahuja, Sanchit, et al.
Pubblicazione: (2024)
MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
di: Fabbri, Alexander R., et al.
Pubblicazione: (2025)
di: Fabbri, Alexander R., et al.
Pubblicazione: (2025)
SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios
di: Zhan, Weidong, et al.
Pubblicazione: (2025)
di: Zhan, Weidong, et al.
Pubblicazione: (2025)
Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners
di: Liu, Yihong, et al.
Pubblicazione: (2026)
di: Liu, Yihong, et al.
Pubblicazione: (2026)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2024)
di: She, Shuaijie, et al.
Pubblicazione: (2024)
Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models
di: Lu, Hongyuan, et al.
Pubblicazione: (2024)
di: Lu, Hongyuan, et al.
Pubblicazione: (2024)
Found in Translation: Measuring Multilingual LLM Consistency as Simple as Translate then Evaluate
di: Gupta, Ashim, et al.
Pubblicazione: (2025)
di: Gupta, Ashim, et al.
Pubblicazione: (2025)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Retail-GPT: leveraging Retrieval Augmented Generation (RAG) for building E-commerce Chat Assistants
di: de Freitas, Bruno Amaral Teixeira, et al.
Pubblicazione: (2024)
di: de Freitas, Bruno Amaral Teixeira, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Lissard: Long and Simple Sequential Reasoning Datasets
di: Bueno, Mirelle, et al.
Pubblicazione: (2024) -
ptt5-v2: A Closer Look at Continued Pretraining of T5 Models for the Portuguese Language
di: Piau, Marcos, et al.
Pubblicazione: (2024) -
Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
di: Abonizio, Hugo, et al.
Pubblicazione: (2025) -
Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines
di: Abonizio, Hugo, et al.
Pubblicazione: (2026) -
ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs
di: Ferraretto, Fernando, et al.
Pubblicazione: (2024)