Diagnosing Translated Benchmarks: An Automated Quality Assurance Study of the EU20 Benchmark Suite
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thellmann, Klaudia, Stadler, Bernhard, Färber, Michael |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
par: Thellmann, Klaudia-Doris, et autres
Publié: (2026)
par: Thellmann, Klaudia-Doris, et autres
Publié: (2026)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
par: Cui, Tianyu, et autres
Publié: (2024)
par: Cui, Tianyu, et autres
Publié: (2024)
A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection
par: Hasan, Khalid, et autres
Publié: (2026)
par: Hasan, Khalid, et autres
Publié: (2026)
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
par: Chen, Jianlyu, et autres
Publié: (2024)
par: Chen, Jianlyu, et autres
Publié: (2024)
Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference
par: Kummer, Cornelius, et autres
Publié: (2026)
par: Kummer, Cornelius, et autres
Publié: (2026)
SQuAI: Scientific Question-Answering with Multi-Agent Retrieval-Augmented Generation
par: Besrour, Ines, et autres
Publié: (2025)
par: Besrour, Ines, et autres
Publié: (2025)
HyperPIE: Hyperparameter Information Extraction from Scientific Publications
par: Saier, Tarek, et autres
Publié: (2023)
par: Saier, Tarek, et autres
Publié: (2023)
Revisiting Projection-based Data Transfer for Cross-Lingual Named Entity Recognition in Low-Resource Languages
par: Politov, Andrei, et autres
Publié: (2025)
par: Politov, Andrei, et autres
Publié: (2025)
Frustratingly Simple Retrieval Improves Challenging, Reasoning-Intensive Benchmarks
par: Lyu, Xinxi, et autres
Publié: (2025)
par: Lyu, Xinxi, et autres
Publié: (2025)
The Effects of Hallucinations in Synthetic Training Data for Relation Extraction
par: Rogulsky, Steven, et autres
Publié: (2024)
par: Rogulsky, Steven, et autres
Publié: (2024)
RAR-b: Reasoning as Retrieval Benchmark
par: Xiao, Chenghao, et autres
Publié: (2024)
par: Xiao, Chenghao, et autres
Publié: (2024)
Benchmarking LLM-based Relevance Judgment Methods
par: Arabzadeh, Negar, et autres
Publié: (2025)
par: Arabzadeh, Negar, et autres
Publié: (2025)
Paths to Causality: Finding Informative Subgraphs Within Knowledge Graphs for Knowledge-Based Causal Discovery
par: Susanti, Yuni, et autres
Publié: (2025)
par: Susanti, Yuni, et autres
Publié: (2025)
JFinTEB: Japanese Financial Text Embedding Benchmark
par: Suzuki, Masahiro, et autres
Publié: (2026)
par: Suzuki, Masahiro, et autres
Publié: (2026)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
par: Hu, Tiansheng, et autres
Publié: (2026)
par: Hu, Tiansheng, et autres
Publié: (2026)
ScholarSearch: Benchmarking Scholar Searching Ability of LLMs
par: Zhou, Junting, et autres
Publié: (2025)
par: Zhou, Junting, et autres
Publié: (2025)
Building Russian Benchmark for Evaluation of Information Retrieval Models
par: Kovalev, Grigory, et autres
Publié: (2025)
par: Kovalev, Grigory, et autres
Publié: (2025)
FinMTEB: Finance Massive Text Embedding Benchmark
par: Tang, Yixuan, et autres
Publié: (2025)
par: Tang, Yixuan, et autres
Publié: (2025)
DAPR: A Benchmark on Document-Aware Passage Retrieval
par: Wang, Kexin, et autres
Publié: (2023)
par: Wang, Kexin, et autres
Publié: (2023)
BERGEN: A Benchmarking Library for Retrieval-Augmented Generation
par: Rau, David, et autres
Publié: (2024)
par: Rau, David, et autres
Publié: (2024)
Optimizing Small Transformer-Based Language Models for Multi-Label Sentiment Analysis in Short Texts
par: Neumann, Julius, et autres
Publié: (2025)
par: Neumann, Julius, et autres
Publié: (2025)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
par: Jin, Rihui, et autres
Publié: (2026)
par: Jin, Rihui, et autres
Publié: (2026)
PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian
par: Mozafari, Jamshid, et autres
Publié: (2026)
par: Mozafari, Jamshid, et autres
Publié: (2026)
TabEmbed: Benchmarking and Learning Generalist Embeddings for Tabular Understanding
par: Qiang, Minjie, et autres
Publié: (2026)
par: Qiang, Minjie, et autres
Publié: (2026)
PJB: A Reasoning-Aware Benchmark for Person-Job Retrieval
par: Wang, Guangzhi, et autres
Publié: (2026)
par: Wang, Guangzhi, et autres
Publié: (2026)
PosIR: Position-Aware Heterogeneous Information Retrieval Benchmark
par: Zeng, Ziyang, et autres
Publié: (2026)
par: Zeng, Ziyang, et autres
Publié: (2026)
exHarmony: Authorship and Citations for Benchmarking the Reviewer Assignment Problem
par: Ebrahimi, Sajad, et autres
Publié: (2025)
par: Ebrahimi, Sajad, et autres
Publié: (2025)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
par: Hu, Caiyu, et autres
Publié: (2025)
par: Hu, Caiyu, et autres
Publié: (2025)
Hindi-BEIR : A Large Scale Retrieval Benchmark in Hindi
par: Acharya, Arkadeep, et autres
Publié: (2024)
par: Acharya, Arkadeep, et autres
Publié: (2024)
ORBIT -- Open Recommendation Benchmark for Reproducible Research with Hidden Tests
par: He, Jingyuan, et autres
Publié: (2025)
par: He, Jingyuan, et autres
Publié: (2025)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
par: Cheng, Yiruo, et autres
Publié: (2024)
par: Cheng, Yiruo, et autres
Publié: (2024)
FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing
par: Qian, Jingbin, et autres
Publié: (2026)
par: Qian, Jingbin, et autres
Publié: (2026)
JUÁ -- A Benchmark for Information Retrieval in Brazilian Legal Text Collections
par: Pereira, Jayr, et autres
Publié: (2026)
par: Pereira, Jayr, et autres
Publié: (2026)
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
par: Wang, Shu, et autres
Publié: (2026)
par: Wang, Shu, et autres
Publié: (2026)
Wikipedia-based Datasets in Russian Information Retrieval Benchmark RusBEIR
par: Kovalev, Grigory, et autres
Publié: (2025)
par: Kovalev, Grigory, et autres
Publié: (2025)
Generating Diverse Q&A Benchmarks for RAG Evaluation with DataMorgana
par: Filice, Simone, et autres
Publié: (2025)
par: Filice, Simone, et autres
Publié: (2025)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
par: Du, Mingxuan, et autres
Publié: (2025)
par: Du, Mingxuan, et autres
Publié: (2025)
RankMamba: Benchmarking Mamba's Document Ranking Performance in the Era of Transformers
par: Xu, Zhichao
Publié: (2024)
par: Xu, Zhichao
Publié: (2024)
CoIR: A Comprehensive Benchmark for Code Information Retrieval Models
par: Li, Xiangyang, et autres
Publié: (2024)
par: Li, Xiangyang, et autres
Publié: (2024)
Diagnosing and Repairing Citation Failures in Generative Engine Optimization
par: Tian, Zhihua, et autres
Publié: (2026)
par: Tian, Zhihua, et autres
Publié: (2026)
Documents similaires
-
Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
par: Thellmann, Klaudia-Doris, et autres
Publié: (2026) -
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
par: Cui, Tianyu, et autres
Publié: (2024) -
A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection
par: Hasan, Khalid, et autres
Publié: (2026) -
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
par: Chen, Jianlyu, et autres
Publié: (2024) -
Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference
par: Kummer, Cornelius, et autres
Publié: (2026)