SuiteEval: Simplifying Retrieval Benchmarks

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Parry, Andrew, Ganguly, Debasis, MacAvaney, Sean
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866908843452137472
author Parry, Andrew
Ganguly, Debasis
MacAvaney, Sean
author_facet Parry, Andrew
Ganguly, Debasis
MacAvaney, Sean
contents Information retrieval evaluation often suffers from fragmented practices -- varying dataset subsets, aggregation methods, and pipeline configurations -- that undermine reproducibility and comparability, especially for foundation embedding models requiring robust out-of-domain performance. We introduce SuiteEval, a unified framework that offers automatic end-to-end evaluation, dynamic indexing that reuses on-disk indices to minimise disk usage, and built-in support for major benchmarks (BEIR, LoTTE, MS MARCO, NanoBEIR, and BRIGHT). Users only need to supply a pipeline generator. SuiteEval handles data loading, indexing, ranking, metric computation, and result aggregation. New benchmark suites can be added in a single line. SuiteEval reduces boilerplate and standardises evaluations to facilitate reproducible IR research, as a broader benchmark set is increasingly required.
format Preprint
id arxiv_https___arxiv_org_abs_2602_18107
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle SuiteEval: Simplifying Retrieval Benchmarks
Parry, Andrew
Ganguly, Debasis
MacAvaney, Sean
Information Retrieval
Information retrieval evaluation often suffers from fragmented practices -- varying dataset subsets, aggregation methods, and pipeline configurations -- that undermine reproducibility and comparability, especially for foundation embedding models requiring robust out-of-domain performance. We introduce SuiteEval, a unified framework that offers automatic end-to-end evaluation, dynamic indexing that reuses on-disk indices to minimise disk usage, and built-in support for major benchmarks (BEIR, LoTTE, MS MARCO, NanoBEIR, and BRIGHT). Users only need to supply a pipeline generator. SuiteEval handles data loading, indexing, ranking, metric computation, and result aggregation. New benchmark suites can be added in a single line. SuiteEval reduces boilerplate and standardises evaluations to facilitate reproducible IR research, as a broader benchmark set is increasingly required.
title SuiteEval: Simplifying Retrieval Benchmarks
topic Information Retrieval
url https://arxiv.org/abs/2602.18107