MIRAGE-Bench: Automatic Multilingual Benchmark Arena for Retrieval-Augmented Generation Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Thakur, Nandan, Kazi, Suleman, Luo, Ge, Lin, Jimmy, Ahmad, Amin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Still Fresh? Evaluating Temporal Drift in Retrieval Benchmarks
par: Kuissi, Nathan, et autres
Publié: (2026)
par: Kuissi, Nathan, et autres
Publié: (2026)
MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation
par: Park, Chanhee, et autres
Publié: (2025)
par: Park, Chanhee, et autres
Publié: (2025)
Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval
par: Thakur, Nandan, et autres
Publié: (2023)
par: Thakur, Nandan, et autres
Publié: (2023)
FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents
par: Thakur, Nandan, et autres
Publié: (2025)
par: Thakur, Nandan, et autres
Publié: (2025)
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
par: Thakur, Nandan, et autres
Publié: (2025)
par: Thakur, Nandan, et autres
Publié: (2025)
Ragnarök: A Reusable RAG Framework and Baselines for TREC 2024 Retrieval-Augmented Generation Track
par: Pradeep, Ronak, et autres
Publié: (2024)
par: Pradeep, Ronak, et autres
Publié: (2024)
ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget
par: Thakur, Nandan, et autres
Publié: (2026)
par: Thakur, Nandan, et autres
Publié: (2026)
FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs
par: Bao, Forrest Sheng, et autres
Publié: (2024)
par: Bao, Forrest Sheng, et autres
Publié: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
par: Lim, Hyeonseok, et autres
Publié: (2024)
par: Lim, Hyeonseok, et autres
Publié: (2024)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
par: Tamber, Manveer Singh, et autres
Publié: (2025)
par: Tamber, Manveer Singh, et autres
Publié: (2025)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
par: Chen, Haotian, et autres
Publié: (2025)
par: Chen, Haotian, et autres
Publié: (2025)
MEMERAG: A Multilingual End-to-End Meta-Evaluation Benchmark for Retrieval Augmented Generation
par: Blandón, María Andrea Cruz, et autres
Publié: (2025)
par: Blandón, María Andrea Cruz, et autres
Publié: (2025)
RAGBench: Explainable Benchmark for Retrieval-Augmented Generation Systems
par: Friel, Robert, et autres
Publié: (2024)
par: Friel, Robert, et autres
Publié: (2024)
Multilingual Retrieval-Augmented Generation for Knowledge-Intensive Task
par: Ranaldi, Leonardo, et autres
Publié: (2025)
par: Ranaldi, Leonardo, et autres
Publié: (2025)
On the Consistency of Multilingual Context Utilization in Retrieval-Augmented Generation
par: Qi, Jirui, et autres
Publié: (2025)
par: Qi, Jirui, et autres
Publié: (2025)
Support Evaluation for the TREC 2024 RAG Track: Comparing Human versus LLM Judges
par: Thakur, Nandan, et autres
Publié: (2025)
par: Thakur, Nandan, et autres
Publié: (2025)
WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives
par: Yu, Yongan, et autres
Publié: (2025)
par: Yu, Yongan, et autres
Publié: (2025)
Benchmarking Retrieval-Augmented Generation for Medicine
par: Xiong, Guangzhi, et autres
Publié: (2024)
par: Xiong, Guangzhi, et autres
Publié: (2024)
A Survey on Retrieval-Augmented Text Generation for Large Language Models
par: Huang, Yizheng, et autres
Publié: (2024)
par: Huang, Yizheng, et autres
Publié: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
HoH: A Dynamic Benchmark for Evaluating the Impact of Outdated Information on Retrieval-Augmented Generation
par: Ouyang, Jie, et autres
Publié: (2025)
par: Ouyang, Jie, et autres
Publié: (2025)
Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning
par: Luo, Qi, et autres
Publié: (2025)
par: Luo, Qi, et autres
Publié: (2025)
AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation
par: Fu, Jia, et autres
Publié: (2024)
par: Fu, Jia, et autres
Publié: (2024)
MRAG: Benchmarking Retrieval-Augmented Generation for Bio-medicine
par: Li, Liz, et autres
Publié: (2026)
par: Li, Liz, et autres
Publié: (2026)
MTRAG: A Multi-Turn Conversational Benchmark for Evaluating Retrieval-Augmented Generation Systems
par: Katsis, Yannis, et autres
Publié: (2025)
par: Katsis, Yannis, et autres
Publié: (2025)
CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
par: Agarwal, Parth, et autres
Publié: (2025)
par: Agarwal, Parth, et autres
Publié: (2025)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
par: Li, Tianle, et autres
Publié: (2024)
par: Li, Tianle, et autres
Publié: (2024)
XRAG: eXamining the Core -- Benchmarking Foundational Components in Advanced Retrieval-Augmented Generation
par: Mao, Qianren, et autres
Publié: (2024)
par: Mao, Qianren, et autres
Publié: (2024)
Benchmarking Retrieval-Augmented Generation for Chemistry
par: Zhong, Xianrui, et autres
Publié: (2025)
par: Zhong, Xianrui, et autres
Publié: (2025)
Towards Cross-Cultural Machine Translation with Retrieval-Augmented Generation from Multilingual Knowledge Graphs
par: Conia, Simone, et autres
Publié: (2024)
par: Conia, Simone, et autres
Publié: (2024)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Retrieval-Augmented Generation Systems for Intellectual Property via Synthetic Multi-Angle Fine-tuning
par: Ren, Runtao, et autres
Publié: (2025)
par: Ren, Runtao, et autres
Publié: (2025)
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering
par: Han, Rujun, et autres
Publié: (2024)
par: Han, Rujun, et autres
Publié: (2024)
SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
par: Liu, Chaoqun, et autres
Publié: (2025)
par: Liu, Chaoqun, et autres
Publié: (2025)
ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering
par: Sultana, Nusrat, et autres
Publié: (2026)
par: Sultana, Nusrat, et autres
Publié: (2026)
Quantum-RAG and PunGPT2: Advancing Low-Resource Language Generation and Retrieval for the Punjabi Language
par: Singh, Jaskaranjeet, et autres
Publié: (2025)
par: Singh, Jaskaranjeet, et autres
Publié: (2025)
Towards Automated Smart Contract Generation: Evaluation, Benchmarking, and Retrieval-Augmented Repair
par: Chen, Zaoyu, et autres
Publié: (2025)
par: Chen, Zaoyu, et autres
Publié: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
par: Jing, Huihao, et autres
Publié: (2025)
par: Jing, Huihao, et autres
Publié: (2025)
Documents similaires
-
Still Fresh? Evaluating Temporal Drift in Retrieval Benchmarks
par: Kuissi, Nathan, et autres
Publié: (2026) -
MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation
par: Park, Chanhee, et autres
Publié: (2025) -
Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval
par: Thakur, Nandan, et autres
Publié: (2023) -
FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents
par: Thakur, Nandan, et autres
Publié: (2025) -
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
par: Thakur, Nandan, et autres
Publié: (2025)