Insider Knowledge: How Much Can RAG Systems Gain from Evaluation Secrets?
Fuente:
arXiv
Saved in:
| Main Authors: | Dietz, Laura, Li, Bryan, Yang, Eugene, Lawrie, Dawn, Walden, William, Mayfield, James |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Incorporating Q&A Nuggets into Retrieval-Augmented Generation
by: Dietz, Laura, et al.
Published: (2026)
by: Dietz, Laura, et al.
Published: (2026)
HLTCOE at TREC 2023 NeuCLIR Track
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
Distillation for Multilingual Information Retrieval
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation
by: Li, Bryan, et al.
Published: (2026)
by: Li, Bryan, et al.
Published: (2026)
HLTCOE at TREC 2024 NeuCLIR Track
by: Yang, Eugene, et al.
Published: (2025)
by: Yang, Eugene, et al.
Published: (2025)
Best in Tau@LLMJudge: Criteria-Based Relevance Evaluation with Llama3
by: Farzi, Naghmeh, et al.
Published: (2024)
by: Farzi, Naghmeh, et al.
Published: (2024)
Language Fairness in Multilingual Information Retrieval
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
LLM-based relevance assessment still can't replace human relevance assessment
by: Clarke, Charles L. A., et al.
Published: (2024)
by: Clarke, Charles L. A., et al.
Published: (2024)
RoutIR: Fast Serving of Retrieval Pipelines for Retrieval-Augmented Generation
by: Yang, Eugene, et al.
Published: (2026)
by: Yang, Eugene, et al.
Published: (2026)
LLM-Evaluation Tropes: Perspectives on the Validity of LLM-Evaluations
by: Dietz, Laura, et al.
Published: (2025)
by: Dietz, Laura, et al.
Published: (2025)
Supporting Humans in Evaluating AI Summaries of Legal Depositions
by: Farzi, Naghmeh, et al.
Published: (2026)
by: Farzi, Naghmeh, et al.
Published: (2026)
Extending Translate-Train for ColBERT-X to African Language CLIR
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
Does UMBRELA Work on Other LLMs?
by: Farzi, Naghmeh, et al.
Published: (2025)
by: Farzi, Naghmeh, et al.
Published: (2025)
Criteria-Based LLM Relevance Judgments
by: Farzi, Naghmeh, et al.
Published: (2025)
by: Farzi, Naghmeh, et al.
Published: (2025)
Auto-ARGUE: LLM-Based Report Generation Evaluation
by: Walden, William, et al.
Published: (2025)
by: Walden, William, et al.
Published: (2025)
Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage
by: Samuel, Saron, et al.
Published: (2026)
by: Samuel, Saron, et al.
Published: (2026)
Translate-Distill: Learning Cross-Language Dense Retrieval by Translation and Distillation
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
PLAID SHIRTTT for Large-Scale Streaming Dense Retrieval
by: Lawrie, Dawn, et al.
Published: (2024)
by: Lawrie, Dawn, et al.
Published: (2024)
Efficiency-Effectiveness Tradeoff of Probabilistic Structured Queries for Cross-Language Information Retrieval
by: Yang, Eugene, et al.
Published: (2024)
by: Yang, Eugene, et al.
Published: (2024)
HLTCOE at LiveRAG: GPT-Researcher using ColBERT retrieval
by: Duh, Kevin, et al.
Published: (2025)
by: Duh, Kevin, et al.
Published: (2025)
Beyond Similarity Search: A Unified Data Layer for Production RAG Systems
by: Budigi, Venkata Krishna Prasanth, et al.
Published: (2026)
by: Budigi, Venkata Krishna Prasanth, et al.
Published: (2026)
Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations
by: Lemdiasova, Ekaterina, et al.
Published: (2026)
by: Lemdiasova, Ekaterina, et al.
Published: (2026)
Overview of the TREC 2025 RAGTIME Track
by: Lawrie, Dawn, et al.
Published: (2026)
by: Lawrie, Dawn, et al.
Published: (2026)
PUB: An LLM-Enhanced Personality-Driven User Behaviour Simulator for Recommender System Evaluation
by: Ma, Chenglong, et al.
Published: (2025)
by: Ma, Chenglong, et al.
Published: (2025)
Can we predict QPP? An approach based on multivariate outliers
by: Chifu, Adrian-Gabriel, et al.
Published: (2024)
by: Chifu, Adrian-Gabriel, et al.
Published: (2024)
CreAgent: Towards Long-Term Evaluation of Recommender System under Platform-Creator Information Asymmetry
by: Ye, Xiaopeng, et al.
Published: (2025)
by: Ye, Xiaopeng, et al.
Published: (2025)
SIGIR 2025 -- LiveRAG Challenge Report
by: Carmel, David, et al.
Published: (2025)
by: Carmel, David, et al.
Published: (2025)
Multi-stage Large Language Model Pipelines Can Outperform GPT-4o in Relevance Assessment
by: Schnabel, Julian A., et al.
Published: (2025)
by: Schnabel, Julian A., et al.
Published: (2025)
A Systematic Framework for Enterprise Knowledge Retrieval: Leveraging LLM-Generated Metadata to Enhance RAG Systems
by: Mishra, Pranav Pushkar, et al.
Published: (2025)
by: Mishra, Pranav Pushkar, et al.
Published: (2025)
EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge
by: Sun, Yuhong, et al.
Published: (2026)
by: Sun, Yuhong, et al.
Published: (2026)
NeuCLIRTech: Chinese Monolingual and Cross-Language Information Retrieval Evaluation in a Challenging Domain
by: Lawrie, Dawn, et al.
Published: (2026)
by: Lawrie, Dawn, et al.
Published: (2026)
NeuCLIRBench: A Modern Evaluation Collection for Monolingual, Cross-Language, and Multilingual Information Retrieval
by: Lawrie, Dawn, et al.
Published: (2025)
by: Lawrie, Dawn, et al.
Published: (2025)
Unconstrained Monotonic Calibration of Predictions in Deep Ranking Systems
by: Bai, Yimeng, et al.
Published: (2025)
by: Bai, Yimeng, et al.
Published: (2025)
RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation
by: Dhole, Kaustubh D., et al.
Published: (2026)
by: Dhole, Kaustubh D., et al.
Published: (2026)
Overview of the TREC 2024 NeuCLIR Track
by: Lawrie, Dawn, et al.
Published: (2025)
by: Lawrie, Dawn, et al.
Published: (2025)
Overview of the TREC 2023 NeuCLIR Track
by: Lawrie, Dawn, et al.
Published: (2024)
by: Lawrie, Dawn, et al.
Published: (2024)
An Intrinsic Framework of Information Retrieval Evaluation Measures
by: Giner, Fernando
Published: (2023)
by: Giner, Fernando
Published: (2023)
Evaluating Contrastive Feedback for Effective User Simulations
by: Kruff, Andreas Konstantin, et al.
Published: (2025)
by: Kruff, Andreas Konstantin, et al.
Published: (2025)
From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents
by: Akarsu, Meftun, et al.
Published: (2026)
by: Akarsu, Meftun, et al.
Published: (2026)
Selective Query Processing: a Risk-Sensitive Selection of System Configurations
by: Mothe, Josiane, et al.
Published: (2023)
by: Mothe, Josiane, et al.
Published: (2023)
Similar Items
-
Incorporating Q&A Nuggets into Retrieval-Augmented Generation
by: Dietz, Laura, et al.
Published: (2026) -
HLTCOE at TREC 2023 NeuCLIR Track
by: Yang, Eugene, et al.
Published: (2024) -
Distillation for Multilingual Information Retrieval
by: Yang, Eugene, et al.
Published: (2024) -
DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation
by: Li, Bryan, et al.
Published: (2026) -
HLTCOE at TREC 2024 NeuCLIR Track
by: Yang, Eugene, et al.
Published: (2025)