Generating Leakage-Free Benchmarks for Robust RAG Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiayi, Zhang, Jiaxing, Jin, Bowen, Neville, Jennifer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLMExplainer: Large Language Model based Bayesian Inference for Graph Explanation Generation
di: Zhang, Jiaxing, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxing, et al.
Pubblicazione: (2024)
CliqueParcel: An Approach For Batching LLM Prompts That Jointly Optimizes Efficiency And Faithfulness
di: Liu, Jiayi, et al.
Pubblicazione: (2024)
di: Liu, Jiayi, et al.
Pubblicazione: (2024)
LeakDojo: Decoding the Leakage Threats of RAG Systems
di: Zhang, Maosen, et al.
Pubblicazione: (2026)
di: Zhang, Maosen, et al.
Pubblicazione: (2026)
ContextRAG: Extraction-Free Hierarchical Graph Construction for Retrieval-Augmented Generation
di: Prosvirnin, Roman, et al.
Pubblicazione: (2026)
di: Prosvirnin, Roman, et al.
Pubblicazione: (2026)
EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations
di: Zhou, Xinyun, et al.
Pubblicazione: (2025)
di: Zhou, Xinyun, et al.
Pubblicazione: (2025)
Benchmarking Benchmark Leakage in Large Language Models
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
di: Xu, Ruijie, et al.
Pubblicazione: (2024)
GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluation
di: Sorodoc, Ionut-Teodor, et al.
Pubblicazione: (2025)
di: Sorodoc, Ionut-Teodor, et al.
Pubblicazione: (2025)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
di: Jin, Bowen, et al.
Pubblicazione: (2024)
di: Jin, Bowen, et al.
Pubblicazione: (2024)
GRADE: Generating multi-hop QA and fine-gRAined Difficulty matrix for RAG Evaluation
di: Lee, Jeongsoo, et al.
Pubblicazione: (2025)
di: Lee, Jeongsoo, et al.
Pubblicazione: (2025)
Know3-RAG: A Knowledge-aware RAG Framework with Adaptive Retrieval, Generation, and Filtering
di: Liu, Xukai, et al.
Pubblicazione: (2025)
di: Liu, Xukai, et al.
Pubblicazione: (2025)
SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG
di: Si, Xiaonan, et al.
Pubblicazione: (2025)
di: Si, Xiaonan, et al.
Pubblicazione: (2025)
LastingBench: Defend Benchmarks Against Knowledge Leakage
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
di: Fang, Yixiong, et al.
Pubblicazione: (2025)
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering
di: Han, Rujun, et al.
Pubblicazione: (2024)
di: Han, Rujun, et al.
Pubblicazione: (2024)
Towards Robust Universal Information Extraction: Benchmark, Evaluation, and Solution
di: Zhu, Jizhao, et al.
Pubblicazione: (2025)
di: Zhu, Jizhao, et al.
Pubblicazione: (2025)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
di: Zheng, Tianpeng, et al.
Pubblicazione: (2026)
di: Zheng, Tianpeng, et al.
Pubblicazione: (2026)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts
di: She, Yining, et al.
Pubblicazione: (2025)
di: She, Yining, et al.
Pubblicazione: (2025)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
di: Wu, Jiayi, et al.
Pubblicazione: (2024)
di: Wu, Jiayi, et al.
Pubblicazione: (2024)
First Token Probability Guided RAG for Telecom Question Answering
di: Chen, Tingwei, et al.
Pubblicazione: (2025)
di: Chen, Tingwei, et al.
Pubblicazione: (2025)
Social Bias Benchmark for Generation: A Comparison of Generation and QA-Based Evaluations
di: Jin, Jiho, et al.
Pubblicazione: (2025)
di: Jin, Jiho, et al.
Pubblicazione: (2025)
MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation
di: He, Junqing, et al.
Pubblicazione: (2024)
di: He, Junqing, et al.
Pubblicazione: (2024)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
di: Tamber, Manveer Singh, et al.
Pubblicazione: (2025)
di: Tamber, Manveer Singh, et al.
Pubblicazione: (2025)
On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
di: Lunardi, Riccardo, et al.
Pubblicazione: (2025)
di: Lunardi, Riccardo, et al.
Pubblicazione: (2025)
DHP Benchmark: Are LLMs Good NLG Evaluators?
di: Wang, Yicheng, et al.
Pubblicazione: (2024)
di: Wang, Yicheng, et al.
Pubblicazione: (2024)
MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
di: Lei, Yuzhen, et al.
Pubblicazione: (2025)
di: Lei, Yuzhen, et al.
Pubblicazione: (2025)
Symbolic Prompt Program Search: A Structure-Aware Approach to Efficient Compile-Time Prompt Optimization
di: Schnabel, Tobias, et al.
Pubblicazione: (2024)
di: Schnabel, Tobias, et al.
Pubblicazione: (2024)
Developing A Framework to Support Human Evaluation of Bias in Generated Free Response Text
di: Healey, Jennifer, et al.
Pubblicazione: (2025)
di: Healey, Jennifer, et al.
Pubblicazione: (2025)
Benchmarking Retrieval-Augmented Generation for Chemistry
di: Zhong, Xianrui, et al.
Pubblicazione: (2025)
di: Zhong, Xianrui, et al.
Pubblicazione: (2025)
LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs -- No Silver Bullet for LC or RAG Routing
di: Li, Kuan, et al.
Pubblicazione: (2025)
di: Li, Kuan, et al.
Pubblicazione: (2025)
Fine-grained Claim-level RAG Benchmark for Law
di: Das, Souvick, et al.
Pubblicazione: (2026)
di: Das, Souvick, et al.
Pubblicazione: (2026)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering
di: Zhang, Rongyang, et al.
Pubblicazione: (2025)
di: Zhang, Rongyang, et al.
Pubblicazione: (2025)
RAG+: Enhancing Retrieval-Augmented Generation with Application-Aware Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
di: Xiao, Yilin, et al.
Pubblicazione: (2025)
di: Xiao, Yilin, et al.
Pubblicazione: (2025)
Benchmarking Retrieval-Augmented Generation for Medicine
di: Xiong, Guangzhi, et al.
Pubblicazione: (2024)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2024)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
di: Xu, Yunqi, et al.
Pubblicazione: (2024)
di: Xu, Yunqi, et al.
Pubblicazione: (2024)
Benchmarking and Improving LLM Robustness for Personalized Generation
di: Okite, Chimaobi, et al.
Pubblicazione: (2025)
di: Okite, Chimaobi, et al.
Pubblicazione: (2025)
QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation
di: Fu, Weiping, et al.
Pubblicazione: (2024)
di: Fu, Weiping, et al.
Pubblicazione: (2024)
DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation
di: Chu, Rui, et al.
Pubblicazione: (2026)
di: Chu, Rui, et al.
Pubblicazione: (2026)
DuetRAG: Collaborative Retrieval-Augmented Generation
di: Jiao, Dian, et al.
Pubblicazione: (2024)
di: Jiao, Dian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLMExplainer: Large Language Model based Bayesian Inference for Graph Explanation Generation
di: Zhang, Jiaxing, et al.
Pubblicazione: (2024) -
CliqueParcel: An Approach For Batching LLM Prompts That Jointly Optimizes Efficiency And Faithfulness
di: Liu, Jiayi, et al.
Pubblicazione: (2024) -
LeakDojo: Decoding the Leakage Threats of RAG Systems
di: Zhang, Maosen, et al.
Pubblicazione: (2026) -
ContextRAG: Extraction-Free Hierarchical Graph Construction for Retrieval-Augmented Generation
di: Prosvirnin, Roman, et al.
Pubblicazione: (2026) -
EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations
di: Zhou, Xinyun, et al.
Pubblicazione: (2025)