Overcoming the "Impracticality" of RAG: Proposing a Real-World Benchmark and Multi-Dimensional Diagnostic Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Narita, Kenichirou, Peng, Siqi, Fukui, Taku, Yamada, Moyuru, Munakata, Satoshi, Takahashi, Satoru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Multiple-Fill-in-the-Blank Exam Approach for Enhancing Zero-Resource Hallucination Detection in Large Language Models
di: Munakata, Satoshi, et al.
Pubblicazione: (2024)
di: Munakata, Satoshi, et al.
Pubblicazione: (2024)
BRIT: Bidirectional Retrieval over Unified Image-Text Graph
di: Khan, Ainulla, et al.
Pubblicazione: (2025)
di: Khan, Ainulla, et al.
Pubblicazione: (2025)
The Multi-Round Diagnostic RAG Framework for Emulating Clinical Reasoning
di: Sun, Penglei, et al.
Pubblicazione: (2025)
di: Sun, Penglei, et al.
Pubblicazione: (2025)
GLoD: Composing Global Contexts and Local Details in Image Generation
di: Yamada, Moyuru
Pubblicazione: (2024)
di: Yamada, Moyuru
Pubblicazione: (2024)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
di: Zhang, YiFan, et al.
Pubblicazione: (2024)
ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World
di: Yan, Weixiang, et al.
Pubblicazione: (2024)
di: Yan, Weixiang, et al.
Pubblicazione: (2024)
AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output
di: Suzuki, Hisami, et al.
Pubblicazione: (2025)
di: Suzuki, Hisami, et al.
Pubblicazione: (2025)
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
di: Tang, Yixuan, et al.
Pubblicazione: (2024)
di: Tang, Yixuan, et al.
Pubblicazione: (2024)
YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology
di: Yu, Deshui, et al.
Pubblicazione: (2025)
di: Yu, Deshui, et al.
Pubblicazione: (2025)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
di: Jin, Bowen, et al.
Pubblicazione: (2024)
di: Jin, Bowen, et al.
Pubblicazione: (2024)
HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
di: Meng, Jinxiang, et al.
Pubblicazione: (2026)
di: Meng, Jinxiang, et al.
Pubblicazione: (2026)
CRAG -- Comprehensive RAG Benchmark
di: Yang, Xiao, et al.
Pubblicazione: (2024)
di: Yang, Xiao, et al.
Pubblicazione: (2024)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
di: Munakata, Hokuto, et al.
Pubblicazione: (2024)
di: Munakata, Hokuto, et al.
Pubblicazione: (2024)
RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World
di: Liu, Hanbing, et al.
Pubblicazione: (2026)
di: Liu, Hanbing, et al.
Pubblicazione: (2026)
Benchmarking and Learning Real-World Customer Service Dialogue
di: Gao, Tianhong, et al.
Pubblicazione: (2025)
di: Gao, Tianhong, et al.
Pubblicazione: (2025)
MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations
di: Rosenthal, Sara, et al.
Pubblicazione: (2026)
di: Rosenthal, Sara, et al.
Pubblicazione: (2026)
CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents
di: Park, Hyunseok, et al.
Pubblicazione: (2026)
di: Park, Hyunseok, et al.
Pubblicazione: (2026)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
ChronoPlay: A Framework for Modeling Dual Dynamics and Authenticity in Game RAG Benchmarks
di: He, Liyang, et al.
Pubblicazione: (2025)
di: He, Liyang, et al.
Pubblicazione: (2025)
FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing
di: Qian, Jingbin, et al.
Pubblicazione: (2026)
di: Qian, Jingbin, et al.
Pubblicazione: (2026)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
di: Wei, Shaohang, et al.
Pubblicazione: (2025)
OpenExempt: A Diagnostic Benchmark for Legal Reasoning and a Framework for Creating Custom Benchmarks on Demand
di: Servantez, Sergio, et al.
Pubblicazione: (2026)
di: Servantez, Sergio, et al.
Pubblicazione: (2026)
D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
di: Chen, Sen, et al.
Pubblicazione: (2025)
di: Chen, Sen, et al.
Pubblicazione: (2025)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
di: Bian, Haonan, et al.
Pubblicazione: (2026)
di: Bian, Haonan, et al.
Pubblicazione: (2026)
TravelPlanner: A Benchmark for Real-World Planning with Language Agents
di: Xie, Jian, et al.
Pubblicazione: (2024)
di: Xie, Jian, et al.
Pubblicazione: (2024)
Zodiac: A Cardiologist-Level LLM Framework for Multi-Agent Diagnostics
di: Zhou, Yuan, et al.
Pubblicazione: (2024)
di: Zhou, Yuan, et al.
Pubblicazione: (2024)
HalluMix: A Task-Agnostic, Multi-Domain Benchmark for Real-World Hallucination Detection
di: Emery, Deanna, et al.
Pubblicazione: (2025)
di: Emery, Deanna, et al.
Pubblicazione: (2025)
Overcoming LLM Challenges using RAG-Driven Precision in Coffee Leaf Disease Remediation
di: S, Selva Kumar, et al.
Pubblicazione: (2024)
di: S, Selva Kumar, et al.
Pubblicazione: (2024)
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
di: Hu, Gang, et al.
Pubblicazione: (2026)
di: Hu, Gang, et al.
Pubblicazione: (2026)
SMARTFinRAG: Interactive Modularized Financial RAG Benchmark
di: Zha, Yiwei
Pubblicazione: (2025)
di: Zha, Yiwei
Pubblicazione: (2025)
Evaluating Rare Disease Diagnostic Performance in Symptom Checkers: A Synthetic Vignette Simulation Approach
di: Nishibayashi, Takashi, et al.
Pubblicazione: (2025)
di: Nishibayashi, Takashi, et al.
Pubblicazione: (2025)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems
di: Fukui, Hiroki
Pubblicazione: (2026)
di: Fukui, Hiroki
Pubblicazione: (2026)
TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks
di: Xu, Frank F., et al.
Pubblicazione: (2024)
di: Xu, Frank F., et al.
Pubblicazione: (2024)
AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
di: You, Qijie, et al.
Pubblicazione: (2026)
di: You, Qijie, et al.
Pubblicazione: (2026)
SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction
di: Zhu, Hangxiao, et al.
Pubblicazione: (2026)
di: Zhu, Hangxiao, et al.
Pubblicazione: (2026)
MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
di: Huang, Zeyu, et al.
Pubblicazione: (2025)
PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers
di: Loc, Ngoc Phan Phuoc, et al.
Pubblicazione: (2026)
di: Loc, Ngoc Phan Phuoc, et al.
Pubblicazione: (2026)
SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework
di: Wang, Junlin, et al.
Pubblicazione: (2025)
di: Wang, Junlin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Multiple-Fill-in-the-Blank Exam Approach for Enhancing Zero-Resource Hallucination Detection in Large Language Models
di: Munakata, Satoshi, et al.
Pubblicazione: (2024) -
BRIT: Bidirectional Retrieval over Unified Image-Text Graph
di: Khan, Ainulla, et al.
Pubblicazione: (2025) -
The Multi-Round Diagnostic RAG Framework for Emulating Clinical Reasoning
di: Sun, Penglei, et al.
Pubblicazione: (2025) -
GLoD: Composing Global Contexts and Local Details in Image Generation
di: Yamada, Moyuru
Pubblicazione: (2024) -
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
di: Zhang, YiFan, et al.
Pubblicazione: (2024)