Intrinsic Evaluation of RAG Systems for Deep-Logic Questions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Junyi, Zhou, You, Wang, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Detecting AI-Generated Texts in Cross-Domains
par: Zhou, You, et autres
Publié: (2024)
par: Zhou, You, et autres
Publié: (2024)
Constructing Cloze Questions Generatively
par: Sun, Yicheng, et autres
Publié: (2024)
par: Sun, Yicheng, et autres
Publié: (2024)
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
par: Li, Xu, et autres
Publié: (2026)
par: Li, Xu, et autres
Publié: (2026)
A Library of LLM Intrinsics for Retrieval-Augmented Generation
par: Danilevsky, Marina, et autres
Publié: (2025)
par: Danilevsky, Marina, et autres
Publié: (2025)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Comparing the Performance of LLMs in RAG-based Question-Answering: A Case Study in Computer Science Literature
par: Dayarathne, Ranul, et autres
Publié: (2025)
par: Dayarathne, Ranul, et autres
Publié: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
A Fuzzy Logic Prompting Framework for Large Language Models in Adaptive and Uncertain Tasks
par: Figueiredo, Vanessa
Publié: (2025)
par: Figueiredo, Vanessa
Publié: (2025)
Pharos-ESG: A Framework for Multimodal Parsing, Contextual Narration, and Hierarchical Labeling of ESG Report
par: Chen, Yan, et autres
Publié: (2025)
par: Chen, Yan, et autres
Publié: (2025)
FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation
par: Hildebrand, Samuel, et autres
Publié: (2025)
par: Hildebrand, Samuel, et autres
Publié: (2025)
The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making
par: Chun, Jon, et autres
Publié: (2026)
par: Chun, Jon, et autres
Publié: (2026)
Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment
par: Wang, Liang, et autres
Publié: (2026)
par: Wang, Liang, et autres
Publié: (2026)
Question Answering Over Spatio-Temporal Knowledge Graph
par: Dai, Xinbang, et autres
Publié: (2024)
par: Dai, Xinbang, et autres
Publié: (2024)
FlexStructRAG: Flexible Structure-Aware Multi-Granular Relational Retrieval for RAG
par: Chen, Mengzhu, et autres
Publié: (2026)
par: Chen, Mengzhu, et autres
Publié: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Evaluating Relational Reasoning in LLMs with REL
par: Fesser, Lukas, et autres
Publié: (2026)
par: Fesser, Lukas, et autres
Publié: (2026)
Evaluating Steering Techniques using Human Similarity Judgments
par: Studdiford, Zach, et autres
Publié: (2025)
par: Studdiford, Zach, et autres
Publié: (2025)
Evaluating LLM Metrics Through Real-World Capabilities
par: Miller, Justin K, et autres
Publié: (2025)
par: Miller, Justin K, et autres
Publié: (2025)
Temporal Knowledge Question Answering via Abstract Reasoning Induction
par: Chen, Ziyang, et autres
Publié: (2023)
par: Chen, Ziyang, et autres
Publié: (2023)
RoleRAG: Enhancing LLM Role-Playing via Graph Guided Retrieval
par: Wang, Yongjie, et autres
Publié: (2025)
par: Wang, Yongjie, et autres
Publié: (2025)
Graph Guided Question Answer Generation for Procedural Question-Answering
par: Pham, Hai X., et autres
Publié: (2024)
par: Pham, Hai X., et autres
Publié: (2024)
EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs
par: Naeem, Numaan, et autres
Publié: (2025)
par: Naeem, Numaan, et autres
Publié: (2025)
Fine-Tuned Large Language Models for Logical Translation: Reducing Hallucinations with Lang2Logic
par: Pan, Muyu, et autres
Publié: (2025)
par: Pan, Muyu, et autres
Publié: (2025)
Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework
par: Preuveneers, Jack, et autres
Publié: (2025)
par: Preuveneers, Jack, et autres
Publié: (2025)
Teaching Probabilistic Logical Reasoning to Transformers
par: Nafar, Aliakbar, et autres
Publié: (2023)
par: Nafar, Aliakbar, et autres
Publié: (2023)
Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems
par: Wang, Zixu, et autres
Publié: (2026)
par: Wang, Zixu, et autres
Publié: (2026)
DQA: Diagnostic Question Answering for IT Support
par: Kapoor, Vishaal, et autres
Publié: (2026)
par: Kapoor, Vishaal, et autres
Publié: (2026)
A Graph-based RAG for Energy Efficiency Question Answering
par: Campi, Riccardo, et autres
Publié: (2025)
par: Campi, Riccardo, et autres
Publié: (2025)
Observations on Building RAG Systems for Technical Documents
par: Soman, Sumit, et autres
Publié: (2024)
par: Soman, Sumit, et autres
Publié: (2024)
Low-Resource Court Judgment Summarization for Common Law Systems
par: Liu, Shuaiqi, et autres
Publié: (2024)
par: Liu, Shuaiqi, et autres
Publié: (2024)
Exploring Graph Representations of Logical Forms for Language Modeling
par: Sullivan, Michael
Publié: (2025)
par: Sullivan, Michael
Publié: (2025)
Xinyu: An Efficient LLM-based System for Commentary Generation
par: Wu, Yiquan, et autres
Publié: (2024)
par: Wu, Yiquan, et autres
Publié: (2024)
VERA: Validation and Evaluation of Retrieval-Augmented Systems
par: Ding, Tianyu, et autres
Publié: (2024)
par: Ding, Tianyu, et autres
Publié: (2024)
ROZA Graphs: Self-Improving Near-Deterministic RAG through Evidence-Centric Feedback
par: Penaroza, Matthew
Publié: (2026)
par: Penaroza, Matthew
Publié: (2026)
Bidirectional RAG: Safe Self-Improving Retrieval-Augmented Generation Through Multi-Stage Validation
par: Chinthala, Teja
Publié: (2025)
par: Chinthala, Teja
Publié: (2025)
Introducing Brain-like Concepts to Embodied Hand-crafted Dialog Management System
par: Joublin, Frank, et autres
Publié: (2024)
par: Joublin, Frank, et autres
Publié: (2024)
CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems
par: Sun, Kangkang, et autres
Publié: (2026)
par: Sun, Kangkang, et autres
Publié: (2026)
AskSport: Web Application for Sports Question-Answering
par: Onofre, Enzo B, et autres
Publié: (2025)
par: Onofre, Enzo B, et autres
Publié: (2025)
How LLMs Are Persuaded: A Few Attention Heads, Rerouted
par: Sun, Xiangkun, et autres
Publié: (2026)
par: Sun, Xiangkun, et autres
Publié: (2026)
From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering
par: Santos, José Guilherme Marques dos, et autres
Publié: (2026)
par: Santos, José Guilherme Marques dos, et autres
Publié: (2026)
Documents similaires
-
Detecting AI-Generated Texts in Cross-Domains
par: Zhou, You, et autres
Publié: (2024) -
Constructing Cloze Questions Generatively
par: Sun, Yicheng, et autres
Publié: (2024) -
TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination
par: Li, Xu, et autres
Publié: (2026) -
A Library of LLM Intrinsics for Retrieval-Augmented Generation
par: Danilevsky, Marina, et autres
Publié: (2025) -
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)