RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Satriani, Dario, Veltri, Enzo, Santoro, Donatello, Papotti, Paolo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An LLM-Based Approach for Insight Generation in Data Analysis
by: Pérez, Alberto Sánchez, et al.
Published: (2025)
by: Pérez, Alberto Sánchez, et al.
Published: (2025)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
by: Yang, Shuo, et al.
Published: (2025)
by: Yang, Shuo, et al.
Published: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025)
by: He, Jiayi, et al.
Published: (2025)
Taxonomy Inference for Tabular Data Using Large Language Models
by: Wu, Zhenyu, et al.
Published: (2025)
by: Wu, Zhenyu, et al.
Published: (2025)
Capturing Legal Reasoning Paths from Facts to Law in Court Judgments using Knowledge Graphs
by: Kondo, Ryoma, et al.
Published: (2025)
by: Kondo, Ryoma, et al.
Published: (2025)
Constraint Decay: The Fragility of LLM Agents in Backend Code Generation
by: Dente, Francesco, et al.
Published: (2026)
by: Dente, Francesco, et al.
Published: (2026)
Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
by: Corallo, Giulio, et al.
Published: (2026)
by: Corallo, Giulio, et al.
Published: (2026)
Are Large Language Models the New Interface for Data Pipelines?
by: Junior, Sylvio Barbon, et al.
Published: (2024)
by: Junior, Sylvio Barbon, et al.
Published: (2024)
Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks
by: Yin, Jiaqi, et al.
Published: (2025)
by: Yin, Jiaqi, et al.
Published: (2025)
GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
by: Tritto, Mattia, et al.
Published: (2025)
by: Tritto, Mattia, et al.
Published: (2025)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
by: Hao, Yijie, et al.
Published: (2025)
by: Hao, Yijie, et al.
Published: (2025)
Give Us the Facts: Enhancing Large Language Models with Knowledge Graphs for Fact-aware Language Modeling
by: Yang, Linyao, et al.
Published: (2023)
by: Yang, Linyao, et al.
Published: (2023)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
by: Li, Fangjun, et al.
Published: (2024)
by: Li, Fangjun, et al.
Published: (2024)
ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge
by: Taghavi, Zeinab Sadat, et al.
Published: (2025)
by: Taghavi, Zeinab Sadat, et al.
Published: (2025)
Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization
by: Li, Shuaimin, et al.
Published: (2024)
by: Li, Shuaimin, et al.
Published: (2024)
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
by: Herel, David, et al.
Published: (2024)
by: Herel, David, et al.
Published: (2024)
Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark
by: Li, Fangjun, et al.
Published: (2024)
by: Li, Fangjun, et al.
Published: (2024)
TrumorGPT: Graph-Based Retrieval-Augmented Large Language Model for Fact-Checking
by: Hang, Ching Nam, et al.
Published: (2025)
by: Hang, Ching Nam, et al.
Published: (2025)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
by: Jiang, Hongda, et al.
Published: (2025)
by: Jiang, Hongda, et al.
Published: (2025)
Automated Data Visualization from Natural Language via Large Language Models: An Exploratory Study
by: Wu, Yang, et al.
Published: (2024)
by: Wu, Yang, et al.
Published: (2024)
Structure Guided Large Language Model for SQL Generation
by: Zhang, Qinggang, et al.
Published: (2024)
by: Zhang, Qinggang, et al.
Published: (2024)
Are Large Language Models a Good Replacement of Taxonomies?
by: Sun, Yushi, et al.
Published: (2024)
by: Sun, Yushi, et al.
Published: (2024)
FactLens: Benchmarking Fine-Grained Fact Verification
by: Mitra, Kushan, et al.
Published: (2024)
by: Mitra, Kushan, et al.
Published: (2024)
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
by: Zhang, Shaolei, et al.
Published: (2025)
by: Zhang, Shaolei, et al.
Published: (2025)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
by: Tran, Hieu, et al.
Published: (2024)
by: Tran, Hieu, et al.
Published: (2024)
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
When Facts Change: Probing LLMs on Evolving Knowledge with evolveQA
by: Nakshatri, Nishanth Sridhar, et al.
Published: (2025)
by: Nakshatri, Nishanth Sridhar, et al.
Published: (2025)
PURPLE: Making a Large Language Model a Better SQL Writer
by: Ren, Tonghui, et al.
Published: (2024)
by: Ren, Tonghui, et al.
Published: (2024)
IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages
by: Dawar, Aviral, et al.
Published: (2026)
by: Dawar, Aviral, et al.
Published: (2026)
TARGET: Benchmarking Table Retrieval for Generative Tasks
by: Ji, Xingyu, et al.
Published: (2025)
by: Ji, Xingyu, et al.
Published: (2025)
A Survey of Large Language Models on Generative Graph Analytics: Query, Learning, and Applications
by: Shang, Wenbo, et al.
Published: (2024)
by: Shang, Wenbo, et al.
Published: (2024)
SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended)
by: Sun, Ruoxi, et al.
Published: (2023)
by: Sun, Ruoxi, et al.
Published: (2023)
Multi-hop Question Answering over Knowledge Graphs using Large Language Models
by: Chakraborty, Abir
Published: (2024)
by: Chakraborty, Abir
Published: (2024)
Bridging Textual and Tabular Worlds for Fact Verification: A Lightweight, Attention-Based Model
by: Varnosfaderani, Shirin Dabbaghi, et al.
Published: (2024)
by: Varnosfaderani, Shirin Dabbaghi, et al.
Published: (2024)
Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
by: Liu, Wei, et al.
Published: (2026)
by: Liu, Wei, et al.
Published: (2026)
Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
by: Lei, Fangyu, et al.
Published: (2024)
by: Lei, Fangyu, et al.
Published: (2024)
Aligning Large Language Models to a Domain-specific Graph Database for NL2GQL
by: Liang, Yuanyuan, et al.
Published: (2024)
by: Liang, Yuanyuan, et al.
Published: (2024)
Generating Knowledge Graphs from Large Language Models: A Comparative Study of GPT-4, LLaMA 2, and BERT
by: Bhatt, Ahan, et al.
Published: (2024)
by: Bhatt, Ahan, et al.
Published: (2024)
Are We Asking the Right Questions? On Ambiguity in Natural Language Queries for Tabular Data Analysis
by: Gomm, Daniel, et al.
Published: (2025)
by: Gomm, Daniel, et al.
Published: (2025)
Similar Items
-
An LLM-Based Approach for Insight Generation in Data Analysis
by: Pérez, Alberto Sánchez, et al.
Published: (2025) -
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
by: Yang, Shuo, et al.
Published: (2025) -
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
by: He, Jiayi, et al.
Published: (2025) -
Taxonomy Inference for Tabular Data Using Large Language Models
by: Wu, Zhenyu, et al.
Published: (2025) -
Capturing Legal Reasoning Paths from Facts to Law in Court Judgments using Knowledge Graphs
by: Kondo, Ryoma, et al.
Published: (2025)