FREB-TQA: A Fine-Grained Robustness Evaluation Benchmark for Table Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Wei, Mesgar, Mohsen, Adel, Heike, Friedrich, Annemarie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
p2-TQA: A Process-based Preference Learning Framework for Self-Improving Table Question Answering Models
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answering
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question Answering
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
di: Zhou, Wei, et al.
Pubblicazione: (2025)
di: Zhou, Wei, et al.
Pubblicazione: (2025)
Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering
di: Tang, Lei, et al.
Pubblicazione: (2025)
di: Tang, Lei, et al.
Pubblicazione: (2025)
M3TQA: Massively Multilingual Multitask Table Question Answering
di: Shu, Daixin, et al.
Pubblicazione: (2025)
di: Shu, Daixin, et al.
Pubblicazione: (2025)
SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQA
di: Zhang, Siyue, et al.
Pubblicazione: (2024)
di: Zhang, Siyue, et al.
Pubblicazione: (2024)
TQA-Bench: Evaluating LLMs for Multi-Table Question Answering with Scalable Context and Symbolic Extension
di: Qiu, Zipeng, et al.
Pubblicazione: (2024)
di: Qiu, Zipeng, et al.
Pubblicazione: (2024)
OMoS-QA: A Dataset for Cross-Lingual Extractive Question Answering in a German Migration Context
di: Kleinle, Steffen, et al.
Pubblicazione: (2024)
di: Kleinle, Steffen, et al.
Pubblicazione: (2024)
Consensus or Conflict? Fine-Grained Evaluation of Conflicting Answers in Question-Answering
di: Nachshoni, Eviatar, et al.
Pubblicazione: (2025)
di: Nachshoni, Eviatar, et al.
Pubblicazione: (2025)
LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual Feedback
di: Lai, Wen, et al.
Pubblicazione: (2024)
di: Lai, Wen, et al.
Pubblicazione: (2024)
Human vs. AI: A Novel Benchmark and a Comparative Study on the Detection of Generated Images and the Impact of Prompts
di: Moeßner, Philipp, et al.
Pubblicazione: (2024)
di: Moeßner, Philipp, et al.
Pubblicazione: (2024)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
di: Wu, Xianjie, et al.
Pubblicazione: (2024)
di: Wu, Xianjie, et al.
Pubblicazione: (2024)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
di: Zhang, Xuanliang, et al.
Pubblicazione: (2025)
di: Zhang, Xuanliang, et al.
Pubblicazione: (2025)
Argument-Based Comparative Question Answering Evaluation Benchmark
di: Nikishina, Irina, et al.
Pubblicazione: (2025)
di: Nikishina, Irina, et al.
Pubblicazione: (2025)
Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language Models
di: Gamboa, Lance Calvin Lim, et al.
Pubblicazione: (2026)
di: Gamboa, Lance Calvin Lim, et al.
Pubblicazione: (2026)
DARE: Diverse Visual Question Answering with Robustness Evaluation
di: Sterz, Hannah, et al.
Pubblicazione: (2024)
di: Sterz, Hannah, et al.
Pubblicazione: (2024)
Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval
di: Knappich, Valentin, et al.
Pubblicazione: (2026)
di: Knappich, Valentin, et al.
Pubblicazione: (2026)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
di: Chen, Zhitong, et al.
Pubblicazione: (2026)
di: Chen, Zhitong, et al.
Pubblicazione: (2026)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
di: Muller, Sacha, et al.
Pubblicazione: (2024)
di: Muller, Sacha, et al.
Pubblicazione: (2024)
Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data
di: Piryani, Bhawna, et al.
Pubblicazione: (2025)
di: Piryani, Bhawna, et al.
Pubblicazione: (2025)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Evaluating Fine-Tuning Efficiency of Human-Inspired Learning Strategies in Medical Question Answering
di: Yang, Yushi, et al.
Pubblicazione: (2024)
di: Yang, Yushi, et al.
Pubblicazione: (2024)
Building a Rich Dataset to Empower the Persian Question Answering Systems
di: Yazdinejad, Mohsen, et al.
Pubblicazione: (2024)
di: Yazdinejad, Mohsen, et al.
Pubblicazione: (2024)
IMB: An Italian Medical Benchmark for Question Answering
di: Romano, Antonio, et al.
Pubblicazione: (2025)
di: Romano, Antonio, et al.
Pubblicazione: (2025)
TableEval: A Real-World Benchmark for Complex, Multilingual, and Multi-Structured Table Question Answering
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
di: Zhu, Junnan, et al.
Pubblicazione: (2025)
DebateQA: Evaluating Question Answering on Debatable Knowledge
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
Accurate Table Question Answering with Accessible LLMs
di: Jiang, Yangfan, et al.
Pubblicazione: (2026)
di: Jiang, Yangfan, et al.
Pubblicazione: (2026)
SCITAT: A Question Answering Benchmark for Scientific Tables and Text Covering Diverse Reasoning Types
di: Zhang, Xuanliang, et al.
Pubblicazione: (2024)
di: Zhang, Xuanliang, et al.
Pubblicazione: (2024)
Uhura: A Benchmark for Evaluating Scientific Question Answering and Truthfulness in Low-Resource African Languages
di: Bayes, Edward, et al.
Pubblicazione: (2024)
di: Bayes, Edward, et al.
Pubblicazione: (2024)
MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Tail Knowledge
di: He, Jie, et al.
Pubblicazione: (2024)
di: He, Jie, et al.
Pubblicazione: (2024)
Spider4SPARQL: A Complex Benchmark for Evaluating Knowledge Graph Question Answering Systems
di: Kosten, Catherine, et al.
Pubblicazione: (2023)
di: Kosten, Catherine, et al.
Pubblicazione: (2023)
PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-Answering
di: Meem, Jannat Ara, et al.
Pubblicazione: (2024)
di: Meem, Jannat Ara, et al.
Pubblicazione: (2024)
Benchmarking Real-Time Question Answering via Executable Code Workflows
di: Zhou, Wenjie, et al.
Pubblicazione: (2026)
di: Zhou, Wenjie, et al.
Pubblicazione: (2026)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
di: Pan, Changzai, et al.
Pubblicazione: (2026)
di: Pan, Changzai, et al.
Pubblicazione: (2026)
Explaining Pre-Trained Language Models with Attribution Scores: An Analysis in Low-Resource Settings
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering
di: Xue, Siqiao, et al.
Pubblicazione: (2024)
di: Xue, Siqiao, et al.
Pubblicazione: (2024)
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
di: Wang, Shu, et al.
Pubblicazione: (2026)
di: Wang, Shu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
p2-TQA: A Process-based Preference Learning Framework for Self-Improving Table Question Answering Models
di: Zhou, Wei, et al.
Pubblicazione: (2025) -
Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answering
di: Zhou, Wei, et al.
Pubblicazione: (2025) -
Efficient Multi-Agent Collaboration with Tool Use for Online Planning in Complex Table Question Answering
di: Zhou, Wei, et al.
Pubblicazione: (2024) -
Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation
di: Zhou, Wei, et al.
Pubblicazione: (2025) -
Exploring Generative Process Reward Modeling for Semi-Structured Data: A Case Study of Table Question Answering
di: Tang, Lei, et al.
Pubblicazione: (2025)