PAT-Questions: A Self-Updating Benchmark for Present-Anchored Temporal Question-Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Meem, Jannat Ara, Rashid, Muhammad Shihab, Dong, Yue, Hristidis, Vagelis |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NORMY: Non-Uniform History Modeling for Open Retrieval Conversational Question Answering
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
EcoRank: Budget-Constrained Text Re-ranking Using Large Language Models
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
Progressive Query Expansion for Retrieval Over Cost-constrained Data Sources
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
by: Rashid, Muhammad Shihab, et al.
Published: (2024)
Ontology-Guided Query Expansion for Biomedical Document Retrieval using Large Language Models
by: Nazi, Zabir Al, et al.
Published: (2025)
by: Nazi, Zabir Al, et al.
Published: (2025)
Question Calibration and Multi-Hop Modeling for Temporal Question Answering
by: Xue, Chao, et al.
Published: (2024)
by: Xue, Chao, et al.
Published: (2024)
Self-Improvement Programming for Temporal Knowledge Graph Question Answering
by: Chen, Zhuo, et al.
Published: (2024)
by: Chen, Zhuo, et al.
Published: (2024)
Continual Learning for Temporal-Sensitive Question Answering
by: Yang, Wanqi, et al.
Published: (2024)
by: Yang, Wanqi, et al.
Published: (2024)
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
by: Chen, Jialin, et al.
Published: (2025)
by: Chen, Jialin, et al.
Published: (2025)
IMB: An Italian Medical Benchmark for Question Answering
by: Romano, Antonio, et al.
Published: (2025)
by: Romano, Antonio, et al.
Published: (2025)
Source-Free Domain Adaptation for Question Answering with Masked Self-training
by: Yin, M., et al.
Published: (2022)
by: Yin, M., et al.
Published: (2022)
Synergizing LLMs and Knowledge Graphs: A Novel Approach to Software Repository-Related Question Answering
by: Abedu, Samuel, et al.
Published: (2024)
by: Abedu, Samuel, et al.
Published: (2024)
It's High Time: A Survey of Temporal Question Answering
by: Piryani, Bhawna, et al.
Published: (2025)
by: Piryani, Bhawna, et al.
Published: (2025)
Argument-Based Comparative Question Answering Evaluation Benchmark
by: Nikishina, Irina, et al.
Published: (2025)
by: Nikishina, Irina, et al.
Published: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
by: Zhang, Xuanliang, et al.
Published: (2025)
by: Zhang, Xuanliang, et al.
Published: (2025)
Social Bias in Popular Question-Answering Benchmarks
by: Kraft, Angelie, et al.
Published: (2025)
by: Kraft, Angelie, et al.
Published: (2025)
SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering
by: Lee, Gyubok, et al.
Published: (2025)
by: Lee, Gyubok, et al.
Published: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
by: Chen, Zhitong, et al.
Published: (2026)
by: Chen, Zhitong, et al.
Published: (2026)
Multi-hop Question Answering under Temporal Knowledge Editing
by: Cheng, Keyuan, et al.
Published: (2024)
by: Cheng, Keyuan, et al.
Published: (2024)
A Benchmark for Long-Form Medical Question Answering
by: Hosseini, Pedram, et al.
Published: (2024)
by: Hosseini, Pedram, et al.
Published: (2024)
Chronological Passage Assembling in RAG framework for Temporal Question Answering
by: Kim, Byeongjeong, et al.
Published: (2025)
by: Kim, Byeongjeong, et al.
Published: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
by: Dong, Kuicai, et al.
Published: (2025)
by: Dong, Kuicai, et al.
Published: (2025)
Faithful Temporal Question Answering over Heterogeneous Sources
by: Jia, Zhen, et al.
Published: (2024)
by: Jia, Zhen, et al.
Published: (2024)
NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens
by: Wang, Cunxiang, et al.
Published: (2024)
by: Wang, Cunxiang, et al.
Published: (2024)
Hallucination Benchmark in Medical Visual Question Answering
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language Models
by: Gamboa, Lance Calvin Lim, et al.
Published: (2026)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2026)
Temporal Knowledge Graph Question Answering: A Survey
by: Su, Miao, et al.
Published: (2024)
by: Su, Miao, et al.
Published: (2024)
On Early Detection of Hallucinations in Factual Question Answering
by: Snyder, Ben, et al.
Published: (2023)
by: Snyder, Ben, et al.
Published: (2023)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
by: Xie, Jiacheng, et al.
Published: (2025)
by: Xie, Jiacheng, et al.
Published: (2025)
LongHealth: A Question Answering Benchmark with Long Clinical Documents
by: Adams, Lisa, et al.
Published: (2024)
by: Adams, Lisa, et al.
Published: (2024)
Unlocking Markets: A Multilingual Benchmark to Cross-Market Question Answering
by: Yuan, Yifei, et al.
Published: (2024)
by: Yuan, Yifei, et al.
Published: (2024)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
by: Wu, Xianjie, et al.
Published: (2024)
by: Wu, Xianjie, et al.
Published: (2024)
AmaSQuAD: A Benchmark for Amharic Extractive Question Answering
by: Hailemariam, Nebiyou Daniel, et al.
Published: (2025)
by: Hailemariam, Nebiyou Daniel, et al.
Published: (2025)
IPQA: A Benchmark for Core Intent Identification in Personalized Question Answering
by: Kim, Jieyong, et al.
Published: (2025)
by: Kim, Jieyong, et al.
Published: (2025)
A Survey of Large Language Model Agents for Question Answering
by: Yue, Murong
Published: (2025)
by: Yue, Murong
Published: (2025)
OWLViz: An Open-World Benchmark for Visual Question Answering
by: Nguyen, Thuy, et al.
Published: (2025)
by: Nguyen, Thuy, et al.
Published: (2025)
KoBBQ: Korean Bias Benchmark for Question Answering
by: Jin, Jiho, et al.
Published: (2023)
by: Jin, Jiho, et al.
Published: (2023)
Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts
by: Chen, Xiangnan, et al.
Published: (2025)
by: Chen, Xiangnan, et al.
Published: (2025)
HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
by: Mandal, Biswadip, et al.
Published: (2025)
by: Mandal, Biswadip, et al.
Published: (2025)
Consistency Training by Synthetic Question Generation for Conversational Question Answering
by: Hemati, Hamed Hematian, et al.
Published: (2024)
by: Hemati, Hamed Hematian, et al.
Published: (2024)
Similar Items
-
NORMY: Non-Uniform History Modeling for Open Retrieval Conversational Question Answering
by: Rashid, Muhammad Shihab, et al.
Published: (2024) -
EcoRank: Budget-Constrained Text Re-ranking Using Large Language Models
by: Rashid, Muhammad Shihab, et al.
Published: (2024) -
Progressive Query Expansion for Retrieval Over Cost-constrained Data Sources
by: Rashid, Muhammad Shihab, et al.
Published: (2024) -
Ontology-Guided Query Expansion for Biomedical Document Retrieval using Large Language Models
by: Nazi, Zabir Al, et al.
Published: (2025) -
Question Calibration and Multi-Hop Modeling for Temporal Question Answering
by: Xue, Chao, et al.
Published: (2024)