NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Cunxiang, Ning, Ruoxi, Pan, Boqi, Wu, Tonghui, Guo, Qipeng, Deng, Cheng, Bao, Guangsheng, Hu, Xiangkun, Zhang, Zheng, Wang, Qian, Zhang, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
par: Wang, Shu, et autres
Publié: (2026)
par: Wang, Shu, et autres
Publié: (2026)
How Likely Do LLMs with CoT Mimic Human Reasoning?
par: Bao, Guangsheng, et autres
Publié: (2024)
par: Bao, Guangsheng, et autres
Publié: (2024)
DocTabQA: Answering Questions from Long Documents Using Tables
par: Wang, Haochen, et autres
Publié: (2024)
par: Wang, Haochen, et autres
Publié: (2024)
ClimaQA_SLO - Slovenian Climate Question-Answering Benchmark
par: Ferk Ovčjak, Monika, et autres
Publié: (2025)
par: Ferk Ovčjak, Monika, et autres
Publié: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
par: Li, Guangwei, et autres
Publié: (2025)
par: Li, Guangwei, et autres
Publié: (2025)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
par: Hudspeth, Marisa, et autres
Publié: (2026)
par: Hudspeth, Marisa, et autres
Publié: (2026)
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
par: Kartha, Aaryaman, et autres
Publié: (2025)
par: Kartha, Aaryaman, et autres
Publié: (2025)
HCT-QA: A Benchmark for Question Answering on Human-Centric Tables
par: Ahmad, Mohammad S., et autres
Publié: (2025)
par: Ahmad, Mohammad S., et autres
Publié: (2025)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
par: Shafayat, Sheikh, et autres
Publié: (2024)
par: Shafayat, Sheikh, et autres
Publié: (2024)
SensorQA: A Question Answering Benchmark for Daily-Life Monitoring
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
FabricQA-Extractor: A Question Answering System to Extract Information from Documents using Natural Language Questions
par: Wang, Qiming, et autres
Publié: (2024)
par: Wang, Qiming, et autres
Publié: (2024)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
UDA: Unsupervised Debiasing Alignment for Pair-wise LLM-as-a-Judge
par: Zhang, Yang, et autres
Publié: (2025)
par: Zhang, Yang, et autres
Publié: (2025)
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
par: Li, Haopeng, et autres
Publié: (2024)
par: Li, Haopeng, et autres
Publié: (2024)
CodeRepoQA: A Large-scale Benchmark for Software Engineering Question Answering
par: Hu, Ruida, et autres
Publié: (2024)
par: Hu, Ruida, et autres
Publié: (2024)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
par: Xiao, Ying, et autres
Publié: (2025)
par: Xiao, Ying, et autres
Publié: (2025)
Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective
par: Chen, Boqi, et autres
Publié: (2026)
par: Chen, Boqi, et autres
Publié: (2026)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
par: Qian, Tianwen, et autres
Publié: (2023)
par: Qian, Tianwen, et autres
Publié: (2023)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
par: Zhang, Yindong, et autres
Publié: (2026)
par: Zhang, Yindong, et autres
Publié: (2026)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
par: Pan, Changzai, et autres
Publié: (2026)
par: Pan, Changzai, et autres
Publié: (2026)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering
par: Li, Zongxi, et autres
Publié: (2025)
par: Li, Zongxi, et autres
Publié: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
par: Chen, Zhitong, et autres
Publié: (2026)
par: Chen, Zhitong, et autres
Publié: (2026)
AmharicStoryQA: A Multicultural Story Question Answering Benchmark in Amharic
par: Azime, Israel Abebe, et autres
Publié: (2026)
par: Azime, Israel Abebe, et autres
Publié: (2026)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
par: Xie, Tianchi, et autres
Publié: (2025)
par: Xie, Tianchi, et autres
Publié: (2025)
LaMP-QA: A Benchmark for Personalized Long-form Question Answering
par: Salemi, Alireza, et autres
Publié: (2025)
par: Salemi, Alireza, et autres
Publié: (2025)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
par: Onami, Eri, et autres
Publié: (2024)
par: Onami, Eri, et autres
Publié: (2024)
RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity
par: Bertolino, Gaia A., et autres
Publié: (2026)
par: Bertolino, Gaia A., et autres
Publié: (2026)
Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents
par: Wu, Shiwei, et autres
Publié: (2024)
par: Wu, Shiwei, et autres
Publié: (2024)
PolQA: Polish Question Answering Dataset
par: Rybak, Piotr, et autres
Publié: (2022)
par: Rybak, Piotr, et autres
Publié: (2022)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
par: Deng, Wenqing, et autres
Publié: (2024)
par: Deng, Wenqing, et autres
Publié: (2024)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
Synergetic Event Understanding: A Collaborative Approach to Cross-Document Event Coreference Resolution with Large Language Models
par: Min, Qingkai, et autres
Publié: (2024)
par: Min, Qingkai, et autres
Publié: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
par: Alonso, Iñigo, et autres
Publié: (2024)
par: Alonso, Iñigo, et autres
Publié: (2024)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
par: Shaar, Shaden, et autres
Publié: (2026)
par: Shaar, Shaden, et autres
Publié: (2026)
CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic
par: Chen, Jing, et autres
Publié: (2026)
par: Chen, Jing, et autres
Publié: (2026)
Documents similaires
-
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
par: Wang, Shu, et autres
Publié: (2026) -
How Likely Do LLMs with CoT Mimic Human Reasoning?
par: Bao, Guangsheng, et autres
Publié: (2024) -
DocTabQA: Answering Questions from Long Documents Using Tables
par: Wang, Haochen, et autres
Publié: (2024) -
ClimaQA_SLO - Slovenian Climate Question-Answering Benchmark
par: Ferk Ovčjak, Monika, et autres
Publié: (2025) -
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
par: Li, Guangwei, et autres
Publié: (2025)