HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Correa-Guillén, Alexis, Gómez-Rodríguez, Carlos, Vilares, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
por: Ezquerro, Ana, et al.
Publicado: (2025)
por: Ezquerro, Ana, et al.
Publicado: (2025)
Bringing Emerging Architectures to Sequence Labeling in NLP
por: Ezquerro, Ana, et al.
Publicado: (2025)
por: Ezquerro, Ana, et al.
Publicado: (2025)
Hierarchical Bracketing Encodings Work for Dependency Graphs
por: Ezquerro, Ana, et al.
Publicado: (2025)
por: Ezquerro, Ana, et al.
Publicado: (2025)
Dependency Graph Parsing as Sequence Labeling
por: Ezquerro, Ana, et al.
Publicado: (2024)
por: Ezquerro, Ana, et al.
Publicado: (2024)
From Partial to Strictly Incremental Constituent Parsing
por: Ezquerro, Ana, et al.
Publicado: (2024)
por: Ezquerro, Ana, et al.
Publicado: (2024)
Hierarchical Bracketing Encodings for Dependency Parsing as Tagging
por: Ezquerro, Ana, et al.
Publicado: (2025)
por: Ezquerro, Ana, et al.
Publicado: (2025)
On the performance of phonetic algorithms in microtext normalization
por: Doval, Yerai, et al.
Publicado: (2024)
por: Doval, Yerai, et al.
Publicado: (2024)
Contrasting Linguistic Patterns in Human and LLM-Generated News Text
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2023)
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2023)
LyS at SemEval-2024 Task 3: An Early Prototype for End-to-End Multimodal Emotion Linking as Graph-Based Parsing
por: Ezquerro, Ana, et al.
Publicado: (2024)
por: Ezquerro, Ana, et al.
Publicado: (2024)
Nested Named Entity Recognition as Single-Pass Sequence Labeling
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2025)
por: Muñoz-Ortiz, Alberto, et al.
Publicado: (2025)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
por: Shafayat, Sheikh, et al.
Publicado: (2024)
por: Shafayat, Sheikh, et al.
Publicado: (2024)
Dancing in the syntax forest: fast, accurate and explainable sentiment analysis with SALSA
por: Gómez-Rodríguez, Carlos, et al.
Publicado: (2024)
por: Gómez-Rodríguez, Carlos, et al.
Publicado: (2024)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
por: Ko, Donghyeon, et al.
Publicado: (2025)
por: Ko, Donghyeon, et al.
Publicado: (2025)
LyS at SemEval 2025 Task 8: Zero-Shot Code Generation for Tabular QA
por: Gude, Adrián, et al.
Publicado: (2025)
por: Gude, Adrián, et al.
Publicado: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
por: Chen, Jiangxi, et al.
Publicado: (2026)
por: Chen, Jiangxi, et al.
Publicado: (2026)
Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images
por: Lompo, Boammani Aser, et al.
Publicado: (2025)
por: Lompo, Boammani Aser, et al.
Publicado: (2025)
MentalQA: An Annotated Arabic Corpus for Questions and Answers of Mental Healthcare
por: Alhuzali, Hassan, et al.
Publicado: (2024)
por: Alhuzali, Hassan, et al.
Publicado: (2024)
SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computation
por: Wang, Hexuan, et al.
Publicado: (2026)
por: Wang, Hexuan, et al.
Publicado: (2026)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
por: Yu, Suhao, et al.
Publicado: (2025)
por: Yu, Suhao, et al.
Publicado: (2025)
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
Adaptive scheduling for adaptive sampling in POS taggers construction
por: Ferro, Manuel Vilares, et al.
Publicado: (2024)
por: Ferro, Manuel Vilares, et al.
Publicado: (2024)
Absolute convergence and error thresholds in non-active adaptive sampling
por: Ferro, Manuel Vilares, et al.
Publicado: (2024)
por: Ferro, Manuel Vilares, et al.
Publicado: (2024)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
por: Shoham, Ofir Ben, et al.
Publicado: (2024)
por: Shoham, Ofir Ben, et al.
Publicado: (2024)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
por: Lu, Zhiyuan, et al.
Publicado: (2026)
por: Lu, Zhiyuan, et al.
Publicado: (2026)
Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features
por: Testoni, Alberto, et al.
Publicado: (2025)
por: Testoni, Alberto, et al.
Publicado: (2025)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
por: Pan, Changzai, et al.
Publicado: (2026)
por: Pan, Changzai, et al.
Publicado: (2026)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
por: Zhang, Yindong, et al.
Publicado: (2026)
por: Zhang, Yindong, et al.
Publicado: (2026)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
por: Quan, Yinzhu, et al.
Publicado: (2024)
por: Quan, Yinzhu, et al.
Publicado: (2024)
HumMusQA: A Human-written Music Understanding QA Benchmark Dataset
por: Weck, Benno, et al.
Publicado: (2026)
por: Weck, Benno, et al.
Publicado: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
por: Zuo, Yuxin, et al.
Publicado: (2025)
por: Zuo, Yuxin, et al.
Publicado: (2025)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
por: Hudspeth, Marisa, et al.
Publicado: (2026)
por: Hudspeth, Marisa, et al.
Publicado: (2026)
Factuality or Fiction? Benchmarking Modern LLMs on Ambiguous QA with Citations
por: Patel, Maya, et al.
Publicado: (2024)
por: Patel, Maya, et al.
Publicado: (2024)
LFQA-E: Carefully Benchmarking Long-form QA Evaluation
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions
por: Hou, Yutao, et al.
Publicado: (2024)
por: Hou, Yutao, et al.
Publicado: (2024)
Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA
por: Maheshwary, Rishabh, et al.
Publicado: (2025)
por: Maheshwary, Rishabh, et al.
Publicado: (2025)
Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
por: Chen, Guanhua, et al.
Publicado: (2026)
por: Chen, Guanhua, et al.
Publicado: (2026)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
por: Pahilajani, Anish, et al.
Publicado: (2024)
por: Pahilajani, Anish, et al.
Publicado: (2024)
DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels
por: Xu, Zhe, et al.
Publicado: (2024)
por: Xu, Zhe, et al.
Publicado: (2024)
MoreHopQA: More Than Multi-hop Reasoning
por: Schnitzler, Julian, et al.
Publicado: (2024)
por: Schnitzler, Julian, et al.
Publicado: (2024)
JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs
por: Carrino, Casimiro Pio, et al.
Publicado: (2026)
por: Carrino, Casimiro Pio, et al.
Publicado: (2026)
Ejemplares similares
-
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
por: Ezquerro, Ana, et al.
Publicado: (2025) -
Bringing Emerging Architectures to Sequence Labeling in NLP
por: Ezquerro, Ana, et al.
Publicado: (2025) -
Hierarchical Bracketing Encodings Work for Dependency Graphs
por: Ezquerro, Ana, et al.
Publicado: (2025) -
Dependency Graph Parsing as Sequence Labeling
por: Ezquerro, Ana, et al.
Publicado: (2024) -
From Partial to Strictly Incremental Constituent Parsing
por: Ezquerro, Ana, et al.
Publicado: (2024)