Saved in:
| Main Authors: | Correa-Guillén, Alexis, Gómez-Rodríguez, Carlos, Vilares, David |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2511.15355 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
by: Ezquerro, Ana, et al.
Published: (2025)
by: Ezquerro, Ana, et al.
Published: (2025)
Bringing Emerging Architectures to Sequence Labeling in NLP
by: Ezquerro, Ana, et al.
Published: (2025)
by: Ezquerro, Ana, et al.
Published: (2025)
Hierarchical Bracketing Encodings Work for Dependency Graphs
by: Ezquerro, Ana, et al.
Published: (2025)
by: Ezquerro, Ana, et al.
Published: (2025)
Dependency Graph Parsing as Sequence Labeling
by: Ezquerro, Ana, et al.
Published: (2024)
by: Ezquerro, Ana, et al.
Published: (2024)
From Partial to Strictly Incremental Constituent Parsing
by: Ezquerro, Ana, et al.
Published: (2024)
by: Ezquerro, Ana, et al.
Published: (2024)
Contrasting Linguistic Patterns in Human and LLM-Generated News Text
by: Muñoz-Ortiz, Alberto, et al.
Published: (2023)
by: Muñoz-Ortiz, Alberto, et al.
Published: (2023)
Hierarchical Bracketing Encodings for Dependency Parsing as Tagging
by: Ezquerro, Ana, et al.
Published: (2025)
by: Ezquerro, Ana, et al.
Published: (2025)
On the performance of phonetic algorithms in microtext normalization
by: Doval, Yerai, et al.
Published: (2024)
by: Doval, Yerai, et al.
Published: (2024)
Nested Named Entity Recognition as Single-Pass Sequence Labeling
by: Muñoz-Ortiz, Alberto, et al.
Published: (2025)
by: Muñoz-Ortiz, Alberto, et al.
Published: (2025)
LyS at SemEval-2024 Task 3: An Early Prototype for End-to-End Multimodal Emotion Linking as Graph-Based Parsing
by: Ezquerro, Ana, et al.
Published: (2024)
by: Ezquerro, Ana, et al.
Published: (2024)
Dancing in the syntax forest: fast, accurate and explainable sentiment analysis with SALSA
by: Gómez-Rodríguez, Carlos, et al.
Published: (2024)
by: Gómez-Rodríguez, Carlos, et al.
Published: (2024)
LyS at SemEval 2025 Task 8: Zero-Shot Code Generation for Tabular QA
by: Gude, Adrián, et al.
Published: (2025)
by: Gude, Adrián, et al.
Published: (2025)
Adaptive scheduling for adaptive sampling in POS taggers construction
by: Ferro, Manuel Vilares, et al.
Published: (2024)
by: Ferro, Manuel Vilares, et al.
Published: (2024)
Absolute convergence and error thresholds in non-active adaptive sampling
by: Ferro, Manuel Vilares, et al.
Published: (2024)
by: Ferro, Manuel Vilares, et al.
Published: (2024)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
by: Shafayat, Sheikh, et al.
Published: (2024)
by: Shafayat, Sheikh, et al.
Published: (2024)
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
by: Ko, Donghyeon, et al.
Published: (2025)
by: Ko, Donghyeon, et al.
Published: (2025)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
by: Chen, Jiangxi, et al.
Published: (2026)
by: Chen, Jiangxi, et al.
Published: (2026)
Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images
by: Lompo, Boammani Aser, et al.
Published: (2025)
by: Lompo, Boammani Aser, et al.
Published: (2025)
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
by: Opsahl-Ong, Krista, et al.
Published: (2026)
by: Opsahl-Ong, Krista, et al.
Published: (2026)
MentalQA: An Annotated Arabic Corpus for Questions and Answers of Mental Healthcare
by: Alhuzali, Hassan, et al.
Published: (2024)
by: Alhuzali, Hassan, et al.
Published: (2024)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
by: Yu, Suhao, et al.
Published: (2025)
by: Yu, Suhao, et al.
Published: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
by: Shoham, Ofir Ben, et al.
Published: (2024)
by: Shoham, Ofir Ben, et al.
Published: (2024)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
by: Lu, Zhiyuan, et al.
Published: (2026)
by: Lu, Zhiyuan, et al.
Published: (2026)
SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computation
by: Wang, Hexuan, et al.
Published: (2026)
by: Wang, Hexuan, et al.
Published: (2026)
HumMusQA: A Human-written Music Understanding QA Benchmark Dataset
by: Weck, Benno, et al.
Published: (2026)
by: Weck, Benno, et al.
Published: (2026)
Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features
by: Testoni, Alberto, et al.
Published: (2025)
by: Testoni, Alberto, et al.
Published: (2025)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
by: Pan, Changzai, et al.
Published: (2026)
by: Pan, Changzai, et al.
Published: (2026)
ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering
by: Zhang, Yindong, et al.
Published: (2026)
by: Zhang, Yindong, et al.
Published: (2026)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
by: Quan, Yinzhu, et al.
Published: (2024)
by: Quan, Yinzhu, et al.
Published: (2024)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
by: Hudspeth, Marisa, et al.
Published: (2026)
by: Hudspeth, Marisa, et al.
Published: (2026)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
by: Mateega, Spencer, et al.
Published: (2025)
by: Mateega, Spencer, et al.
Published: (2025)
JobResQA: A Benchmark for LLM Machine Reading Comprehension on Multilingual Résumés and JDs
by: Carrino, Casimiro Pio, et al.
Published: (2026)
by: Carrino, Casimiro Pio, et al.
Published: (2026)
Factuality or Fiction? Benchmarking Modern LLMs on Ambiguous QA with Citations
by: Patel, Maya, et al.
Published: (2024)
by: Patel, Maya, et al.
Published: (2024)
LFQA-E: Carefully Benchmarking Long-form QA Evaluation
by: Fan, Yuchen, et al.
Published: (2024)
by: Fan, Yuchen, et al.
Published: (2024)
Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions
by: Hou, Yutao, et al.
Published: (2024)
by: Hou, Yutao, et al.
Published: (2024)
K-QA: A Real-World Medical Q&A Benchmark
by: Manes, Itay, et al.
Published: (2024)
by: Manes, Itay, et al.
Published: (2024)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
by: Düzkar, Kemal
Published: (2026)
by: Düzkar, Kemal
Published: (2026)
Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA
by: Maheshwary, Rishabh, et al.
Published: (2025)
by: Maheshwary, Rishabh, et al.
Published: (2025)
Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA
by: Chen, Guanhua, et al.
Published: (2026)
by: Chen, Guanhua, et al.
Published: (2026)
Similar Items
-
Better Benchmarking LLMs for Zero-Shot Dependency Parsing
by: Ezquerro, Ana, et al.
Published: (2025) -
Bringing Emerging Architectures to Sequence Labeling in NLP
by: Ezquerro, Ana, et al.
Published: (2025) -
Hierarchical Bracketing Encodings Work for Dependency Graphs
by: Ezquerro, Ana, et al.
Published: (2025) -
Dependency Graph Parsing as Sequence Labeling
by: Ezquerro, Ana, et al.
Published: (2024) -
From Partial to Strictly Incremental Constituent Parsing
by: Ezquerro, Ana, et al.
Published: (2024)