Benchmarking Critical Questions Generation: A Challenging Reasoning Task for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Figueras, Banca Calvo, Agerri, Rodrigo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Critical Questions Generation: Motivation and Challenges
by: Figueras, Blanca Calvo, et al.
Published: (2024)
by: Figueras, Blanca Calvo, et al.
Published: (2024)
Multilingual Medical Reasoning for Question Answering with Large Language Models
by: Ferrazzi, Pietro, et al.
Published: (2025)
by: Ferrazzi, Pietro, et al.
Published: (2025)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024)
by: Alonso, Iñigo, et al.
Published: (2024)
Dynamic Knowledge Integration for Evidence-Driven Counter-Argument Generation with Large Language Models
by: Yeginbergen, Anar, et al.
Published: (2025)
by: Yeginbergen, Anar, et al.
Published: (2025)
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
by: Sanchez-Bayona, Elisa, et al.
Published: (2025)
by: Sanchez-Bayona, Elisa, et al.
Published: (2025)
Language Independent Stance Detection: Social Interaction-based Embeddings and Large Language Models
by: de Landa, Joseba Fernandez, et al.
Published: (2022)
by: de Landa, Joseba Fernandez, et al.
Published: (2022)
Effects of Cross-lingual Evidence in Multilingual Medical Question Answering
by: Yeginbergen, Anar, et al.
Published: (2026)
by: Yeginbergen, Anar, et al.
Published: (2026)
Physical Commonsense Reasoning for Lower-Resourced Languages and Dialects: a Study on Basque
by: Bengoetxea, Jaione, et al.
Published: (2026)
by: Bengoetxea, Jaione, et al.
Published: (2026)
Lemma Dilemma: On Lemma Generation Without Domain- or Language-Specific Training Data
by: Toporkov, Olia, et al.
Published: (2025)
by: Toporkov, Olia, et al.
Published: (2025)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
by: Liu, Junlin, et al.
Published: (2026)
by: Liu, Junlin, et al.
Published: (2026)
Truth Knows No Language: Evaluating Truthfulness Beyond English
by: Figueras, Blanca Calvo, et al.
Published: (2025)
by: Figueras, Blanca Calvo, et al.
Published: (2025)
A LLM-Based Ranking Method for the Evaluation of Automatic Counter-Narrative Generation
by: Zubiaga, Irune, et al.
Published: (2024)
by: Zubiaga, Irune, et al.
Published: (2024)
Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions
by: Chen, Hanjie, et al.
Published: (2024)
by: Chen, Hanjie, et al.
Published: (2024)
Cross-lingual Argument Mining in the Medical Domain
by: Yeginbergen, Anar, et al.
Published: (2023)
by: Yeginbergen, Anar, et al.
Published: (2023)
Evaluating Shortest Edit Script Methods for Contextual Lemmatization
by: Toporkov, Olia, et al.
Published: (2024)
by: Toporkov, Olia, et al.
Published: (2024)
Benchmarking Large Language Models for Math Reasoning Tasks
by: Seßler, Kathrin, et al.
Published: (2024)
by: Seßler, Kathrin, et al.
Published: (2024)
A Critical Review of Causal Reasoning Benchmarks for Large Language Models
by: Yang, Linying, et al.
Published: (2024)
by: Yang, Linying, et al.
Published: (2024)
EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning
by: Wei, Mingyang, et al.
Published: (2026)
by: Wei, Mingyang, et al.
Published: (2026)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
by: Sun, Haoxiang, et al.
Published: (2025)
by: Sun, Haoxiang, et al.
Published: (2025)
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
by: Song, Seok Hwan, et al.
Published: (2025)
by: Song, Seok Hwan, et al.
Published: (2025)
A Catalog of Basque Dialectal Resources: Online Collections and Standard-to-Dialectal Adaptations
by: Bengoetxea, Jaione, et al.
Published: (2026)
by: Bengoetxea, Jaione, et al.
Published: (2026)
Meta4XNLI: A Crosslingual Parallel Corpus for Metaphor Detection and Interpretation
by: Sanchez-Bayona, Elisa, et al.
Published: (2024)
by: Sanchez-Bayona, Elisa, et al.
Published: (2024)
Basque and Spanish Counter Narrative Generation: Data Creation and Evaluation
by: Bengoetxea, Jaione, et al.
Published: (2024)
by: Bengoetxea, Jaione, et al.
Published: (2024)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
by: Yan, Yibo, et al.
Published: (2024)
by: Yan, Yibo, et al.
Published: (2024)
EconLogicQA: A Question-Answering Benchmark for Evaluating Large Language Models in Economic Sequential Reasoning
by: Quan, Yinzhu, et al.
Published: (2024)
by: Quan, Yinzhu, et al.
Published: (2024)
CasiMedicos-Arg: A Medical Question Answering Dataset Annotated with Explanatory Argumentative Structures
by: Sviridova, Ekaterina, et al.
Published: (2024)
by: Sviridova, Ekaterina, et al.
Published: (2024)
Performance of Large Language Models in Answering Critical Care Medicine Questions
by: Alwakeel, Mahmoud, et al.
Published: (2025)
by: Alwakeel, Mahmoud, et al.
Published: (2025)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
by: Tiwari, Utkarsh, et al.
Published: (2025)
by: Tiwari, Utkarsh, et al.
Published: (2025)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
by: Amjad, Husnain, et al.
Published: (2026)
by: Amjad, Husnain, et al.
Published: (2026)
Lost in Variation? Evaluating NLI Performance in Basque and Spanish Geographical Variants
by: Bengoetxea, Jaione, et al.
Published: (2025)
by: Bengoetxea, Jaione, et al.
Published: (2025)
To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks
by: Gong, Nanxu, et al.
Published: (2026)
by: Gong, Nanxu, et al.
Published: (2026)
Argument Mining in Data Scarce Settings: Cross-lingual Transfer and Few-shot Techniques
by: Yeginbergen, Anar, et al.
Published: (2024)
by: Yeginbergen, Anar, et al.
Published: (2024)
Political Leaning Inference through Plurinational Scenarios
by: de Landa, Joseba Fernandez, et al.
Published: (2024)
by: de Landa, Joseba Fernandez, et al.
Published: (2024)
UBench: Benchmarking Uncertainty in Large Language Models with Multiple Choice Questions
by: Wang, Xunzhi, et al.
Published: (2024)
by: Wang, Xunzhi, et al.
Published: (2024)
HalluScore: Large Language Model Hallucination Question Answering Benchmark
by: Alansari, Aisha, et al.
Published: (2026)
by: Alansari, Aisha, et al.
Published: (2026)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
by: Xu, Liuchang, et al.
Published: (2024)
by: Xu, Liuchang, et al.
Published: (2024)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
Large Language Models for Mathematical Reasoning: Progresses and Challenges
by: Ahn, Janice, et al.
Published: (2024)
by: Ahn, Janice, et al.
Published: (2024)
TaskBench: Benchmarking Large Language Models for Task Automation
by: Shen, Yongliang, et al.
Published: (2023)
by: Shen, Yongliang, et al.
Published: (2023)
Large Language Model Benchmarks in Medical Tasks
by: Yan, Lawrence K. Q., et al.
Published: (2024)
by: Yan, Lawrence K. Q., et al.
Published: (2024)
Similar Items
-
Critical Questions Generation: Motivation and Challenges
by: Figueras, Blanca Calvo, et al.
Published: (2024) -
Multilingual Medical Reasoning for Question Answering with Large Language Models
by: Ferrazzi, Pietro, et al.
Published: (2025) -
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
by: Alonso, Iñigo, et al.
Published: (2024) -
Dynamic Knowledge Integration for Evidence-Driven Counter-Argument Generation with Large Language Models
by: Yeginbergen, Anar, et al.
Published: (2025) -
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
by: Sanchez-Bayona, Elisa, et al.
Published: (2025)