Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ferguson, Nick, Guillou, Liane, Bundy, Alan, Nuamah, Kwabena |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task
von: Ferguson, Nick, et al.
Veröffentlicht: (2026)
von: Ferguson, Nick, et al.
Veröffentlicht: (2026)
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
von: Tang, Weizhi, et al.
Veröffentlicht: (2024)
Multilingual Medical Reasoning for Question Answering with Large Language Models
von: Ferrazzi, Pietro, et al.
Veröffentlicht: (2025)
von: Ferrazzi, Pietro, et al.
Veröffentlicht: (2025)
EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning
von: Wei, Mingyang, et al.
Veröffentlicht: (2026)
von: Wei, Mingyang, et al.
Veröffentlicht: (2026)
Answering Questions by Meta-Reasoning over Multiple Chains of Thought
von: Yoran, Ori, et al.
Veröffentlicht: (2023)
von: Yoran, Ori, et al.
Veröffentlicht: (2023)
ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
von: Wu, Yifan, et al.
Veröffentlicht: (2024)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
von: Sui, Yuan, et al.
Veröffentlicht: (2024)
von: Sui, Yuan, et al.
Veröffentlicht: (2024)
Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets
von: Xenofontos, Andreas, et al.
Veröffentlicht: (2026)
von: Xenofontos, Andreas, et al.
Veröffentlicht: (2026)
Evaluating Multimodal Large Language Models on Educational Textbook Question Answering
von: Alawwad, Hessa A., et al.
Veröffentlicht: (2025)
von: Alawwad, Hessa A., et al.
Veröffentlicht: (2025)
Uncertainty Estimation of Large Language Models in Medical Question Answering
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
THELMA: Task Based Holistic Evaluation of Large Language Model Applications-RAG Question Answering
von: Patel, Udita, et al.
Veröffentlicht: (2025)
von: Patel, Udita, et al.
Veröffentlicht: (2025)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
von: Mastrokostas, Charalampos, et al.
Veröffentlicht: (2026)
von: Mastrokostas, Charalampos, et al.
Veröffentlicht: (2026)
Collaboration among Multiple Large Language Models for Medical Question Answering
von: Shang, Kexin, et al.
Veröffentlicht: (2025)
von: Shang, Kexin, et al.
Veröffentlicht: (2025)
Cost-efficient Knowledge-based Question Answering with Large Language Models
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
von: Dong, Junnan, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models in Code Question Answering: Baselines and Issues
von: Andryushchenko, Georgy, et al.
Veröffentlicht: (2024)
von: Andryushchenko, Georgy, et al.
Veröffentlicht: (2024)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
von: Rogoz, Ana-Cristina, et al.
Veröffentlicht: (2025)
SQuARE: Sequential Question Answering Reasoning Engine for Enhanced Chain-of-Thought in Large Language Models
von: Fleischer, Daniel, et al.
Veröffentlicht: (2025)
von: Fleischer, Daniel, et al.
Veröffentlicht: (2025)
On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data
von: Ruiz, Alfredo Garrachón, et al.
Veröffentlicht: (2025)
von: Ruiz, Alfredo Garrachón, et al.
Veröffentlicht: (2025)
Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models
von: Yao, Jui-Ming, et al.
Veröffentlicht: (2025)
von: Yao, Jui-Ming, et al.
Veröffentlicht: (2025)
Lyria: A Genetic Algorithm-Driven Neuro-Symbolic Reasoning Framework for LLMs
von: Tang, Weizhi, et al.
Veröffentlicht: (2025)
von: Tang, Weizhi, et al.
Veröffentlicht: (2025)
A Survey of Large Language Model Agents for Question Answering
von: Yue, Murong
Veröffentlicht: (2025)
von: Yue, Murong
Veröffentlicht: (2025)
Seek and Solve Reasoning for Table Question Answering
von: Jiang, Ruya, et al.
Veröffentlicht: (2024)
von: Jiang, Ruya, et al.
Veröffentlicht: (2024)
Reasoning on Efficient Knowledge Paths:Knowledge Graph Guides Large Language Model for Domain Question Answering
von: Wang, Yuqi, et al.
Veröffentlicht: (2024)
von: Wang, Yuqi, et al.
Veröffentlicht: (2024)
Bactrainus: Optimizing Large Language Models for Multi-hop Complex Question Answering Tasks
von: Barati, Iman, et al.
Veröffentlicht: (2025)
von: Barati, Iman, et al.
Veröffentlicht: (2025)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
von: Ding, Jing, et al.
Veröffentlicht: (2025)
von: Ding, Jing, et al.
Veröffentlicht: (2025)
Reliable Academic Conference Question Answering: A Study Based on Large Language Model
von: Huang, Zhiwei, et al.
Veröffentlicht: (2023)
von: Huang, Zhiwei, et al.
Veröffentlicht: (2023)
Declarative Knowledge Distillation from Large Language Models for Visual Question Answering Datasets
von: Eiter, Thomas, et al.
Veröffentlicht: (2024)
von: Eiter, Thomas, et al.
Veröffentlicht: (2024)
Multi-Agents Based on Large Language Models for Knowledge-based Visual Question Answering
von: Hu, Zhongjian, et al.
Veröffentlicht: (2024)
von: Hu, Zhongjian, et al.
Veröffentlicht: (2024)
Enhancing Healthcare through Large Language Models: A Study on Medical Question Answering
von: Yu, Haoran, et al.
Veröffentlicht: (2024)
von: Yu, Haoran, et al.
Veröffentlicht: (2024)
Towards Building a Robust Knowledge Intensive Question Answering Model with Large Language Models
von: Hong, Xingyun, et al.
Veröffentlicht: (2024)
von: Hong, Xingyun, et al.
Veröffentlicht: (2024)
ReasoningLM: Enabling Structural Subgraph Reasoning in Pre-trained Language Models for Question Answering over Knowledge Graph
von: Jiang, Jinhao, et al.
Veröffentlicht: (2023)
von: Jiang, Jinhao, et al.
Veröffentlicht: (2023)
METER: Evaluating Multi-Level Contextual Causal Reasoning in Large Language Models
von: Li, Pengfeng, et al.
Veröffentlicht: (2026)
von: Li, Pengfeng, et al.
Veröffentlicht: (2026)
MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation
von: Bazoge, Adrien
Veröffentlicht: (2025)
von: Bazoge, Adrien
Veröffentlicht: (2025)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
von: Jamali, Naghmeh, et al.
Veröffentlicht: (2025)
von: Jamali, Naghmeh, et al.
Veröffentlicht: (2025)
Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answering
von: Adlakha, Vaibhav, et al.
Veröffentlicht: (2023)
von: Adlakha, Vaibhav, et al.
Veröffentlicht: (2023)
Multi-Hop Reasoning for Question Answering with Hyperbolic Representations
von: Welz, Simon, et al.
Veröffentlicht: (2025)
von: Welz, Simon, et al.
Veröffentlicht: (2025)
To Reason or Not to: Selective Chain-of-Thought in Medical Question Answering
von: Zhan, Zaifu, et al.
Veröffentlicht: (2026)
von: Zhan, Zaifu, et al.
Veröffentlicht: (2026)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Models
von: Gong, Zhaoyan, et al.
Veröffentlicht: (2025)
von: Gong, Zhaoyan, et al.
Veröffentlicht: (2025)
Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering
von: Long, Xiao, et al.
Veröffentlicht: (2025)
von: Long, Xiao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task
von: Ferguson, Nick, et al.
Veröffentlicht: (2026) -
LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models
von: Tang, Weizhi, et al.
Veröffentlicht: (2024) -
Multilingual Medical Reasoning for Question Answering with Large Language Models
von: Ferrazzi, Pietro, et al.
Veröffentlicht: (2025) -
EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning
von: Wei, Mingyang, et al.
Veröffentlicht: (2026) -
Answering Questions by Meta-Reasoning over Multiple Chains of Thought
von: Yoran, Ori, et al.
Veröffentlicht: (2023)