Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Mondorf, Philipp, Plank, Barbara |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
di: Rabern, Brian, et al.
Pubblicazione: (2026)
di: Rabern, Brian, et al.
Pubblicazione: (2026)
The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate It
di: Bertolazzi, Leonardo, et al.
Pubblicazione: (2025)
di: Bertolazzi, Leonardo, et al.
Pubblicazione: (2025)
Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Tracing Uncertainty in Language Model "Reasoning"
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)
If Probable, Then Acceptable? Understanding Conditional Acceptability Judgments in Large Language Models
di: Orth, Jasmin, et al.
Pubblicazione: (2025)
di: Orth, Jasmin, et al.
Pubblicazione: (2025)
Circuit Compositions: Exploring Modular Structures in Transformer-Based Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
Reasoning that Travels: Dissecting How Chain-of-Thought Transfers Across Models
di: Cheng, Xinyuan, et al.
Pubblicazione: (2026)
di: Cheng, Xinyuan, et al.
Pubblicazione: (2026)
Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
di: Mondorf, Philipp, et al.
Pubblicazione: (2025)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
di: Xu, Fangzhi, et al.
Pubblicazione: (2023)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
di: Xu, Fengli, et al.
Pubblicazione: (2025)
di: Xu, Fengli, et al.
Pubblicazione: (2025)
A Survey on Large Language Models for Mathematical Reasoning
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
di: Wang, Peng-Yuan, et al.
Pubblicazione: (2025)
Logical Reasoning in Large Language Models: A Survey
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
di: Liu, Hanmeng, et al.
Pubblicazione: (2025)
A Survey of Inductive Reasoning for Large Language Models
di: Chen, Kedi, et al.
Pubblicazione: (2025)
di: Chen, Kedi, et al.
Pubblicazione: (2025)
Benchmarking the Capabilities of Large Language Models in Transportation System Engineering: Accuracy, Consistency, and Reasoning Behaviors
di: Syed, Usman, et al.
Pubblicazione: (2024)
di: Syed, Usman, et al.
Pubblicazione: (2024)
A Survey on Evaluation of Large Language Models
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
di: Li, Jindong, et al.
Pubblicazione: (2025)
di: Li, Jindong, et al.
Pubblicazione: (2025)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
di: Malghan, Arjun R.
Pubblicazione: (2025)
di: Malghan, Arjun R.
Pubblicazione: (2025)
Puzzle Solving using Reasoning of Large Language Models: A Survey
di: Giadikiaroglou, Panagiotis, et al.
Pubblicazione: (2024)
di: Giadikiaroglou, Panagiotis, et al.
Pubblicazione: (2024)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
di: Li, Xin, et al.
Pubblicazione: (2025)
di: Li, Xin, et al.
Pubblicazione: (2025)
Medical Reasoning with Large Language Models: A Survey and MR-Bench
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
di: Ren, Xiaohan, et al.
Pubblicazione: (2026)
Beyond the Speculative Game: A Survey of Speculative Execution in Large Language Models
di: Zhang, Chen, et al.
Pubblicazione: (2024)
di: Zhang, Chen, et al.
Pubblicazione: (2024)
Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
di: Chen, Qiguang, et al.
Pubblicazione: (2025)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
di: Tao, Zhengwei, et al.
Pubblicazione: (2024)
Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology
di: D'Amario, Vanessa, et al.
Pubblicazione: (2025)
di: D'Amario, Vanessa, et al.
Pubblicazione: (2025)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
di: Li, Yubo, et al.
Pubblicazione: (2025)
di: Li, Yubo, et al.
Pubblicazione: (2025)
Beyond the Sentence: A Survey on Context-Aware Machine Translation with Large Language Models
di: Appicharla, Ramakrishna, et al.
Pubblicazione: (2025)
di: Appicharla, Ramakrishna, et al.
Pubblicazione: (2025)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
di: Saxena, Yash, et al.
Pubblicazione: (2024)
di: Saxena, Yash, et al.
Pubblicazione: (2024)
Mind the Uncertainty in Human Disagreement: Evaluating Discrepancies between Model Predictions and Human Responses in VQA
di: Lan, Jian, et al.
Pubblicazione: (2024)
di: Lan, Jian, et al.
Pubblicazione: (2024)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
di: Hao, Yijie, et al.
Pubblicazione: (2025)
di: Hao, Yijie, et al.
Pubblicazione: (2025)
Evaluating the Feasibility and Accuracy of Large Language Models for Medical History-Taking in Obstetrics and Gynecology
di: Liu, Dou, et al.
Pubblicazione: (2025)
di: Liu, Dou, et al.
Pubblicazione: (2025)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
di: He, Zhenghao, et al.
Pubblicazione: (2026)
di: He, Zhenghao, et al.
Pubblicazione: (2026)
Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior
di: Si, Shengyun, et al.
Pubblicazione: (2025)
di: Si, Shengyun, et al.
Pubblicazione: (2025)
Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
Beyond Lines and Circles: Unveiling the Geometric Reasoning Gap in Large Language Models
di: Mouselinos, Spyridon, et al.
Pubblicazione: (2024)
di: Mouselinos, Spyridon, et al.
Pubblicazione: (2024)
A Survey on Feedback-based Multi-step Reasoning for Large Language Models on Mathematics
di: Wei, Ting-Ruen, et al.
Pubblicazione: (2025)
di: Wei, Ting-Ruen, et al.
Pubblicazione: (2025)
Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning
di: Mondorf, Philipp, et al.
Pubblicazione: (2024) -
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
di: Rabern, Brian, et al.
Pubblicazione: (2026) -
The Validation Gap: A Mechanistic Analysis of How Language Models Compute Arithmetic but Fail to Validate It
di: Bertolazzi, Leonardo, et al.
Pubblicazione: (2025) -
Liar, Liar, Logical Mire: A Benchmark for Suppositional Reasoning in Large Language Models
di: Mondorf, Philipp, et al.
Pubblicazione: (2024) -
Tracing Uncertainty in Language Model "Reasoning"
di: Grünefeld, Nils, et al.
Pubblicazione: (2026)