Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Fangzhi, Lin, Qika, Han, Jiawei, Zhao, Tianzhe, Liu, Jun, Cambria, Erik |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PathReasoner: Modeling Reasoning Path with Equivalent Extension for Logical Question Answering
by: Xu, Fangzhi, et al.
Published: (2024)
by: Xu, Fangzhi, et al.
Published: (2024)
Self-supervised Quantized Representation for Seamlessly Integrating Knowledge Graphs with Large Language Models
by: Lin, Qika, et al.
Published: (2025)
by: Lin, Qika, et al.
Published: (2025)
Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method
by: Zhao, Tianzhe, et al.
Published: (2026)
by: Zhao, Tianzhe, et al.
Published: (2026)
Towards Unified Neurosymbolic Reasoning on Knowledge Graphs
by: Lin, Qika, et al.
Published: (2025)
by: Lin, Qika, et al.
Published: (2025)
A Semantic Mention Graph Augmented Model for Document-Level Event Argument Extraction
by: Zhang, Jian, et al.
Published: (2024)
by: Zhang, Jian, et al.
Published: (2024)
Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models
by: Xu, Fangzhi, et al.
Published: (2023)
by: Xu, Fangzhi, et al.
Published: (2023)
A Survey of Quantized Graph Representation Learning: Connecting Graph Structures with Large Language Models
by: Lin, Qika, et al.
Published: (2025)
by: Lin, Qika, et al.
Published: (2025)
Logical Reasoning over Natural Language as Knowledge Representation: A Survey
by: Yang, Zonglin, et al.
Published: (2023)
by: Yang, Zonglin, et al.
Published: (2023)
MAPS: Multi-Agent Personality Shaping for Collaborative Reasoning
by: Zhang, Jian, et al.
Published: (2025)
by: Zhang, Jian, et al.
Published: (2025)
MARS: Multi-Agent Adaptive Reasoning with Socratic Guidance for Automated Prompt Optimization
by: Zhang, Jian, et al.
Published: (2025)
by: Zhang, Jian, et al.
Published: (2025)
$ϕ$-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitation
by: Xu, Fangzhi, et al.
Published: (2025)
by: Xu, Fangzhi, et al.
Published: (2025)
A Systematic Analysis of Biases in Large Language Models
by: Zhang, Xulang, et al.
Published: (2025)
by: Zhang, Xulang, et al.
Published: (2025)
Language Models as Inductive Reasoners
by: Yang, Zonglin, et al.
Published: (2022)
by: Yang, Zonglin, et al.
Published: (2022)
Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
by: Prakash, Nirmalendu, et al.
Published: (2025)
by: Prakash, Nirmalendu, et al.
Published: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
by: liu, Hanmeng, et al.
Published: (2023)
by: liu, Hanmeng, et al.
Published: (2023)
A Comprehensive Evaluation on Event Reasoning of Large Language Models
by: Tao, Zhengwei, et al.
Published: (2024)
by: Tao, Zhengwei, et al.
Published: (2024)
What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code
by: Zhao, Yuze, et al.
Published: (2026)
by: Zhao, Yuze, et al.
Published: (2026)
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
by: Xu, Fangzhi, et al.
Published: (2024)
by: Xu, Fangzhi, et al.
Published: (2024)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
by: Bhatia, Gagan, et al.
Published: (2026)
by: Bhatia, Gagan, et al.
Published: (2026)
Learning First-Order Rules with Relational Path Contrast for Inductive Relation Reasoning
by: Pan, Yudai, et al.
Published: (2021)
by: Pan, Yudai, et al.
Published: (2021)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
by: Parmar, Mihir, et al.
Published: (2024)
by: Parmar, Mihir, et al.
Published: (2024)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
by: Malik, Saumya
Published: (2024)
by: Malik, Saumya
Published: (2024)
Toward Clinically Explainable AI for Medical Diagnosis: A Foundation Model with Human-Compatible Reasoning via Reinforcement Learning
by: Lin, Qika, et al.
Published: (2025)
by: Lin, Qika, et al.
Published: (2025)
Logical Reasoning in Large Language Models: A Survey
by: Liu, Hanmeng, et al.
Published: (2025)
by: Liu, Hanmeng, et al.
Published: (2025)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
by: Xu, Hainiu, et al.
Published: (2024)
by: Xu, Hainiu, et al.
Published: (2024)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
by: Yang, Zonglin, et al.
Published: (2023)
by: Yang, Zonglin, et al.
Published: (2023)
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
by: Zhang, Ran, et al.
Published: (2024)
by: Zhang, Ran, et al.
Published: (2024)
Structured Chemistry Reasoning with Large Language Models
by: Ouyang, Siru, et al.
Published: (2023)
by: Ouyang, Siru, et al.
Published: (2023)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
by: Chung, Tsz Ting, et al.
Published: (2025)
by: Chung, Tsz Ting, et al.
Published: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
by: Wang, Yiqi, et al.
Published: (2024)
by: Wang, Yiqi, et al.
Published: (2024)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
by: Liu, Junteng, et al.
Published: (2025)
by: Liu, Junteng, et al.
Published: (2025)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
by: Chen, Michael K., et al.
Published: (2025)
by: Chen, Michael K., et al.
Published: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
by: Li, Ce, et al.
Published: (2025)
by: Li, Ce, et al.
Published: (2025)
Empowering LLMs with Logical Reasoning: A Comprehensive Survey
by: Cheng, Fengxiang, et al.
Published: (2025)
by: Cheng, Fengxiang, et al.
Published: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
Deriving Strategic Market Insights with Large Language Models: A Benchmark for Forward Counterfactual Generation
by: Ong, Keane, et al.
Published: (2025)
by: Ong, Keane, et al.
Published: (2025)
GenRES: Rethinking Evaluation for Generative Relation Extraction in the Era of Large Language Models
by: Jiang, Pengcheng, et al.
Published: (2024)
by: Jiang, Pengcheng, et al.
Published: (2024)
Beyond Specialization: Benchmarking LLMs for Transliteration of Indian Languages
by: Azam, Gulfarogh, et al.
Published: (2025)
by: Azam, Gulfarogh, et al.
Published: (2025)
Are Large Reasoning Models Good Translation Evaluators? Analysis and Performance Boost
by: Zhan, Runzhe, et al.
Published: (2025)
by: Zhan, Runzhe, et al.
Published: (2025)
Similar Items
-
PathReasoner: Modeling Reasoning Path with Equivalent Extension for Logical Question Answering
by: Xu, Fangzhi, et al.
Published: (2024) -
Self-supervised Quantized Representation for Seamlessly Integrating Knowledge Graphs with Large Language Models
by: Lin, Qika, et al.
Published: (2025) -
Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method
by: Zhao, Tianzhe, et al.
Published: (2026) -
Towards Unified Neurosymbolic Reasoning on Knowledge Graphs
by: Lin, Qika, et al.
Published: (2025) -
A Semantic Mention Graph Augmented Model for Document-Level Event Argument Extraction
by: Zhang, Jian, et al.
Published: (2024)