Evaluating the Logical Reasoning Abilities of Large Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Hanmeng, Ding, Yiran, Fu, Zhizhang, Zhang, Chaoli, Liu, Xiaozhang, Zhang, Yue |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Logical Reasoning in Large Language Models: A Survey
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
von: liu, Hanmeng, et al.
Veröffentlicht: (2023)
Break the Chain: Large Language Models Can be Shortcut Reasoners
von: Ding, Mengru, et al.
Veröffentlicht: (2024)
von: Ding, Mengru, et al.
Veröffentlicht: (2024)
ReEfBench: Quantifying the Reasoning Efficiency of LLMs
von: Fu, Zhizhang, et al.
Veröffentlicht: (2026)
von: Fu, Zhizhang, et al.
Veröffentlicht: (2026)
Logic Agent: Enhancing Validity with Logic Rule Invocation
von: Liu, Hanmeng, et al.
Veröffentlicht: (2024)
von: Liu, Hanmeng, et al.
Veröffentlicht: (2024)
GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation
von: Weng, Shichao, et al.
Veröffentlicht: (2025)
von: Weng, Shichao, et al.
Veröffentlicht: (2025)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
von: Hong, Ruixin, et al.
Veröffentlicht: (2023)
von: Hong, Ruixin, et al.
Veröffentlicht: (2023)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
von: Wan, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wan, Yuxuan, et al.
Veröffentlicht: (2024)
Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
von: FU, Zhizhang, et al.
Veröffentlicht: (2025)
von: FU, Zhizhang, et al.
Veröffentlicht: (2025)
ChatLogic: Integrating Logic Programming with Large Language Models for Multi-Step Reasoning
von: Wang, Zhongsheng, et al.
Veröffentlicht: (2024)
von: Wang, Zhongsheng, et al.
Veröffentlicht: (2024)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
von: Patel, Nisarg, et al.
Veröffentlicht: (2024)
von: Patel, Nisarg, et al.
Veröffentlicht: (2024)
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation
von: Liu, Ming, et al.
Veröffentlicht: (2025)
von: Liu, Ming, et al.
Veröffentlicht: (2025)
Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
von: Xu, Sen, et al.
Veröffentlicht: (2025)
von: Xu, Sen, et al.
Veröffentlicht: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
von: Liu, Jiacai, et al.
Veröffentlicht: (2024)
von: Liu, Jiacai, et al.
Veröffentlicht: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
von: Chung, Tsz Ting, et al.
Veröffentlicht: (2025)
von: Chung, Tsz Ting, et al.
Veröffentlicht: (2025)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
von: Liu, Junteng, et al.
Veröffentlicht: (2025)
von: Liu, Junteng, et al.
Veröffentlicht: (2025)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
von: Xu, Fangzhi, et al.
Veröffentlicht: (2023)
von: Xu, Fangzhi, et al.
Veröffentlicht: (2023)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
von: Yuan, Jiakang, et al.
Veröffentlicht: (2025)
von: Yuan, Jiakang, et al.
Veröffentlicht: (2025)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
von: Malik, Saumya
Veröffentlicht: (2024)
von: Malik, Saumya
Veröffentlicht: (2024)
PricingLogic: Evaluating LLMs Reasoning on Complex Tourism Pricing Tasks
von: Liu, Yunuo, et al.
Veröffentlicht: (2025)
von: Liu, Yunuo, et al.
Veröffentlicht: (2025)
MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models
von: Ma, Siqi, et al.
Veröffentlicht: (2025)
von: Ma, Siqi, et al.
Veröffentlicht: (2025)
Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
von: Li, Tianle, et al.
Veröffentlicht: (2025)
von: Li, Tianle, et al.
Veröffentlicht: (2025)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
von: Jiang, Jin, et al.
Veröffentlicht: (2025)
von: Jiang, Jin, et al.
Veröffentlicht: (2025)
Logic Contrastive Reasoning with Lightweight Large Language Model for Math Word Problems
von: Kai, Ding, et al.
Veröffentlicht: (2024)
von: Kai, Ding, et al.
Veröffentlicht: (2024)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
von: Ying, Yuchen, et al.
Veröffentlicht: (2026)
von: Ying, Yuchen, et al.
Veröffentlicht: (2026)
Evaluating Robustness of Reasoning Models on Parameterized Logical Problems
von: Es-sebbani, Naïm, et al.
Veröffentlicht: (2026)
von: Es-sebbani, Naïm, et al.
Veröffentlicht: (2026)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
von: Jin, Haibo, et al.
Veröffentlicht: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
von: Zhang, Junkai, et al.
Veröffentlicht: (2025)
Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning
von: Tian, Chang, et al.
Veröffentlicht: (2025)
von: Tian, Chang, et al.
Veröffentlicht: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
von: Lu, Leo, et al.
Veröffentlicht: (2025)
von: Lu, Leo, et al.
Veröffentlicht: (2025)
On Reasoning Strength Planning in Large Reasoning Models
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
von: Sheng, Leheng, et al.
Veröffentlicht: (2025)
FEABench: Evaluating Language Models on Multiphysics Reasoning Ability
von: Mudur, Nayantara, et al.
Veröffentlicht: (2025)
von: Mudur, Nayantara, et al.
Veröffentlicht: (2025)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
von: Wang, Yiqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Logical Reasoning in Large Language Models: A Survey
von: Liu, Hanmeng, et al.
Veröffentlicht: (2025) -
GLoRE: Evaluating Logical Reasoning of Large Language Models
von: liu, Hanmeng, et al.
Veröffentlicht: (2023) -
Break the Chain: Large Language Models Can be Shortcut Reasoners
von: Ding, Mengru, et al.
Veröffentlicht: (2024) -
ReEfBench: Quantifying the Reasoning Efficiency of LLMs
von: Fu, Zhizhang, et al.
Veröffentlicht: (2026) -
Logic Agent: Enhancing Validity with Logic Rule Invocation
von: Liu, Hanmeng, et al.
Veröffentlicht: (2024)