Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Malik, Saumya |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
par: Parmar, Mihir, et autres
Publié: (2024)
par: Parmar, Mihir, et autres
Publié: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
par: liu, Hanmeng, et autres
Publié: (2023)
par: liu, Hanmeng, et autres
Publié: (2023)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
par: Hua, Wenyue, et autres
Publié: (2024)
par: Hua, Wenyue, et autres
Publié: (2024)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
par: Wan, Yuxuan, et autres
Publié: (2024)
par: Wan, Yuxuan, et autres
Publié: (2024)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
par: Li, Yanda, et autres
Publié: (2024)
par: Li, Yanda, et autres
Publié: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
Logical Reasoning in Large Language Models: A Survey
par: Liu, Hanmeng, et autres
Publié: (2025)
par: Liu, Hanmeng, et autres
Publié: (2025)
Assessing Logical Reasoning Capabilities of Encoder-Only Transformer Models
par: Pirozelli, Paulo, et autres
Publié: (2023)
par: Pirozelli, Paulo, et autres
Publié: (2023)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
par: Xu, Fangzhi, et autres
Publié: (2023)
par: Xu, Fangzhi, et autres
Publié: (2023)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
par: Jiang, Jin, et autres
Publié: (2025)
par: Jiang, Jin, et autres
Publié: (2025)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
par: Patel, Nisarg, et autres
Publié: (2024)
par: Patel, Nisarg, et autres
Publié: (2024)
LogicTree: Structured Proof Exploration for Coherent and Rigorous Logical Reasoning with Large Language Models
par: He, Kang, et autres
Publié: (2025)
par: He, Kang, et autres
Publié: (2025)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
par: Saxena, Yash, et autres
Publié: (2024)
par: Saxena, Yash, et autres
Publié: (2024)
Logic Contrastive Reasoning with Lightweight Large Language Model for Math Word Problems
par: Kai, Ding, et autres
Publié: (2024)
par: Kai, Ding, et autres
Publié: (2024)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
par: Chen, Jiangjie, et autres
Publié: (2025)
par: Chen, Jiangjie, et autres
Publié: (2025)
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
par: Rabern, Brian, et autres
Publié: (2026)
par: Rabern, Brian, et autres
Publié: (2026)
Towards LogiGLUE: A Brief Survey and A Benchmark for Analyzing Logical Reasoning Capabilities of Language Models
par: Luo, Man, et autres
Publié: (2023)
par: Luo, Man, et autres
Publié: (2023)
Improving Symbolic Translation of Language Models for Logical Reasoning
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2026)
par: Thatikonda, Ramya Keerthy, et autres
Publié: (2026)
LINC: A Neurosymbolic Approach for Logical Reasoning by Combining Language Models with First-Order Logic Provers
par: Olausson, Theo X., et autres
Publié: (2023)
par: Olausson, Theo X., et autres
Publié: (2023)
ChatRule: Mining Logical Rules with Large Language Models for Knowledge Graph Reasoning
par: Luo, Linhao, et autres
Publié: (2023)
par: Luo, Linhao, et autres
Publié: (2023)
A Closer Look at the Self-Verification Abilities of Large Language Models in Logical Reasoning
par: Hong, Ruixin, et autres
Publié: (2023)
par: Hong, Ruixin, et autres
Publié: (2023)
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
par: Bao, Qiming, et autres
Publié: (2023)
par: Bao, Qiming, et autres
Publié: (2023)
Transformer-based Language Models for Reasoning in the Description Logic ALCQ
par: Poulis, Angelos, et autres
Publié: (2024)
par: Poulis, Angelos, et autres
Publié: (2024)
Language Models and Logic Programs for Trustworthy Tax Reasoning
par: Jurayj, William, et autres
Publié: (2025)
par: Jurayj, William, et autres
Publié: (2025)
CLOMO: Counterfactual Logical Modification with Large Language Models
par: Huang, Yinya, et autres
Publié: (2023)
par: Huang, Yinya, et autres
Publié: (2023)
Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives
par: Ozeki, Kentaro, et autres
Publié: (2025)
par: Ozeki, Kentaro, et autres
Publié: (2025)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
par: Chen, Michael K., et autres
Publié: (2025)
par: Chen, Michael K., et autres
Publié: (2025)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
par: Bruun, Sofie Helene, et autres
Publié: (2025)
par: Bruun, Sofie Helene, et autres
Publié: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
par: Liu, Junteng, et autres
Publié: (2025)
par: Liu, Junteng, et autres
Publié: (2025)
ReportLogic: Evaluating Logical Quality in Deep Research Reports
par: Zhao, Jujia, et autres
Publié: (2026)
par: Zhao, Jujia, et autres
Publié: (2026)
Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing
par: Świechowski, Maciej, et autres
Publié: (2026)
par: Świechowski, Maciej, et autres
Publié: (2026)
Abstract Meaning Representation-Based Logic-Driven Data Augmentation for Logical Reasoning
par: Bao, Qiming, et autres
Publié: (2023)
par: Bao, Qiming, et autres
Publié: (2023)
Evaluating Interventional Reasoning Capabilities of Large Language Models
par: Kasetty, Tejas, et autres
Publié: (2024)
par: Kasetty, Tejas, et autres
Publié: (2024)
Do Large Language Models Understand Logic or Just Mimick Context?
par: Yan, Junbing, et autres
Publié: (2024)
par: Yan, Junbing, et autres
Publié: (2024)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
Towards Logically Sound Natural Language Reasoning with Logic-Enhanced Language Model Agents
par: Mensfelt, Agnieszka, et autres
Publié: (2024)
par: Mensfelt, Agnieszka, et autres
Publié: (2024)
Reasoning Capabilities of Large Language Models on Dynamic Tasks
par: Wong, Annie, et autres
Publié: (2025)
par: Wong, Annie, et autres
Publié: (2025)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
par: Huang, Xu, et autres
Publié: (2024)
par: Huang, Xu, et autres
Publié: (2024)
Documents similaires
-
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
par: Parmar, Mihir, et autres
Publié: (2024) -
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024) -
GLoRE: Evaluating Logical Reasoning of Large Language Models
par: liu, Hanmeng, et autres
Publié: (2023) -
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
par: Hua, Wenyue, et autres
Publié: (2024) -
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
par: Wan, Yuxuan, et autres
Publié: (2024)