Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cohn, Anthony G, Blackwell, Robert E |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
par: Cohn, Anthony G, et autres
Publié: (2024)
par: Cohn, Anthony G, et autres
Publié: (2024)
Can Large Language Models Reason about the Region Connection Calculus?
par: Cohn, Anthony G, et autres
Publié: (2024)
par: Cohn, Anthony G, et autres
Publié: (2024)
Towards Reproducible LLM Evaluation: Quantifying Uncertainty in LLM Benchmark Scores
par: Blackwell, Robert E., et autres
Publié: (2024)
par: Blackwell, Robert E., et autres
Publié: (2024)
QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi
par: Cohn, Anthony G., et autres
Publié: (2026)
par: Cohn, Anthony G., et autres
Publié: (2026)
Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark
par: Li, Fangjun, et autres
Publié: (2024)
par: Li, Fangjun, et autres
Publié: (2024)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
par: Li, Fangjun, et autres
Publié: (2024)
par: Li, Fangjun, et autres
Publié: (2024)
What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
par: Yun, Tian, et autres
Publié: (2025)
par: Yun, Tian, et autres
Publié: (2025)
Disentangling Memory and Reasoning Ability in Large Language Models
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
Revisiting the Graph Reasoning Ability of Large Language Models: Case Studies in Translation, Connectivity and Shortest Path
par: Dai, Xinnan, et autres
Publié: (2024)
par: Dai, Xinnan, et autres
Publié: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
par: Zhu, Qin, et autres
Publié: (2025)
par: Zhu, Qin, et autres
Publié: (2025)
LLM-Coordination: Evaluating and Analyzing Multi-agent Coordination Abilities in Large Language Models
par: Agashe, Saaket, et autres
Publié: (2023)
par: Agashe, Saaket, et autres
Publié: (2023)
Graph-enhanced Large Language Models in Asynchronous Plan Reasoning
par: Lin, Fangru, et autres
Publié: (2024)
par: Lin, Fangru, et autres
Publié: (2024)
RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation
par: Diallo, Aissatou, et autres
Publié: (2025)
par: Diallo, Aissatou, et autres
Publié: (2025)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
par: Parmar, Mihir, et autres
Publié: (2024)
par: Parmar, Mihir, et autres
Publié: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
Distilling Reasoning Ability from Large Language Models with Adaptive Thinking
par: Chen, Xiaoshu, et autres
Publié: (2024)
par: Chen, Xiaoshu, et autres
Publié: (2024)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
par: Wan, Yuxuan, et autres
Publié: (2024)
par: Wan, Yuxuan, et autres
Publié: (2024)
ICLEval: Evaluating In-Context Learning Ability of Large Language Models
par: Chen, Wentong, et autres
Publié: (2024)
par: Chen, Wentong, et autres
Publié: (2024)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
par: Wang, Yajing, et autres
Publié: (2024)
par: Wang, Yajing, et autres
Publié: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
par: Gu, Zhouhong, et autres
Publié: (2024)
par: Gu, Zhouhong, et autres
Publié: (2024)
FEABench: Evaluating Language Models on Multiphysics Reasoning Ability
par: Mudur, Nayantara, et autres
Publié: (2025)
par: Mudur, Nayantara, et autres
Publié: (2025)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
par: Jo, Hwiyeol, et autres
Publié: (2025)
par: Jo, Hwiyeol, et autres
Publié: (2025)
Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability
par: Sakai, Yusuke, et autres
Publié: (2025)
par: Sakai, Yusuke, et autres
Publié: (2025)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
par: Lee, Janghwan, et autres
Publié: (2024)
par: Lee, Janghwan, et autres
Publié: (2024)
Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts
par: Bandarkar, Lucas, et autres
Publié: (2026)
par: Bandarkar, Lucas, et autres
Publié: (2026)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
par: Zhan, Xiaoyu, et autres
Publié: (2025)
par: Zhan, Xiaoyu, et autres
Publié: (2025)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
par: Jin, Haibo, et autres
Publié: (2025)
par: Jin, Haibo, et autres
Publié: (2025)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
par: Patel, Nisarg, et autres
Publié: (2024)
par: Patel, Nisarg, et autres
Publié: (2024)
A Survey on Enhancing Causal Reasoning Ability of Large Language Models
par: Li, Xin, et autres
Publié: (2025)
par: Li, Xin, et autres
Publié: (2025)
Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models
par: Klisura, Đorđe, et autres
Publié: (2025)
par: Klisura, Đorđe, et autres
Publié: (2025)
Reasoning Abilities of Large Language Models: In-Depth Analysis on the Abstraction and Reasoning Corpus
par: Lee, Seungpil, et autres
Publié: (2024)
par: Lee, Seungpil, et autres
Publié: (2024)
Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models
par: Hagendorff, Thilo, et autres
Publié: (2025)
par: Hagendorff, Thilo, et autres
Publié: (2025)
Code-Driven Inductive Synthesis: Enhancing Reasoning Abilities of Large Language Models with Sequences
par: Chen, Kedi, et autres
Publié: (2025)
par: Chen, Kedi, et autres
Publié: (2025)
Optimizing Language Model's Reasoning Abilities with Weak Supervision
par: Tong, Yongqi, et autres
Publié: (2024)
par: Tong, Yongqi, et autres
Publié: (2024)
Evaluation of Instruction-Following Ability for Large Language Models on Story-Ending Generation
par: Hida, Rem, et autres
Publié: (2024)
par: Hida, Rem, et autres
Publié: (2024)
Can Large Language Models Generalize Procedures Across Representations?
par: Lin, Fangru, et autres
Publié: (2026)
par: Lin, Fangru, et autres
Publié: (2026)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
par: Wang, Weiqi, et autres
Publié: (2024)
par: Wang, Weiqi, et autres
Publié: (2024)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning
par: Yu, Yahan, et autres
Publié: (2026)
par: Yu, Yahan, et autres
Publié: (2026)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
par: Costarelli, Anthony, et autres
Publié: (2024)
par: Costarelli, Anthony, et autres
Publié: (2024)
Documents similaires
-
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions
par: Cohn, Anthony G, et autres
Publié: (2024) -
Can Large Language Models Reason about the Region Connection Calculus?
par: Cohn, Anthony G, et autres
Publié: (2024) -
Towards Reproducible LLM Evaluation: Quantifying Uncertainty in LLM Benchmark Scores
par: Blackwell, Robert E., et autres
Publié: (2024) -
QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi
par: Cohn, Anthony G., et autres
Publié: (2026) -
Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark
par: Li, Fangjun, et autres
Publié: (2024)