Large Language Models and Mathematical Reasoning Failures
Fuente:
arXiv
Guardado en:
| Autores principales: | Boye, Johan, Moell, Birger |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Complexity Measurement as a Noisy Zero-Shot Proxy for Evaluating LLM Performance
por: Moell, Birger, et al.
Publicado: (2025)
por: Moell, Birger, et al.
Publicado: (2025)
Evaluating Large Language Models with Human Feedback: Establishing a Swedish Benchmark
por: Moell, Birger
Publicado: (2024)
por: Moell, Birger
Publicado: (2024)
Comparing the Efficacy of GPT-4 and Chat-GPT in Mental Health Care: A Blind Assessment of Large Language Models for Psychological Support
por: Moell, Birger
Publicado: (2024)
por: Moell, Birger
Publicado: (2024)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
por: Moell, Birger, et al.
Publicado: (2025)
por: Moell, Birger, et al.
Publicado: (2025)
The order in speech disorder: a scoping review of state of the art machine learning methods for clinical speech classification
por: Moell, Birger, et al.
Publicado: (2025)
por: Moell, Birger, et al.
Publicado: (2025)
Mathematical Computation and Reasoning Errors by Large Language Models
por: Zhang, Liang, et al.
Publicado: (2025)
por: Zhang, Liang, et al.
Publicado: (2025)
Mathematical Proof as a Litmus Test: Revealing Failure Modes of Advanced Large Reasoning Models
por: Guo, Dadi, et al.
Publicado: (2025)
por: Guo, Dadi, et al.
Publicado: (2025)
Large Language Model Reasoning Failures
por: Song, Peiyang, et al.
Publicado: (2026)
por: Song, Peiyang, et al.
Publicado: (2026)
Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
por: Lu, Leo, et al.
Publicado: (2025)
por: Lu, Leo, et al.
Publicado: (2025)
A Survey on Mathematical Reasoning and Optimization with Large Language Models
por: Forootani, Ali
Publicado: (2025)
por: Forootani, Ali
Publicado: (2025)
GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models
por: Wang, Zhijie
Publicado: (2026)
por: Wang, Zhijie
Publicado: (2026)
Dissecting Failure Dynamics in Large Language Model Reasoning
por: Zhu, Wei, et al.
Publicado: (2026)
por: Zhu, Wei, et al.
Publicado: (2026)
A Survey on Large Language Models for Mathematical Reasoning
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning
por: Zhao, Jun, et al.
Publicado: (2024)
por: Zhao, Jun, et al.
Publicado: (2024)
Artificial Humans
por: Moell, Birger
Publicado: (2025)
por: Moell, Birger
Publicado: (2025)
Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
por: Sun, Zhishen, et al.
Publicado: (2025)
por: Sun, Zhishen, et al.
Publicado: (2025)
M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models
por: Wang, Junjian, et al.
Publicado: (2026)
por: Wang, Junjian, et al.
Publicado: (2026)
Enhancing Mathematical Reasoning in Large Language Models with Self-Consistency-Based Hallucination Detection
por: Liu, MingShan, et al.
Publicado: (2025)
por: Liu, MingShan, et al.
Publicado: (2025)
CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
por: Zan, Lei, et al.
Publicado: (2025)
por: Zan, Lei, et al.
Publicado: (2025)
Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning
por: Pawar, Pranav, et al.
Publicado: (2025)
por: Pawar, Pranav, et al.
Publicado: (2025)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
por: Yu, Zhouliang, et al.
Publicado: (2025)
por: Yu, Zhouliang, et al.
Publicado: (2025)
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
por: Mirzadeh, Iman, et al.
Publicado: (2024)
por: Mirzadeh, Iman, et al.
Publicado: (2024)
Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model
por: Zhu, Xunyu, et al.
Publicado: (2024)
por: Zhu, Xunyu, et al.
Publicado: (2024)
MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models
por: Peng, Shuai, et al.
Publicado: (2024)
por: Peng, Shuai, et al.
Publicado: (2024)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
por: Zhao, Zilong, et al.
Publicado: (2024)
por: Zhao, Zilong, et al.
Publicado: (2024)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
por: Jiang, Weisen, et al.
Publicado: (2023)
por: Jiang, Weisen, et al.
Publicado: (2023)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
por: Zhang, Xiao, et al.
Publicado: (2026)
por: Zhang, Xiao, et al.
Publicado: (2026)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
por: Amjad, Husnain, et al.
Publicado: (2026)
por: Amjad, Husnain, et al.
Publicado: (2026)
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
por: Camposampiero, Giacomo, et al.
Publicado: (2025)
por: Camposampiero, Giacomo, et al.
Publicado: (2025)
LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning
por: Wang, Shu, et al.
Publicado: (2024)
por: Wang, Shu, et al.
Publicado: (2024)
A Survey on Feedback-based Multi-step Reasoning for Large Language Models on Mathematics
por: Wei, Ting-Ruen, et al.
Publicado: (2025)
por: Wei, Ting-Ruen, et al.
Publicado: (2025)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
por: Kim, Hyeonwoo, et al.
Publicado: (2024)
From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models
por: Mishra, Shubhra, et al.
Publicado: (2024)
por: Mishra, Shubhra, et al.
Publicado: (2024)
Large Language Models for Mathematical Analysis
por: Chen, Ziye, et al.
Publicado: (2024)
por: Chen, Ziye, et al.
Publicado: (2024)
Large Language Model enabled Mathematical Modeling
por: Zhang, Guoyun
Publicado: (2025)
por: Zhang, Guoyun
Publicado: (2025)
Distilling Mathematical Reasoning Capabilities into Small Language Models
por: Zhu, Xunyu, et al.
Publicado: (2024)
por: Zhu, Xunyu, et al.
Publicado: (2024)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?
por: Niyogi, Mitodru, et al.
Publicado: (2024)
por: Niyogi, Mitodru, et al.
Publicado: (2024)
LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning
por: Agarwal, Shradha, et al.
Publicado: (2026)
por: Agarwal, Shradha, et al.
Publicado: (2026)
Ejemplares similares
-
Language Complexity Measurement as a Noisy Zero-Shot Proxy for Evaluating LLM Performance
por: Moell, Birger, et al.
Publicado: (2025) -
Evaluating Large Language Models with Human Feedback: Establishing a Swedish Benchmark
por: Moell, Birger
Publicado: (2024) -
Comparing the Efficacy of GPT-4 and Chat-GPT in Mental Health Care: A Blind Assessment of Large Language Models for Psychological Support
por: Moell, Birger
Publicado: (2024) -
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
por: Moell, Birger, et al.
Publicado: (2025) -
The order in speech disorder: a scoping review of state of the art machine learning methods for clinical speech classification
por: Moell, Birger, et al.
Publicado: (2025)