Mathematical Reasoning in Large Language Models: Assessing Logical and Arithmetic Errors across Wide Numerical Ranges
Fuente:
arXiv
Salvato in:
| Autori principali: | Shrestha, Safal, Kim, Minwu, Ross, Keith |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning
di: Kim, Minwu, et al.
Pubblicazione: (2026)
di: Kim, Minwu, et al.
Pubblicazione: (2026)
On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
di: Shrestha, Safal, et al.
Pubblicazione: (2026)
di: Shrestha, Safal, et al.
Pubblicazione: (2026)
Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
di: Kim, Minwu, et al.
Pubblicazione: (2025)
di: Kim, Minwu, et al.
Pubblicazione: (2025)
Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings
di: Shrestha, Safal, et al.
Pubblicazione: (2025)
di: Shrestha, Safal, et al.
Pubblicazione: (2025)
Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training
di: Nepal, Aadim, et al.
Pubblicazione: (2025)
di: Nepal, Aadim, et al.
Pubblicazione: (2025)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
di: Li, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2024)
Integrating Arithmetic Learning Improves Mathematical Reasoning in Smaller Models
di: Gangwar, Neeraj, et al.
Pubblicazione: (2025)
di: Gangwar, Neeraj, et al.
Pubblicazione: (2025)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
di: Feng, Guhao, et al.
Pubblicazione: (2024)
di: Feng, Guhao, et al.
Pubblicazione: (2024)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
di: Zhao, Zilong, et al.
Pubblicazione: (2024)
di: Zhao, Zilong, et al.
Pubblicazione: (2024)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
di: Jiang, Weisen, et al.
Pubblicazione: (2023)
di: Jiang, Weisen, et al.
Pubblicazione: (2023)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
di: Chung, Tsz Ting, et al.
Pubblicazione: (2025)
LogicTree: Structured Proof Exploration for Coherent and Rigorous Logical Reasoning with Large Language Models
di: He, Kang, et al.
Pubblicazione: (2025)
di: He, Kang, et al.
Pubblicazione: (2025)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
di: Yu, Erxin, et al.
Pubblicazione: (2025)
di: Yu, Erxin, et al.
Pubblicazione: (2025)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
di: Hua, Wenyue, et al.
Pubblicazione: (2024)
ProcessBench: Identifying Process Errors in Mathematical Reasoning
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?
di: Niyogi, Mitodru, et al.
Pubblicazione: (2024)
di: Niyogi, Mitodru, et al.
Pubblicazione: (2024)
Correlated Errors in Large Language Models
di: Kim, Elliot, et al.
Pubblicazione: (2025)
di: Kim, Elliot, et al.
Pubblicazione: (2025)
Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)
di: Daheim, Nico, et al.
Pubblicazione: (2024)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
di: Zhao, Xueliang, et al.
Pubblicazione: (2025)
Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
Evaluating Computational Accuracy of Large Language Models in Numerical Reasoning Tasks for Healthcare Applications
di: Malghan, Arjun R.
Pubblicazione: (2025)
di: Malghan, Arjun R.
Pubblicazione: (2025)
DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning
di: Karaman, Batuhan K., et al.
Pubblicazione: (2026)
di: Karaman, Batuhan K., et al.
Pubblicazione: (2026)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
di: Zeng, Liang, et al.
Pubblicazione: (2024)
di: Zeng, Liang, et al.
Pubblicazione: (2024)
CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
di: Chen, Zhuofan, et al.
Pubblicazione: (2025)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
di: Luo, Haipeng, et al.
Pubblicazione: (2023)
di: Luo, Haipeng, et al.
Pubblicazione: (2023)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
di: Luo, Haipeng, et al.
Pubblicazione: (2025)
CLadder: Assessing Causal Reasoning in Language Models
di: Jin, Zhijing, et al.
Pubblicazione: (2023)
di: Jin, Zhijing, et al.
Pubblicazione: (2023)
Evaluating Robustness of Reward Models for Mathematical Reasoning
di: Kim, Sunghwan, et al.
Pubblicazione: (2024)
di: Kim, Sunghwan, et al.
Pubblicazione: (2024)
Learning Mathematical Rules with Large Language Models
di: Gorceix, Antoine, et al.
Pubblicazione: (2024)
di: Gorceix, Antoine, et al.
Pubblicazione: (2024)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
di: Liu, Chengwu, et al.
Pubblicazione: (2025)
di: Liu, Chengwu, et al.
Pubblicazione: (2025)
A Careful Examination of Large Language Model Performance on Grade School Arithmetic
di: Zhang, Hugh, et al.
Pubblicazione: (2024)
di: Zhang, Hugh, et al.
Pubblicazione: (2024)
Large Language Models Are Better Logical Fallacy Reasoners with Counterargument, Explanation, and Goal-Aware Prompt Formulation
di: Jeong, Jiwon, et al.
Pubblicazione: (2025)
di: Jeong, Jiwon, et al.
Pubblicazione: (2025)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
di: Wu, Da, et al.
Pubblicazione: (2023)
di: Wu, Da, et al.
Pubblicazione: (2023)
Self-Training Elicits Concise Reasoning in Large Language Models
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
di: Munkhbat, Tergel, et al.
Pubblicazione: (2025)
Enhancing Zero-Shot Chain-of-Thought Reasoning in Large Language Models through Logic
di: Zhao, Xufeng, et al.
Pubblicazione: (2023)
di: Zhao, Xufeng, et al.
Pubblicazione: (2023)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
di: Park, Jinyoung, et al.
Pubblicazione: (2023)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
di: Yu, Ye, et al.
Pubblicazione: (2025)
di: Yu, Ye, et al.
Pubblicazione: (2025)
Language Models Do Hard Arithmetic Tasks Easily and Hardly Do Easy Arithmetic Tasks
di: Gambardella, Andrew, et al.
Pubblicazione: (2024)
di: Gambardella, Andrew, et al.
Pubblicazione: (2024)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
di: Shao, Zhihong, et al.
Pubblicazione: (2024)
di: Shao, Zhihong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning
di: Kim, Minwu, et al.
Pubblicazione: (2026) -
On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
di: Shrestha, Safal, et al.
Pubblicazione: (2026) -
Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
di: Kim, Minwu, et al.
Pubblicazione: (2025) -
Warm Up Before You Train: Unlocking General Reasoning in Resource-Constrained Settings
di: Shrestha, Safal, et al.
Pubblicazione: (2025) -
Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training
di: Nepal, Aadim, et al.
Pubblicazione: (2025)