Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Srivastava, Gaurav, Hussain, Aafiya, Srinivasan, Sriram, Wang, Xuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EffGen: Enabling Small Language Models as Capable Autonomous Agents
par: Srivastava, Gaurav, et autres
Publié: (2026)
par: Srivastava, Gaurav, et autres
Publié: (2026)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
par: Srivastava, Saurabh, et autres
Publié: (2025)
par: Srivastava, Saurabh, et autres
Publié: (2025)
SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
par: Hussain, Aafiya, et autres
Publié: (2026)
par: Hussain, Aafiya, et autres
Publié: (2026)
Towards Reasoning Ability of Small Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models
par: Pu, Xiao, et autres
Publié: (2025)
par: Pu, Xiao, et autres
Publié: (2025)
Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
par: Yadav, Anushka, et autres
Publié: (2025)
par: Yadav, Anushka, et autres
Publié: (2025)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
par: Bi, Zhenyu, et autres
Publié: (2025)
par: Bi, Zhenyu, et autres
Publié: (2025)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
par: Sui, Yang, et autres
Publié: (2025)
par: Sui, Yang, et autres
Publié: (2025)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025)
par: Xue, Boyang, et autres
Publié: (2025)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
par: Chen, Xingyu, et autres
Publié: (2024)
par: Chen, Xingyu, et autres
Publié: (2024)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
Benchmarking Large Language Models for Math Reasoning Tasks
par: Seßler, Kathrin, et autres
Publié: (2024)
par: Seßler, Kathrin, et autres
Publié: (2024)
SLIM-LLMs: Modeling of Style-Sensory Language RelationshipsThrough Low-Dimensional Representations
par: Khalid, Osama, et autres
Publié: (2025)
par: Khalid, Osama, et autres
Publié: (2025)
Think, But Don't Overthink: Reproducing Recursive Language Models
par: Wang, Daren
Publié: (2026)
par: Wang, Daren
Publié: (2026)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
par: Guan, Weixin, et autres
Publié: (2026)
par: Guan, Weixin, et autres
Publié: (2026)
Mitigating Overthinking through Reasoning Shaping
par: Song, Feifan, et autres
Publié: (2025)
par: Song, Feifan, et autres
Publié: (2025)
Reasoning or Overthinking: Evaluating Large Language Models on Financial Sentiment Analysis
par: Vamvourellis, Dimitris, et autres
Publié: (2025)
par: Vamvourellis, Dimitris, et autres
Publié: (2025)
Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
par: Su, Jinyan, et autres
Publié: (2025)
par: Su, Jinyan, et autres
Publié: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
par: Sun, Haoxiang, et autres
Publié: (2025)
par: Sun, Haoxiang, et autres
Publié: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
par: Ying, Huaiyuan, et autres
Publié: (2024)
par: Ying, Huaiyuan, et autres
Publié: (2024)
BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
par: Diao, Xingjian, et autres
Publié: (2026)
par: Diao, Xingjian, et autres
Publié: (2026)
Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs
par: Rahman, Amirul, et autres
Publié: (2026)
par: Rahman, Amirul, et autres
Publié: (2026)
Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking
par: Zhang, Xinliang Frederick, et autres
Publié: (2025)
par: Zhang, Xinliang Frederick, et autres
Publié: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
SafeMath: Inference-time Safety improves Math Accuracy
par: Basu, Sagnik, et autres
Publié: (2026)
par: Basu, Sagnik, et autres
Publié: (2026)
Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking
par: Han, Jinyi, et autres
Publié: (2025)
par: Han, Jinyi, et autres
Publié: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
par: Zhao, Yilun, et autres
Publié: (2023)
par: Zhao, Yilun, et autres
Publié: (2023)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
par: Tian, Shi-Yu, et autres
Publié: (2025)
par: Tian, Shi-Yu, et autres
Publié: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
par: Huang, Yao, et autres
Publié: (2025)
par: Huang, Yao, et autres
Publié: (2025)
Simpson's Paradox and the Accuracy-Fluency Tradeoff in Translation
par: Lim, Zheng Wei, et autres
Publié: (2024)
par: Lim, Zheng Wei, et autres
Publié: (2024)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
par: Wang, Qianyue, et autres
Publié: (2026)
par: Wang, Qianyue, et autres
Publié: (2026)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
par: Dekoninck, Jasper, et autres
Publié: (2026)
par: Dekoninck, Jasper, et autres
Publié: (2026)
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math
par: Xu, Haoran, et autres
Publié: (2025)
par: Xu, Haoran, et autres
Publié: (2025)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
par: Guan, Xinyu, et autres
Publié: (2025)
par: Guan, Xinyu, et autres
Publié: (2025)
STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsing
par: Zou, Jiaru, et autres
Publié: (2024)
par: Zou, Jiaru, et autres
Publié: (2024)
Documents similaires
-
EffGen: Enabling Small Language Models as Capable Autonomous Agents
par: Srivastava, Gaurav, et autres
Publié: (2026) -
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025) -
Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
par: Srivastava, Saurabh, et autres
Publié: (2025) -
SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
par: Hussain, Aafiya, et autres
Publié: (2026) -
Towards Reasoning Ability of Small Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)