Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Srivastava, Gaurav, Hussain, Aafiya, Srinivasan, Sriram, Wang, Xuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EffGen: Enabling Small Language Models as Capable Autonomous Agents
di: Srivastava, Gaurav, et al.
Pubblicazione: (2026)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2026)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
di: Srivastava, Saurabh, et al.
Pubblicazione: (2025)
di: Srivastava, Saurabh, et al.
Pubblicazione: (2025)
SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
di: Hussain, Aafiya, et al.
Pubblicazione: (2026)
di: Hussain, Aafiya, et al.
Pubblicazione: (2026)
Towards Reasoning Ability of Small Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models
di: Pu, Xiao, et al.
Pubblicazione: (2025)
di: Pu, Xiao, et al.
Pubblicazione: (2025)
Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
di: Yadav, Anushka, et al.
Pubblicazione: (2025)
di: Yadav, Anushka, et al.
Pubblicazione: (2025)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)
DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
di: Yan, Kaiwen, et al.
Pubblicazione: (2025)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
di: Sui, Yang, et al.
Pubblicazione: (2025)
di: Sui, Yang, et al.
Pubblicazione: (2025)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2025)
di: Xue, Boyang, et al.
Pubblicazione: (2025)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
di: Chen, Xingyu, et al.
Pubblicazione: (2024)
MathHay: An Automated Benchmark for Long-Context Mathematical Reasoning in LLMs
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Benchmarking Large Language Models for Math Reasoning Tasks
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
di: Seßler, Kathrin, et al.
Pubblicazione: (2024)
SLIM-LLMs: Modeling of Style-Sensory Language RelationshipsThrough Low-Dimensional Representations
di: Khalid, Osama, et al.
Pubblicazione: (2025)
di: Khalid, Osama, et al.
Pubblicazione: (2025)
Think, But Don't Overthink: Reproducing Recursive Language Models
di: Wang, Daren
Pubblicazione: (2026)
di: Wang, Daren
Pubblicazione: (2026)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
di: Guan, Weixin, et al.
Pubblicazione: (2026)
di: Guan, Weixin, et al.
Pubblicazione: (2026)
Mitigating Overthinking through Reasoning Shaping
di: Song, Feifan, et al.
Pubblicazione: (2025)
di: Song, Feifan, et al.
Pubblicazione: (2025)
Reasoning or Overthinking: Evaluating Large Language Models on Financial Sentiment Analysis
di: Vamvourellis, Dimitris, et al.
Pubblicazione: (2025)
di: Vamvourellis, Dimitris, et al.
Pubblicazione: (2025)
Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
di: Su, Jinyan, et al.
Pubblicazione: (2025)
di: Su, Jinyan, et al.
Pubblicazione: (2025)
SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese
di: Xu, Liang, et al.
Pubblicazione: (2024)
di: Xu, Liang, et al.
Pubblicazione: (2024)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
di: Sun, Haoxiang, et al.
Pubblicazione: (2025)
di: Sun, Haoxiang, et al.
Pubblicazione: (2025)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs
di: Rahman, Amirul, et al.
Pubblicazione: (2026)
di: Rahman, Amirul, et al.
Pubblicazione: (2026)
Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking
di: Zhang, Xinliang Frederick, et al.
Pubblicazione: (2025)
di: Zhang, Xinliang Frederick, et al.
Pubblicazione: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
di: Huang, Kaixuan, et al.
Pubblicazione: (2025)
SafeMath: Inference-time Safety improves Math Accuracy
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
di: Basu, Sagnik, et al.
Pubblicazione: (2026)
Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking
di: Han, Jinyi, et al.
Pubblicazione: (2025)
di: Han, Jinyi, et al.
Pubblicazione: (2025)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
TabularMath: Understanding Math Reasoning over Tables with Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
di: Huang, Yao, et al.
Pubblicazione: (2025)
di: Huang, Yao, et al.
Pubblicazione: (2025)
Simpson's Paradox and the Accuracy-Fluency Tradeoff in Translation
di: Lim, Zheng Wei, et al.
Pubblicazione: (2024)
di: Lim, Zheng Wei, et al.
Pubblicazione: (2024)
Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning
di: Wang, Qianyue, et al.
Pubblicazione: (2026)
di: Wang, Qianyue, et al.
Pubblicazione: (2026)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math
di: Xu, Haoran, et al.
Pubblicazione: (2025)
di: Xu, Haoran, et al.
Pubblicazione: (2025)
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
di: Guan, Xinyu, et al.
Pubblicazione: (2025)
STEM-POM: Evaluating Language Models Math-Symbol Reasoning in Document Parsing
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
di: Zou, Jiaru, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EffGen: Enabling Small Language Models as Capable Autonomous Agents
di: Srivastava, Gaurav, et al.
Pubblicazione: (2026) -
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025) -
Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
di: Srivastava, Saurabh, et al.
Pubblicazione: (2025) -
SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
di: Hussain, Aafiya, et al.
Pubblicazione: (2026) -
Towards Reasoning Ability of Small Language Models
di: Srivastava, Gaurav, et al.
Pubblicazione: (2025)