Evaluating Mathematical Reasoning Across Large Language Models: A Fine-Grained Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jahin, Afrar, Zidan, Arif Hassan, Zhang, Wei, Bao, Yu, Liu, Tianming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Permutation Randomization on Nonsmooth Nonconvex Optimization: A Theoretical and Experimental Study
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
HOME-3: High-Order Momentum Estimator with Third-Power Gradient for Convex and Smooth Nonconvex Optimization
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Quantum-Classical Hybrid Molecular Autoencoder for Advancing Classical Decoding
par: Jahin, Afrar, et autres
Publié: (2025)
par: Jahin, Afrar, et autres
Publié: (2025)
Fine-Grained Uncertainty Decomposition in Large Language Models: A Spectral Approach
par: Walha, Nassim, et autres
Publié: (2025)
par: Walha, Nassim, et autres
Publié: (2025)
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
par: Jiang, Weisen, et autres
Publié: (2023)
par: Jiang, Weisen, et autres
Publié: (2023)
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
par: Zidan, Arif Hassan, et autres
Publié: (2026)
par: Zidan, Arif Hassan, et autres
Publié: (2026)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
par: Lu, Haoran, et autres
Publié: (2025)
par: Lu, Haoran, et autres
Publié: (2025)
FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
par: Yu, Zhouliang, et autres
Publié: (2025)
par: Yu, Zhouliang, et autres
Publié: (2025)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
par: Li, Ziheng, et autres
Publié: (2026)
par: Li, Ziheng, et autres
Publié: (2026)
Multilingual Financial Fraud Detection Using Machine Learning and Transformer Models: A Bangla-English Study
par: Uddin, Mohammad Shihab, et autres
Publié: (2026)
par: Uddin, Mohammad Shihab, et autres
Publié: (2026)
Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction
par: Li, Xiaoyuan, et autres
Publié: (2024)
par: Li, Xiaoyuan, et autres
Publié: (2024)
CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
par: Zan, Lei, et autres
Publié: (2025)
par: Zan, Lei, et autres
Publié: (2025)
From Task-Specific Models to Unified Systems: A Review of Model Merging Approaches
par: Ruan, Wei, et autres
Publié: (2025)
par: Ruan, Wei, et autres
Publié: (2025)
Fine-Grained Interpretation of Political Opinions in Large Language Models
par: Hu, Jingyu, et autres
Publié: (2025)
par: Hu, Jingyu, et autres
Publié: (2025)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
par: Kim, Gyuhak, et autres
Publié: (2025)
par: Kim, Gyuhak, et autres
Publié: (2025)
ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
par: Liu, Jincheng, et autres
Publié: (2025)
par: Liu, Jincheng, et autres
Publié: (2025)
A Natural Language Processing-Based Classification and Mode-Based Ranking of Musculoskeletal Disorder Risk Factors
par: Jahin, Md Abrar, et autres
Publié: (2023)
par: Jahin, Md Abrar, et autres
Publié: (2023)
CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities
par: Mao, Yujun, et autres
Publié: (2024)
par: Mao, Yujun, et autres
Publié: (2024)
Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning
par: Pawar, Pranav, et autres
Publié: (2025)
par: Pawar, Pranav, et autres
Publié: (2025)
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
par: Mirzadeh, Iman, et autres
Publié: (2024)
par: Mirzadeh, Iman, et autres
Publié: (2024)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
par: Weng, Zixuan, et autres
Publié: (2026)
par: Weng, Zixuan, et autres
Publié: (2026)
PromptCoT: Synthesizing Olympiad-level Problems for Mathematical Reasoning in Large Language Models
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
SFMP: Fine-Grained, Hardware-Friendly and Search-Free Mixed-Precision Quantization for Large Language Models
par: Nie, Xin, et autres
Publié: (2026)
par: Nie, Xin, et autres
Publié: (2026)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
par: Zhao, Zilong, et autres
Publié: (2024)
par: Zhao, Zilong, et autres
Publié: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024)
par: Zeng, Liang, et autres
Publié: (2024)
Revealing Fine-Grained Values and Opinions in Large Language Models
par: Wright, Dustin, et autres
Publié: (2024)
par: Wright, Dustin, et autres
Publié: (2024)
Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models
par: Fang, Zhengyu, et autres
Publié: (2026)
par: Fang, Zhengyu, et autres
Publié: (2026)
Fine-Grained Gradient Restriction: A Simple Approach for Mitigating Catastrophic Forgetting
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
par: Camposampiero, Giacomo, et autres
Publié: (2025)
par: Camposampiero, Giacomo, et autres
Publié: (2025)
Improve Mathematical Reasoning in Language Models by Automated Process Supervision
par: Luo, Liangchen, et autres
Publié: (2024)
par: Luo, Liangchen, et autres
Publié: (2024)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
Large Language Models: A Mathematical Formulation
par: Baptista, Ricardo, et autres
Publié: (2026)
par: Baptista, Ricardo, et autres
Publié: (2026)
PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
par: Yu, Ye, et autres
Publié: (2025)
par: Yu, Ye, et autres
Publié: (2025)
Fine-tuning Large Language Model for Automated Algorithm Design
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
Evaluating Robustness of Reward Models for Mathematical Reasoning
par: Kim, Sunghwan, et autres
Publié: (2024)
par: Kim, Sunghwan, et autres
Publié: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
A Dual Large Language Models Architecture with Herald Guided Prompts for Parallel Fine Grained Traffic Signal Control
par: Guo, Qing, et autres
Publié: (2025)
par: Guo, Qing, et autres
Publié: (2025)
GFlowNet Fine-tuning for Diverse Correct Solutions in Mathematical Reasoning Tasks
par: Takase, Ryoichi, et autres
Publié: (2024)
par: Takase, Ryoichi, et autres
Publié: (2024)
Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning
par: Cai, Hengrui, et autres
Publié: (2023)
par: Cai, Hengrui, et autres
Publié: (2023)
PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?
par: Niyogi, Mitodru, et autres
Publié: (2024)
par: Niyogi, Mitodru, et autres
Publié: (2024)
Documents similaires
-
Permutation Randomization on Nonsmooth Nonconvex Optimization: A Theoretical and Experimental Study
par: Zhang, Wei, et autres
Publié: (2025) -
HOME-3: High-Order Momentum Estimator with Third-Power Gradient for Convex and Smooth Nonconvex Optimization
par: Zhang, Wei, et autres
Publié: (2025) -
Quantum-Classical Hybrid Molecular Autoencoder for Advancing Classical Decoding
par: Jahin, Afrar, et autres
Publié: (2025) -
Fine-Grained Uncertainty Decomposition in Large Language Models: A Spectral Approach
par: Walha, Nassim, et autres
Publié: (2025) -
Forward-Backward Reasoning in Large Language Models for Mathematical Verification
par: Jiang, Weisen, et autres
Publié: (2023)