Evaluating Mathematical Reasoning Beyond Accuracy
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Shijie, Li, Xuefeng, Liu, Yixin, Wu, Tongshuang, Liu, Pengfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LIMO: Less is More for Reasoning
di: Ye, Yixin, et al.
Pubblicazione: (2025)
di: Ye, Yixin, et al.
Pubblicazione: (2025)
Progress or Regress? Self-Improvement Reversal in Post-training
di: Wu, Ting, et al.
Pubblicazione: (2024)
di: Wu, Ting, et al.
Pubblicazione: (2024)
Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness
di: Zhao, Xinran, et al.
Pubblicazione: (2024)
di: Zhao, Xinran, et al.
Pubblicazione: (2024)
O1 Replication Journey: A Strategic Progress Report -- Part 1
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
SAFETY-J: Evaluating Safety with Critique
di: Liu, Yixiu, et al.
Pubblicazione: (2024)
di: Liu, Yixiu, et al.
Pubblicazione: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
ToRL: Scaling Tool-Integrated RL
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore
di: Yan, Zhichao, et al.
Pubblicazione: (2026)
di: Yan, Zhichao, et al.
Pubblicazione: (2026)
Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
di: Deng, Jie, et al.
Pubblicazione: (2026)
di: Deng, Jie, et al.
Pubblicazione: (2026)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
di: Wang, Zengzhi, et al.
Pubblicazione: (2023)
di: Wang, Zengzhi, et al.
Pubblicazione: (2023)
OlympicArena Medal Ranks: Who Is the Most Intelligent AI So Far?
di: Huang, Zhen, et al.
Pubblicazione: (2024)
di: Huang, Zhen, et al.
Pubblicazione: (2024)
Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning
di: Yang, Xia, et al.
Pubblicazione: (2026)
di: Yang, Xia, et al.
Pubblicazione: (2026)
Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
Understanding Reference Policies in Direct Preference Optimization
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs
di: Zhang, Jiaqiao, et al.
Pubblicazione: (2026)
di: Zhang, Jiaqiao, et al.
Pubblicazione: (2026)
FRoG: Evaluating Fuzzy Reasoning of Generalized Quantifiers in Large Language Models
di: Li, Yiyuan, et al.
Pubblicazione: (2024)
di: Li, Yiyuan, et al.
Pubblicazione: (2024)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
di: Mondorf, Philipp, et al.
Pubblicazione: (2024)
O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?
di: Huang, Zhen, et al.
Pubblicazione: (2024)
di: Huang, Zhen, et al.
Pubblicazione: (2024)
What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code
di: Zhao, Yuze, et al.
Pubblicazione: (2026)
di: Zhao, Yuze, et al.
Pubblicazione: (2026)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Generative AI Act II: Test Time Scaling Drives Cognition Engineering
di: Xia, Shijie, et al.
Pubblicazione: (2025)
di: Xia, Shijie, et al.
Pubblicazione: (2025)
DynaSolidGeo: A Dynamic Benchmark for Genuine Spatial Mathematical Reasoning of VLMs in Solid Geometry
di: Wu, Changti, et al.
Pubblicazione: (2025)
di: Wu, Changti, et al.
Pubblicazione: (2025)
PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
di: Liu, Wentao, et al.
Pubblicazione: (2024)
di: Liu, Wentao, et al.
Pubblicazione: (2024)
SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking
di: Huang, Weiyang, et al.
Pubblicazione: (2026)
di: Huang, Weiyang, et al.
Pubblicazione: (2026)
Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition
di: Ma, Jinlong, et al.
Pubblicazione: (2026)
di: Ma, Jinlong, et al.
Pubblicazione: (2026)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
di: Li, Yiyuan, et al.
Pubblicazione: (2026)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
di: Lu, Pan, et al.
Pubblicazione: (2023)
di: Lu, Pan, et al.
Pubblicazione: (2023)
Toward Automated Robustness Evaluation of Mathematical Reasoning
di: Hou, Yutao, et al.
Pubblicazione: (2025)
di: Hou, Yutao, et al.
Pubblicazione: (2025)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
di: Zhang, Zhihan, et al.
Pubblicazione: (2024)
di: Zhang, Zhihan, et al.
Pubblicazione: (2024)
OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
di: Wang, Zengzhi, et al.
Pubblicazione: (2025)
di: Wang, Zengzhi, et al.
Pubblicazione: (2025)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
di: Chang, Qikai, et al.
Pubblicazione: (2025)
di: Chang, Qikai, et al.
Pubblicazione: (2025)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
di: Dekoninck, Jasper, et al.
Pubblicazione: (2026)
RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems
di: Zeng, Yixiao, et al.
Pubblicazione: (2025)
di: Zeng, Yixiao, et al.
Pubblicazione: (2025)
Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning
di: Zhang, Lan, et al.
Pubblicazione: (2025)
di: Zhang, Lan, et al.
Pubblicazione: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions
di: Patil, Parth, et al.
Pubblicazione: (2026)
di: Patil, Parth, et al.
Pubblicazione: (2026)
Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
di: Li, Alan, et al.
Pubblicazione: (2025)
di: Li, Alan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LIMO: Less is More for Reasoning
di: Ye, Yixin, et al.
Pubblicazione: (2025) -
Progress or Regress? Self-Improvement Reversal in Post-training
di: Wu, Ting, et al.
Pubblicazione: (2024) -
Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness
di: Zhao, Xinran, et al.
Pubblicazione: (2024) -
O1 Replication Journey: A Strategic Progress Report -- Part 1
di: Qin, Yiwei, et al.
Pubblicazione: (2024) -
SAFETY-J: Evaluating Safety with Critique
di: Liu, Yixiu, et al.
Pubblicazione: (2024)