Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yuhong, Yin, Zhangyue, Huang, Xuanjing, Qiu, Xipeng, Zhao, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
Dynamic and Generalizable Process Reward Modeling
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
di: Xu, Ningyu, et al.
Pubblicazione: (2026)
di: Xu, Ningyu, et al.
Pubblicazione: (2026)
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
di: Yin, Zhangyue, et al.
Pubblicazione: (2024)
di: Yin, Zhangyue, et al.
Pubblicazione: (2024)
Scaling Laws for Fact Memorization of Large Language Models
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
di: Lu, Xingyu, et al.
Pubblicazione: (2024)
Elementary Math Word Problem Generation using Large Language Models
di: Ariyarathne, Nimesh, et al.
Pubblicazione: (2025)
di: Ariyarathne, Nimesh, et al.
Pubblicazione: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
di: Liu, Peiju, et al.
Pubblicazione: (2026)
di: Liu, Peiju, et al.
Pubblicazione: (2026)
Corex: Pushing the Boundaries of Complex Reasoning through Multi-Model Collaboration
di: Sun, Qiushi, et al.
Pubblicazione: (2023)
di: Sun, Qiushi, et al.
Pubblicazione: (2023)
Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
Logic Contrastive Reasoning with Lightweight Large Language Model for Math Word Problems
di: Kai, Ding, et al.
Pubblicazione: (2024)
di: Kai, Ding, et al.
Pubblicazione: (2024)
AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems
di: Wang, Weiyi, et al.
Pubblicazione: (2026)
di: Wang, Weiyi, et al.
Pubblicazione: (2026)
Adversarial Math Word Problem Generation
di: Xie, Roy, et al.
Pubblicazione: (2024)
di: Xie, Roy, et al.
Pubblicazione: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
di: Zhu, Qin, et al.
Pubblicazione: (2024)
di: Zhu, Qin, et al.
Pubblicazione: (2024)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
In-Memory Learning: A Declarative Learning Framework for Large Language Models
di: Wang, Bo, et al.
Pubblicazione: (2024)
di: Wang, Bo, et al.
Pubblicazione: (2024)
Template-Driven LLM-Paraphrased Framework for Tabular Math Word Problem Generation
di: Kang, Xiaoqiang, et al.
Pubblicazione: (2024)
di: Kang, Xiaoqiang, et al.
Pubblicazione: (2024)
VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
di: Yang, Jie, et al.
Pubblicazione: (2025)
di: Yang, Jie, et al.
Pubblicazione: (2025)
LLatrieval: LLM-Verified Retrieval for Verifiable Generation
di: Li, Xiaonan, et al.
Pubblicazione: (2023)
di: Li, Xiaonan, et al.
Pubblicazione: (2023)
Solving Math Word Problems via Cooperative Reasoning induced Language Models
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
di: Zhu, Xinyu, et al.
Pubblicazione: (2022)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
di: Zhu, Qin, et al.
Pubblicazione: (2025)
di: Zhu, Qin, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Bengali Math Word Problem Solving with Chain of Thought Reasoning
di: Paul, Bidyarthi, et al.
Pubblicazione: (2025)
di: Paul, Bidyarthi, et al.
Pubblicazione: (2025)
Ask-Before-Detection: Identifying and Mitigating Conformity Bias in LLM-Powered Error Detector for Math Word Problem Solutions
di: Li, Hang, et al.
Pubblicazione: (2024)
di: Li, Hang, et al.
Pubblicazione: (2024)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
From Large to Tiny: Distilling and Refining Mathematical Expertise for Math Word Problems with Weakly Supervision
di: Lin, Qingwen, et al.
Pubblicazione: (2024)
di: Lin, Qingwen, et al.
Pubblicazione: (2024)
Can LLMs Solve longer Math Word Problems Better?
di: Xu, Xin, et al.
Pubblicazione: (2024)
di: Xu, Xin, et al.
Pubblicazione: (2024)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Large Language Models Struggle with Unreasonability in Math Problems
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
di: Ma, Jingyuan, et al.
Pubblicazione: (2024)
Making Large Language Models Better Reasoners with Orchestrated Streaming Experiences
di: Liu, Xiangyang, et al.
Pubblicazione: (2025)
di: Liu, Xiangyang, et al.
Pubblicazione: (2025)
Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
di: Yang, Kaiqi, et al.
Pubblicazione: (2025)
di: Yang, Kaiqi, et al.
Pubblicazione: (2025)
MathLearner: A Large Language Model Agent Framework for Learning to Solve Mathematical Problems
di: Xie, Wenbei, et al.
Pubblicazione: (2024)
di: Xie, Wenbei, et al.
Pubblicazione: (2024)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
di: Cao, Yixin, et al.
Pubblicazione: (2025)
di: Cao, Yixin, et al.
Pubblicazione: (2025)
What Makes Math Word Problems Challenging for LLMs?
di: Srivatsa, KV Aditya, et al.
Pubblicazione: (2024)
di: Srivatsa, KV Aditya, et al.
Pubblicazione: (2024)
Expression Syntax Information Bottleneck for Math Word Problems
di: Xiong, Jing, et al.
Pubblicazione: (2023)
di: Xiong, Jing, et al.
Pubblicazione: (2023)
Self-consistent Reasoning For Solving Math Word Problems
di: Xiong, Jing, et al.
Pubblicazione: (2022)
di: Xiong, Jing, et al.
Pubblicazione: (2022)
A Diversity-Enhanced Knowledge Distillation Model for Practical Math Word Problem Solving
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline
di: Xu, Yifan, et al.
Pubblicazione: (2024)
di: Xu, Yifan, et al.
Pubblicazione: (2024)
Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
di: Azime, Israel Abebe, et al.
Pubblicazione: (2025)
di: Azime, Israel Abebe, et al.
Pubblicazione: (2025)
We Need Knowledge Distillation for Solving Math Word Problems
di: Shen, Zhenquan, et al.
Pubblicazione: (2025)
di: Shen, Zhenquan, et al.
Pubblicazione: (2025)
Structured Reasoning with Tree-of-Thoughts for Bengali Math Word Problems
di: Mahmood, Aurprita, et al.
Pubblicazione: (2025)
di: Mahmood, Aurprita, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
di: Sun, Yuhong, et al.
Pubblicazione: (2024) -
Dynamic and Generalizable Process Reward Modeling
di: Yin, Zhangyue, et al.
Pubblicazione: (2025) -
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
di: Xu, Ningyu, et al.
Pubblicazione: (2026) -
Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models
di: Yin, Zhangyue, et al.
Pubblicazione: (2024) -
Scaling Laws for Fact Memorization of Large Language Models
di: Lu, Xingyu, et al.
Pubblicazione: (2024)